AI 아바타 손동작: 아바타를 움직이거나 춤추게 하는 방법
Avatar 1.0 영상에는 제스처 설정이 없습니다. 손동작이나 춤 동작을 고르려면 모션 컨트롤로 최대 30초 길이의 클립을 써서 아바타를 움직이세요.
AI 아바타에 원하는 손동작이나 춤 동작을 넣으려면 그 동작을 담은 영상으로 아바타를 움직이세요. 모션 컨트롤 모델은 레퍼런스 클립의 움직임을 아바타의 스틸 이미지에 옮깁니다. Sume에서 Avatar 1.0 말하는 영상은 제스처나 포즈 설정을 받지 않으므로, 아바타의 handle과 최대 30초 길이의 드라이빙 클립을 Kling 3.0 Motion Control로 보내면 출력이 그 클립의 움직임과 길이를 따릅니다.
이 글의 내용은 2026-09-27에 확인한 Sume의 아바타 영상 생성, 영상 생성 (영문), 페이스 스왑 문서와 Sume API 레퍼런스의 모션 컨트롤 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 엔드포인트 전체는 모션 컨트롤 API 가이드에서 다룹니다.
Avatar 1.0 영상에는 손동작이 들어가나요?
생성 과정에서 더해지는 손동작만 들어갑니다. 현재 코드에서는 모든 클립의 프롬프트가 표정 변화, 눈 깜빡임, 입 움직임, 살짝 움직이는 고개, 편안한 어깨, 작은 손동작 같은 자연스러운 말하기 동작을 요구합니다. 이 동작은 고를 수 없습니다. POST /v1/avatar-1.0/talking-video에는 제스처, 포즈, 모션 필드가 없으며, 목록에 없는 필드는 400으로 실패합니다("… is not supported in this launch API contract.").
아바타가 특정 제스처를 하게 하려면 어떻게 하나요?
- 그 제스처를 담은 최대 30초 길이의 드라이빙 클립을 녹화하거나 고르고, 가져올 수 있는 공개 HTTPS URL에 두세요.
- 아바타의
avatar_handle,motion_video_url에 넣은 클립,duration_seconds에 넣은 클립 길이(1–30)를 담아POST /v1/kling/3.0/motion-control을 보내세요. prompt에 제스처를 설명하지 마세요. 움직임과 프레이밍은 드라이빙 영상을 따르고, 프롬프트는 외형 세부만 조정합니다.- 아바타 스틸의 프레이밍을 유지하려면
character_orientation을image로 설정하세요. 기본값인video는 클립의 프레이밍을 유지합니다. - 드라이빙 영상 길이를 초 단위로 올림해 과금하며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 현재 요율은
GET /v1/catalog에 나와 있습니다.
curl -X POST https://api.sume.com/v1/kling/3.0/motion-control \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: avatar-gestures-001" \
-d '{
"avatar_handle": "product_host",
"motion_video_url": "https://example.com/gestures.mp4",
"duration_seconds": 8,
"keep_original_sound": false,
"character_orientation": "image"
}'AI 아바타가 춤추게 하려면 어떻게 하나요?
댄스 클립을 드라이빙 영상으로 쓰세요. 출력 길이는 드라이빙 영상을 따르므로, Job 하나로 최대 30초의 춤을 만들 수 있습니다. keep_original_sound: false로 설정하지 않으면 클립 자체의 오디오 트랙이 출력에 남으며, 이 값을 설정하면 무음 클립이 반환됩니다.
레퍼런스 클립이 없다면 동작을 글로 설명하세요. POST /v1/videos에서 Sume에 호스팅된 공개 이미지인 아바타의 preview_image_url을 frame_images의 first_frame으로 넘기고, 춤은 prompt에 적으세요. 그러면 움직임은 텍스트에서 나옵니다. 각 모델은 받는 프레임 유형을 supported_frame_images에 나열하며, 요청 예시는 이미지로 영상 만들기 가이드에 있습니다.
아바타가 말하면서 동시에 제스처를 할 수 있나요?
문서화된 호출 한 번으로는 원하는 제스처를 넣어 말하게 할 수 없습니다. Avatar 1.0은 생성 과정에서 더해지는 작은 제스처만 곁들여 말합니다. 모션 컨트롤 요청은 움직임, 프레이밍, 클립 소리 유지 여부를 다루지만 대본이나 음성 오디오 입력은 없습니다. VEED Fabric 1.0은 스틸을 오디오에 립싱크하지만 모션 입력은 받지 않습니다.
직접 촬영한 영상에 아바타의 얼굴을 입히는 페이스 스왑은 베타입니다. 준비된 아바타의 얼굴을 짧은 공개 소스 영상에 입히며, 문서는 현재 사용할 만한 오디오가 있는 약 4–15초 길이의 소스를 계획하고 있습니다. Avatar Face Swap API(베타)를 참고하세요.
아바타는 어떤 방법으로 움직여야 하나요?
움직임을 어디서 가져올지에 따라 경로를 고르세요. 모션 컨트롤의 모든 필드와 예시 가격은 모션 컨트롤 API 가이드에 나와 있습니다.
| 경로 | 움직임의 출처 | 음성 | 길이 |
|---|---|---|---|
| Avatar 1.0 말하는 영상 | 생성: 작은 손동작이 섞인 자연스러운 말하기 동작 | 영어 대본을 말함 | 4–60초 |
| Kling 3.0 Motion Control | 드라이빙 클립 | 대본·음성 입력 없음. 기본적으로 클립의 소리 유지 | 클립을 따름, 최대 30초 |
이미지로 영상 만들기, POST /v1/videos | 아바타 스틸에서 시작하는 프롬프트 | 영상 모델은 TTS에 립싱크하지 않음 | 모델별 supported_durations |
| 페이스 스왑(베타) | 직접 촬영한 영상 | 소스에 사용할 만한 오디오 필요 | 약 4–15초 소스 |
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI로 나를 클론하는 방법: 내 얼굴과 내 목소리
AI로 나를 클론하려면 내 얼굴 사진과 내 목소리 클론을 짝지으세요. Sume에서는 목소리를 클론하고, TTS 1.0으로 말하게 한 뒤, Fabric으로 립싱크합니다.
- AI 립싱크 번역: 아바타 영상을 더빙하는 방법
Sume는 기존 영상의 입 모양을 다시 맞추지 못합니다. 아바타 영상을 더빙하려면 대본을 번역하고, TTS 1.0으로 읽힌 뒤, Fabric으로 얼굴을 립싱크하세요.
- 사진으로 영상 얼굴 바꾸기(페이스 스왑): 먼저 아바타 만들기
Sume의 Face Swap(베타)은 사진이 아니라 준비된 아바타를 받습니다. 먼저 사진으로 아바타를 만든 뒤, 4–15초 길이의 공개 영상에 그 얼굴을 입히세요.
- AI로 사진을 말하게 하는 방법: 음성 먼저, 그다음 립싱크
사진은 두 단계로 말하게 할 수 있습니다. 텍스트를 음성으로 바꾼 뒤, 그 오디오에 맞춰 사진을 립싱크하세요. Sume에서는 TTS 1.0 다음 VEED Fabric 1.0을 씁니다.
작성자 Sume