AI 아바타 감정 표현: 톤과 말하는 속도 설정하기
Avatar 1.0 말하는 영상에는 감정이나 속도 설정이 없습니다. TTS 1.0 음성에 감정, 속도, 볼륨을 설정한 뒤 Fabric으로 아바타를 립싱크하세요.
AI 아바타에 감정을 입히려면 목소리를 연출하세요. 얼굴을 립싱크하면 톤, 속도, 소리 크기는 음성이 전달합니다. Sume에서 Avatar 1.0 말하는 영상에는 감정, 속도, 발음 설정이 없습니다. 대신 TTS 1.0으로 아바타 자체의 목소리를 써서 emotion 가이드, 0.6에서 1.5 사이의 speed, volume을 지정해 대사를 음성으로 만든 다음, VEED Fabric 1.0으로 아바타를 그 오디오에 립싱크하세요.
이 글의 내용은 2026-09-27에 확인한 Sume의 Models 개요 (영문)와 아바타 영상 생성 문서, 그리고 Sume API 레퍼런스의 TTS·Fabric 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. TTS의 모든 필드는 텍스트 음성 변환 API 가이드에서 다룹니다.
Avatar 1.0 말하는 영상에 감정이나 속도를 설정할 수 있나요?
할 수 없습니다. 현재 코드에서 POST /v1/avatar-1.0/talking-video는 avatar_handle, script부터 quality, aspect_ratio까지 목록에 있는 필드만 받으며, 그 밖의 필드는 400과 함께 "… is not supported in this launch API contract."라는 메시지로 실패합니다.
말하는 방식은 생성 과정에서 정해집니다. 현재 코드에서는 모든 클립의 프롬프트가 표정 변화와 작은 손동작을 포함한 똑같은 자연스러운 말하기 동작을 요구하며, 감정을 고를 수 있는 필드는 없습니다.
아바타 목소리를 신나게, 차분하게, 또는 더 느리게 하려면 어떻게 하나요?
음성을 별도 단계로 분리하세요.
POST /v1/tts-1.0/generate와 아바타의avatar_handle로 대사를 음성으로 만드세요. 아바타의voice.status가ready가 되면 TTS가 그 아바타에 이미 있는 음성을 찾아 씁니다.speed,volume,emotion가이드를 담은generation_config를 추가하세요.POST /v1/veed/fabric-1.0으로 립싱크하세요. 같은avatar_handle, TTS의audio_url, 오디오의duration_seconds를 보냅니다. TTS 요청에timestamps.words: true를 넣으면 현재 코드가audio_url옆에 그 길이를 알려 줍니다.
curl -X POST https://api.sume.com/v1/tts-1.0/generate \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: calm-line-001" \
-d '{
"transcript": "Take a breath. Setup takes about two minutes, and you can pause anytime.",
"avatar_handle": "product_host",
"language": "en",
"generation_config": { "speed": 0.85, "volume": 1.1 },
"timestamps": { "words": true }
}'말하는 방식은 어떤 설정으로 조절할 수 있나요?
이 설정은 TTS 단계에만 있습니다. API 레퍼런스에 emotion이 받는 값이 나와 있지 않으므로, 긴 대본 전에 짧은 문장으로 값을 테스트하세요. 예전의 최상위 speed enum(slow, normal, fast)은 지원 중단되었으니 generation_config.speed를 쓰세요.
| 설정 | Avatar 1.0 말하는 영상 | TTS 1.0 다음 Fabric |
|---|---|---|
| 말하는 속도 | 없음 | generation_config.speed, 0.6에서 1.5 사이의 배수 |
| 볼륨 | 없음 | generation_config.volume, 0.5에서 2.0 사이의 배수 |
| 감정 | 없음. 생성 과정에서 자연스러운 표정 변화가 더해짐 | generation_config.emotion, 1–64자의 가이드 |
| 발음 | 없음 | pronunciation_dict_id, 선택적 사전 ID |
| 음성 | 아바타 자체의 음성 | avatar_handle로 지정한 아바타의 음성 또는 voice.id |
아바타의 얼굴에도 감정이 드러나나요?
Sume 문서에는 나와 있지 않습니다. Fabric 요청에는 표정이나 감정 필드가 없고, Fabric은 오디오를 바탕으로 스틸을 움직이므로, 원하는 감정은 TTS 대사에 담아야 합니다.
Fabric의 speed_tier 필드는 아바타가 말하는 속도가 아니라 처리 큐를 고르며, 값은 standard(기본값) 또는 fast입니다. 말하는 속도는 TTS에서 정합니다.
어떤 제한이 있나요?
- TTS에는 아바타나
voice.id를 보내고, 둘을 함께 보낼 때는 서로 일치해야 합니다. 일치하지 않으면400으로 실패합니다. - Fabric은 아바타의 아이덴티티 스틸에서 시작하므로, Avatar 1.0 요청에 있던 장면과 제품은 이어지지 않습니다.
- TTS는 요청당 최대 20,000자를 받습니다. Fabric은 Sume에 호스팅된 1–300초 오디오를 받으며, 파일은 최대 10 MB입니다.
- TTS는 1,000자당 $0.0475, Fabric은 오디오 초당(720p) $0.1875이며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다.
- 기본 말하는 방식으로 충분한 영어 대사라면 말하는 아바타 영상 API로 호출 한 번이면 됩니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI로 나를 클론하는 방법: 내 얼굴과 내 목소리
AI로 나를 클론하려면 내 얼굴 사진과 내 목소리 클론을 짝지으세요. Sume에서는 목소리를 클론하고, TTS 1.0으로 말하게 한 뒤, Fabric으로 립싱크합니다.
- AI 립싱크 번역: 아바타 영상을 더빙하는 방법
Sume는 기존 영상의 입 모양을 다시 맞추지 못합니다. 아바타 영상을 더빙하려면 대본을 번역하고, TTS 1.0으로 읽힌 뒤, Fabric으로 얼굴을 립싱크하세요.
- 사진으로 영상 얼굴 바꾸기(페이스 스왑): 먼저 아바타 만들기
Sume의 Face Swap(베타)은 사진이 아니라 준비된 아바타를 받습니다. 먼저 사진으로 아바타를 만든 뒤, 4–15초 길이의 공개 영상에 그 얼굴을 입히세요.
- AI로 사진을 말하게 하는 방법: 음성 먼저, 그다음 립싱크
사진은 두 단계로 말하게 할 수 있습니다. 텍스트를 음성으로 바꾼 뒤, 그 오디오에 맞춰 사진을 립싱크하세요. Sume에서는 TTS 1.0 다음 VEED Fabric 1.0을 씁니다.
작성자 Sume