AI 아바타 감정 표현: 톤과 말하는 속도 설정하기

Avatar 1.0 말하는 영상에는 감정이나 속도 설정이 없습니다. TTS 1.0 음성에 감정, 속도, 볼륨을 설정한 뒤 Fabric으로 아바타를 립싱크하세요.

읽는 시간 5분Sume
전체 글

AI 아바타에 감정을 입히려면 목소리를 연출하세요. 얼굴을 립싱크하면 톤, 속도, 소리 크기는 음성이 전달합니다. Sume에서 Avatar 1.0 말하는 영상에는 감정, 속도, 발음 설정이 없습니다. 대신 TTS 1.0으로 아바타 자체의 목소리를 써서 emotion 가이드, 0.6에서 1.5 사이의 speed, volume을 지정해 대사를 음성으로 만든 다음, VEED Fabric 1.0으로 아바타를 그 오디오에 립싱크하세요.

이 글의 내용은 2026-09-27에 확인한 Sume의 Models 개요 (영문)와 아바타 영상 생성 문서, 그리고 Sume API 레퍼런스의 TTS·Fabric 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. TTS의 모든 필드는 텍스트 음성 변환 API 가이드에서 다룹니다.

Avatar 1.0 말하는 영상에 감정이나 속도를 설정할 수 있나요?

할 수 없습니다. 현재 코드에서 POST /v1/avatar-1.0/talking-video는 avatar_handle, script부터 quality, aspect_ratio까지 목록에 있는 필드만 받으며, 그 밖의 필드는 400과 함께 "… is not supported in this launch API contract."라는 메시지로 실패합니다.

말하는 방식은 생성 과정에서 정해집니다. 현재 코드에서는 모든 클립의 프롬프트가 표정 변화와 작은 손동작을 포함한 똑같은 자연스러운 말하기 동작을 요구하며, 감정을 고를 수 있는 필드는 없습니다.

아바타 목소리를 신나게, 차분하게, 또는 더 느리게 하려면 어떻게 하나요?

음성을 별도 단계로 분리하세요.

  • POST /v1/tts-1.0/generate와 아바타의 avatar_handle로 대사를 음성으로 만드세요. 아바타의 voice.status가 ready가 되면 TTS가 그 아바타에 이미 있는 음성을 찾아 씁니다.
  • speed, volume, emotion 가이드를 담은 generation_config를 추가하세요.
  • POST /v1/veed/fabric-1.0으로 립싱크하세요. 같은 avatar_handle, TTS의 audio_url, 오디오의 duration_seconds를 보냅니다. TTS 요청에 timestamps.words: true를 넣으면 현재 코드가 audio_url 옆에 그 길이를 알려 줍니다.
curl -X POST https://api.sume.com/v1/tts-1.0/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: calm-line-001" \
  -d '{
    "transcript": "Take a breath. Setup takes about two minutes, and you can pause anytime.",
    "avatar_handle": "product_host",
    "language": "en",
    "generation_config": { "speed": 0.85, "volume": 1.1 },
    "timestamps": { "words": true }
  }'

말하는 방식은 어떤 설정으로 조절할 수 있나요?

이 설정은 TTS 단계에만 있습니다. API 레퍼런스에 emotion이 받는 값이 나와 있지 않으므로, 긴 대본 전에 짧은 문장으로 값을 테스트하세요. 예전의 최상위 speed enum(slow, normal, fast)은 지원 중단되었으니 generation_config.speed를 쓰세요.

Sume API 레퍼런스의 TTS 스키마, 아바타 영상 생성, Sume의 현재 코드 기준, 2026-09-27 확인.
설정Avatar 1.0 말하는 영상TTS 1.0 다음 Fabric
말하는 속도없음generation_config.speed, 0.6에서 1.5 사이의 배수
볼륨없음generation_config.volume, 0.5에서 2.0 사이의 배수
감정없음. 생성 과정에서 자연스러운 표정 변화가 더해짐generation_config.emotion, 1–64자의 가이드
발음없음pronunciation_dict_id, 선택적 사전 ID
음성아바타 자체의 음성avatar_handle로 지정한 아바타의 음성 또는 voice.id

아바타의 얼굴에도 감정이 드러나나요?

Sume 문서에는 나와 있지 않습니다. Fabric 요청에는 표정이나 감정 필드가 없고, Fabric은 오디오를 바탕으로 스틸을 움직이므로, 원하는 감정은 TTS 대사에 담아야 합니다.

Fabric의 speed_tier 필드는 아바타가 말하는 속도가 아니라 처리 큐를 고르며, 값은 standard(기본값) 또는 fast입니다. 말하는 속도는 TTS에서 정합니다.

어떤 제한이 있나요?

  • TTS에는 아바타나 voice.id를 보내고, 둘을 함께 보낼 때는 서로 일치해야 합니다. 일치하지 않으면 400으로 실패합니다.
  • Fabric은 아바타의 아이덴티티 스틸에서 시작하므로, Avatar 1.0 요청에 있던 장면과 제품은 이어지지 않습니다.
  • TTS는 요청당 최대 20,000자를 받습니다. Fabric은 Sume에 호스팅된 1–300초 오디오를 받으며, 파일은 최대 10 MB입니다.
  • TTS는 1,000자당 $0.0475, Fabric은 오디오 초당(720p) $0.1875이며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다.
  • 기본 말하는 방식으로 충분한 영어 대사라면 말하는 아바타 영상 API로 호출 한 번이면 됩니다.

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume