AI 아바타 언어: 아바타는 어떤 언어로 말할 수 있나요?

Sume의 Avatar 1.0 말하는 영상은 현재 영어로만 말합니다. 스페인어, 힌디어, 한국어라면 TTS 1.0으로 음성을 만든 뒤 립싱크하세요.

읽는 시간 5분Sume
전체 글

AI 아바타가 어떤 언어로 말하는지는 음성을 만드는 방식에 달려 있습니다. 립싱크한 아바타는 오디오 트랙이 어떤 언어든 그 언어로 말하고, 영상과 함께 음성을 생성하는 아바타는 그 생성기가 허용하는 언어로만 말합니다. Sume에서 Avatar 1.0 말하는 영상은 현재 코드상 영어로만 말합니다. 스페인어, 힌디어, 한국어 등 다른 언어라면 TTS 1.0과 언어 코드로 음성을 생성한 다음, VEED Fabric 1.0으로 아바타를 그 음성에 립싱크하세요.

이 글의 내용은 2026-09-27에 확인한 Sume의 아바타 영상 생성과 Models 개요 (영문) 문서, 그리고 Sume API 레퍼런스의 TTS·Fabric 스키마에서 가져왔습니다. 영어 전용 규칙, 보이스(Voices)의 언어 목록, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다.

Sume 아바타 영상은 스페인어나 한국어로 말할 수 있나요?

호출 한 번으로 만드는 말하는 영상으로는 할 수 없습니다.현재 코드에서 Avatar 1.0의 대사 클립마다 쓰이는 프롬프트에는 "Spoken language: English only."라고 적혀 있고 정확한 영어 대사를 요구합니다. Sume 호스팅 MCP의 안내도 대본이 영어여야 한다고 말하며, 각 아바타 자체의 음성도 영어로 클론됩니다. POST /v1/avatar-1.0/talking-video에는 언어 필드가 없으므로 영어 대본만 보내세요.

아바타가 다른 언어로 말하게 하려면 어떻게 하나요?

먼저 음성을 만든 다음, 그 위에 얼굴을 입히세요.

  • 대사를 목표 언어로 쓰세요. TTS는 보낸 transcript를 그대로 읽으므로, 영상 보이스오버 번역하기에서처럼 번역은 직접 맡아야 하는 단계입니다.
  • POST /v1/tts-1.0/generate에 음성과 목표 언어 코드로 설정한 language를 담아 음성으로 만드세요. language를 생략하면 영어가 기본값입니다. 음성은 아바타 자체의 음성(avatar_handle)이나, 에셋 → 보이스(Assets → Voices)에서 그 언어용으로 만든 음성(voice.id)을 쓸 수 있습니다.
  • POST /v1/veed/fabric-1.0으로 아바타를 립싱크하세요. 아바타의 avatar_handle, TTS의 audio_url, 오디오의 duration_seconds를 보냅니다. Fabric에는 언어 필드가 없으며, 아바타의 아이덴티티 스틸을 오디오에 맞춰 움직입니다.
curl -X POST https://api.sume.com/v1/tts-1.0/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: avatar-es-line-001" \
  -d '{
    "transcript": "Hola, soy Ana. Hoy te muestro la nueva app en un minuto.",
    "avatar_handle": "product_host",
    "language": "es",
    "timestamps": { "words": true }
  }'

어떤 언어를 고를 수 있나요?

TTS 1.0은 요청마다 BCP-47 / ISO-639 코드 하나를 받으며, 문서에 나온 예시는 ko, ja, en입니다. 스키마에 전체 목록은 공개되어 있지 않으므로, 긴 대본을 보내기 전에 새 언어로 짧은 문장 하나를 합성해 들어 보세요. 현재 Sume 앱에서는 에셋 → 보이스에서 음성을 만들 때 16개 언어 중 하나로 태그를 붙입니다. 영어(en), 한국어(ko), 일본어(ja), 중국어(zh), 스페인어(es), 프랑스어(fr), 독일어(de), 포르투갈어(pt), 이탈리아어(it), 힌디어(hi), 네덜란드어(nl), 폴란드어(pl), 러시아어(ru), 스웨덴어(sv), 튀르키예어(tr), 타갈로그어(tl)입니다. 이 태그는 음성의 언어를 기록할 뿐, 언어마다 어떻게 들리는지를 보장하지는 않습니다.

아바타 영상 생성, Sume API 레퍼런스의 스키마, Sume의 현재 코드 기준, 2026-09-27 확인.
경로말하는 내용언어를 정하는 방식
Avatar 1.0 말하는 영상영어만(현재 코드 기준)언어 필드 없음. 대본은 영어여야 함
TTS 1.0보낸 대본을 고른 음성으로language: 요청당 BCP-47 / ISO-639 코드 하나
VEED Fabric 1.0입력한 오디오 파일언어 필드 없음
에셋 → 보이스(Sume 앱)클론하거나 생성한 음성만들 때 고르는 16개 언어 태그 중 하나

음성과 언어가 맞지 않으면 어떻게 되나요?

현재 코드에서 TTS는 Voices 라이브러리 음성의 언어 태그를 요청 언어와 비교합니다. 둘이 다르면 같은 요청을 confirm_language_mismatch: true와 함께 다시 보낼 때까지 제출이 409 tts_voice_language_mismatch로 멈추며, 이때는 Job도 요금도 생기기 전입니다. 이 재확인 절차는 API로 영상 보이스오버 번역하기에서 단계별로 다룹니다.

어떤 제한이 있나요?

  • TTS 요청 하나에는 language가 하나만 들어가므로, 언어가 바뀌는 대본은 언어마다 요청을 하나씩 보내세요.
  • TTS는 요청당 최대 20,000자를 받습니다. Fabric은 Sume에 호스팅된 1–300초 오디오를 받으며, 파일은 최대 10 MB입니다.
  • Fabric은 아바타의 아이덴티티 스틸에서 시작하므로, Avatar 1.0 요청에 있던 장면과 제품은 이어지지 않습니다.
  • 화면에 나오는 텍스트는 별도의 자막 Job입니다. POST /v1/video-captions는 language 힌트를 받고, 문서에 나온 스타일은 라틴 서체나 한글 서체로 그리며, 한국어에는 한글 스타일이 필요합니다(한국어 자막).
  • TTS는 1,000자당 $0.0475, Fabric은 오디오 초당(720p) $0.1875이며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다.

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume