AI 립싱크 번역: 아바타 영상을 더빙하는 방법

Sume는 기존 영상의 입 모양을 다시 맞추지 못합니다. 아바타 영상을 더빙하려면 대본을 번역하고, TTS 1.0으로 읽힌 뒤, Fabric으로 얼굴을 립싱크하세요.

읽는 시간 5분Sume
전체 글

AI 립싱크 번역, 곧 더빙은 영상의 음성을 번역된 음성으로 바꾸고 새 대사에 맞춰 입을 움직이는 작업입니다. Sume는 원본 영상을 편집하지 않고 새로 생성하는 방식으로 이를 처리합니다. Sume의 립싱크는 스틸 이미지나 아바타를 새 오디오에 맞춰 움직이기 때문입니다. 따라서 대본을 번역하고, TTS 1.0으로 목표 언어 음성을 만든 뒤, VEED Fabric 1.0으로 같은 얼굴을 그 음성에 립싱크하세요.

이 글의 내용은 2026-09-27에 확인한 Sume의 Models 개요 (영문), Timeline 1.0, 영상 프레임 문서와 Sume API 레퍼런스의 TTS·립싱크 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 입 움직임을 새로 만들지 않고 음성만 바꾸려면 API로 영상 보이스오버 번역하기를 참고하세요.

이미 있는 영상의 입 모양을 Sume가 다시 맞출 수 있나요?

할 수 없습니다. 두 립싱크 엔드포인트인 VEED Fabric 1.0과 MiniMax H3 Max Lip Sync는 스틸 하나(image_url)나 준비된 아바타, 그리고 Sume에 호스팅된 오디오를 받으며, 둘 다 영상은 받지 않습니다. Avatar 1.0도 말하는 영상을 새 언어로 다시 렌더링할 수 없습니다. 현재 코드에서 클립 프롬프트가 영어 음성만 허용하기 때문입니다. 더빙한 버전은 같은 얼굴로 만든 새 클립입니다.

아바타 영상은 어떤 단계로 더빙하나요?

  • 대사를 준비하세요. Sume로 만든 영상이라면 대본이 이미 있습니다. 이미 media.sume.com에 있는 클립이라면 보이스오버 가이드에서 타이밍과 함께 전사하는 방법을 볼 수 있습니다.
  • 대사를 직접 번역하거나 에이전트 실행으로 번역하세요. TTS는 보낸 transcript를 그대로 읽습니다.
  • POST /v1/tts-1.0/generate로 번역문을 음성으로 만드세요. 음성, 목표 언어 코드로 설정한 language, 그리고 timestamps.words: true를 보내면 현재 코드가 오디오의 duration_seconds를 알려 줍니다.
  • POST /v1/veed/fabric-1.0으로 립싱크하세요. 같은 avatar_handle, TTS의 audio_url, 그리고 그 길이를 보냅니다. Job 하나는 최대 10 MB 파일에 담긴 1–300초 오디오를 받으며, 이는 Avatar 1.0 영상의 상한인 60초보다 깁니다.
  • 300초를 넘으면 음성을 나눠 립싱크하고, Timeline 1.0 렌더 한 번으로 전체 TTS 트랙 위에 클립들을 올리세요. 방법은 긴 영상용 AI 립싱크에 나와 있습니다.
curl -X POST https://api.sume.com/v1/veed/fabric-1.0 \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: dub-es-lipsync-001" \
  -d '{
    "avatar_handle": "product_host",
    "audio_url": "https://media.sume.com/artifacts/example/script-es.mp3",
    "duration_seconds": 41.2,
    "resolution": "720p"
  }'

더빙 클립은 어떤 얼굴에서 시작해야 하나요?

Fabric은 시각 소스를 정확히 하나만 받습니다.

  • avatar_handle 또는 avatar_id: Sume가 아바타의 아이덴티티 스틸을 찾아 씁니다. 그 아바타로 만든 영상을 더빙할 때 쓰세요.
  • image_url: 원본에서 뽑은 프레임 같은 공개 HTTPS 스틸이면 무엇이든 됩니다. media.sume.com에 있는 클립이라면 POST /v1/video-frames가 지정한 시각의 스틸을 계속 보관되는 이미지로 반환하며, 과금하지 않습니다.

원본과 비교해 무엇이 달라지나요?

  • 움직임. Fabric은 스틸 하나를 새 오디오에 맞춰 움직이므로, 원본의 제스처, 카메라 움직임, 제품 샷은 남지 않습니다.
  • 타이밍. 번역문은 원래 대사보다 길어지거나 짧아질 수 있으므로, 컷은 새 TTS 타이밍에 맞추세요.
  • 음성. 아바타 자체의 음성이나 목표 언어용으로 만든 Voices 라이브러리 음성을 쓰세요. 현재 코드에서 각 아바타 자체의 음성은 영어로 클론됩니다. 언어 규칙은 AI 아바타는 어떤 언어로 말할 수 있나요?에서 다룹니다.

더빙 버전의 비용은 얼마인가요?

각 단계는 따로 과금되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. Fabric은 오디오 길이를 초 단위로 올림해 세므로, 번역된 음성 60초를 720p로 립싱크하면 수수료 전 $11.25입니다.

Sume API 레퍼런스의 스키마, Timeline 1.0, API 요금 페이지를 만드는 코드 기준, 2026-09-27 확인.
단계호출가격한도
음성 합성POST /v1/tts-1.0/generate1,000자당 $0.0475최대 20,000자
립싱크POST /v1/veed/fabric-1.0오디오 초당(720p) $0.1875Sume에 호스팅된 1–300초 오디오, 최대 10 MB
이어 붙이기(300초를 넘을 때만)POST /v1/timeline-1.0/render출력 분당 $0.10출력 1–1,800초. 슬롯 1–200개. Sume에 호스팅된 URL

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume