AI 립싱크 번역: 아바타 영상을 더빙하는 방법
Sume는 기존 영상의 입 모양을 다시 맞추지 못합니다. 아바타 영상을 더빙하려면 대본을 번역하고, TTS 1.0으로 읽힌 뒤, Fabric으로 얼굴을 립싱크하세요.
AI 립싱크 번역, 곧 더빙은 영상의 음성을 번역된 음성으로 바꾸고 새 대사에 맞춰 입을 움직이는 작업입니다. Sume는 원본 영상을 편집하지 않고 새로 생성하는 방식으로 이를 처리합니다. Sume의 립싱크는 스틸 이미지나 아바타를 새 오디오에 맞춰 움직이기 때문입니다. 따라서 대본을 번역하고, TTS 1.0으로 목표 언어 음성을 만든 뒤, VEED Fabric 1.0으로 같은 얼굴을 그 음성에 립싱크하세요.
이 글의 내용은 2026-09-27에 확인한 Sume의 Models 개요 (영문), Timeline 1.0, 영상 프레임 문서와 Sume API 레퍼런스의 TTS·립싱크 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 입 움직임을 새로 만들지 않고 음성만 바꾸려면 API로 영상 보이스오버 번역하기를 참고하세요.
이미 있는 영상의 입 모양을 Sume가 다시 맞출 수 있나요?
할 수 없습니다. 두 립싱크 엔드포인트인 VEED Fabric 1.0과 MiniMax H3 Max Lip Sync는 스틸 하나(image_url)나 준비된 아바타, 그리고 Sume에 호스팅된 오디오를 받으며, 둘 다 영상은 받지 않습니다. Avatar 1.0도 말하는 영상을 새 언어로 다시 렌더링할 수 없습니다. 현재 코드에서 클립 프롬프트가 영어 음성만 허용하기 때문입니다. 더빙한 버전은 같은 얼굴로 만든 새 클립입니다.
아바타 영상은 어떤 단계로 더빙하나요?
- 대사를 준비하세요. Sume로 만든 영상이라면 대본이 이미 있습니다. 이미
media.sume.com에 있는 클립이라면 보이스오버 가이드에서 타이밍과 함께 전사하는 방법을 볼 수 있습니다. - 대사를 직접 번역하거나 에이전트 실행으로 번역하세요. TTS는 보낸
transcript를 그대로 읽습니다. POST /v1/tts-1.0/generate로 번역문을 음성으로 만드세요. 음성, 목표 언어 코드로 설정한language, 그리고timestamps.words: true를 보내면 현재 코드가 오디오의duration_seconds를 알려 줍니다.POST /v1/veed/fabric-1.0으로 립싱크하세요. 같은avatar_handle, TTS의audio_url, 그리고 그 길이를 보냅니다. Job 하나는 최대 10 MB 파일에 담긴 1–300초 오디오를 받으며, 이는 Avatar 1.0 영상의 상한인 60초보다 깁니다.- 300초를 넘으면 음성을 나눠 립싱크하고, Timeline 1.0 렌더 한 번으로 전체 TTS 트랙 위에 클립들을 올리세요. 방법은 긴 영상용 AI 립싱크에 나와 있습니다.
curl -X POST https://api.sume.com/v1/veed/fabric-1.0 \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: dub-es-lipsync-001" \
-d '{
"avatar_handle": "product_host",
"audio_url": "https://media.sume.com/artifacts/example/script-es.mp3",
"duration_seconds": 41.2,
"resolution": "720p"
}'더빙 클립은 어떤 얼굴에서 시작해야 하나요?
Fabric은 시각 소스를 정확히 하나만 받습니다.
avatar_handle또는avatar_id: Sume가 아바타의 아이덴티티 스틸을 찾아 씁니다. 그 아바타로 만든 영상을 더빙할 때 쓰세요.image_url: 원본에서 뽑은 프레임 같은 공개 HTTPS 스틸이면 무엇이든 됩니다.media.sume.com에 있는 클립이라면POST /v1/video-frames가 지정한 시각의 스틸을 계속 보관되는 이미지로 반환하며, 과금하지 않습니다.
원본과 비교해 무엇이 달라지나요?
- 움직임. Fabric은 스틸 하나를 새 오디오에 맞춰 움직이므로, 원본의 제스처, 카메라 움직임, 제품 샷은 남지 않습니다.
- 타이밍. 번역문은 원래 대사보다 길어지거나 짧아질 수 있으므로, 컷은 새 TTS 타이밍에 맞추세요.
- 음성. 아바타 자체의 음성이나 목표 언어용으로 만든 Voices 라이브러리 음성을 쓰세요. 현재 코드에서 각 아바타 자체의 음성은 영어로 클론됩니다. 언어 규칙은 AI 아바타는 어떤 언어로 말할 수 있나요?에서 다룹니다.
더빙 버전의 비용은 얼마인가요?
각 단계는 따로 과금되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. Fabric은 오디오 길이를 초 단위로 올림해 세므로, 번역된 음성 60초를 720p로 립싱크하면 수수료 전 $11.25입니다.
| 단계 | 호출 | 가격 | 한도 |
|---|---|---|---|
| 음성 합성 | POST /v1/tts-1.0/generate | 1,000자당 $0.0475 | 최대 20,000자 |
| 립싱크 | POST /v1/veed/fabric-1.0 | 오디오 초당(720p) $0.1875 | Sume에 호스팅된 1–300초 오디오, 최대 10 MB |
| 이어 붙이기(300초를 넘을 때만) | POST /v1/timeline-1.0/render | 출력 분당 $0.10 | 출력 1–1,800초. 슬롯 1–200개. Sume에 호스팅된 URL |
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- 사진으로 영상 얼굴 바꾸기(페이스 스왑): 먼저 아바타 만들기
Sume의 Face Swap(베타)은 사진이 아니라 준비된 아바타를 받습니다. 먼저 사진으로 아바타를 만든 뒤, 4–15초 길이의 공개 영상에 그 얼굴을 입히세요.
- AI로 사진을 말하게 하는 방법: 음성 먼저, 그다음 립싱크
사진은 두 단계로 말하게 할 수 있습니다. 텍스트를 음성으로 바꾼 뒤, 그 오디오에 맞춰 사진을 립싱크하세요. Sume에서는 TTS 1.0 다음 VEED Fabric 1.0을 씁니다.
- 부동산 중개사 AI 영상: 모든 매물에 아바타 하나로
부동산 중개사는 촬영 없이 AI 영상을 만들 수 있습니다. 사진으로 아바타를 한 번 만든 뒤, 매물 사진을 장면으로 삼아 영상마다 스크립트를 쓰세요.
- AI 아바타 스크립트: 60초에 몇 단어가 들어가나요?
AI 아바타 스크립트는 아바타가 말하는 대사입니다. 현재 Sume의 추정기는 초당 2.8단어로 세므로, 60초에는 약 165단어가 들어갑니다.
작성자 Sume