긴 영상 AI 립싱크: 5분 클립 한도를 넘는 방법
AI로 긴 영상을 립싱크하려면 오디오를 나누고, 각 파트를 같은 얼굴에 립싱크한 뒤 클립을 이어 붙이세요. Sume Job 하나는 오디오를 최대 300초까지 받습니다.

AI로 긴 영상을 립싱크하려면 음성을 립싱크 Job 하나에 들어가는 크기의 파트로 나누고, 파트마다 같은 얼굴을 움직이게 한 뒤, 클립들을 전체 오디오 위에 다시 배치하세요. Sume에서 VEED Fabric 1.0 Job 하나는 최대 10 MB 파일에 담긴 최대 300초의 오디오를 받으며, Timeline 1.0 렌더 하나가 클립들을 최대 30분 길이의 영상으로 이어 붙입니다.
Sume 관련 사실은 2026-09-27에 확인한 타임라인 오디오와 Timeline 1.0 문서, 그리고 Sume API 레퍼런스의 Fabric과 TTS 요청 스키마에서 가져왔습니다. 300초 이하의 클립 하나라면 립싱크 API: 이미지와 오디오로 말하는 클립 만들기를 참고하세요.
립싱크 Job 하나는 왜 5분에서 멈추나요?
POST /v1/veed/fabric-1.0은 duration_seconds로 1에서 300까지 받고, audio_url은 Sume 미디어 호스트에 있는 최대 10 MB 파일이어야 합니다. WAV라면 바이트 상한에 먼저 걸립니다.
- 16비트 WAV는 채널당 샘플 하나에 2바이트를 저장합니다. 모노 기준으로 44.1 kHz에서는 초당 88,200바이트, 48 kHz에서는 96,000바이트입니다. 따라서 10 MB에 담기는 모노 WAV는 이 분이 채 안 되고, 스테레오는 그 절반입니다.
- TTS의 기본 MP3는 44.1 kHz, 128 kbps로 초당 16,000바이트이므로, 300초짜리 MP3는 5 MB 미만에 들어갑니다.
- 그래도 Sume의 타임라인 오디오 문서는 립싱크에 쓸 오디오라면 WAV를 유지하라고 안내합니다. MP3는 모든 경계에 프라이밍 패딩을 다시 붙이기 때문입니다. 현재 Sume의 TTS는 WAV를 모노로 쓰고, 타임라인 오디오는 각 파트를 48 kHz로 쓰며, Fabric은 상한을 넘는 파트를 제출 시점에
400 audio_too_large로 거부합니다. 그러니 파트는 약 100초 단위로 계획하세요.
음성은 어떻게 파트로 나누나요?
내레이션을 한 번에 만든 뒤, 타임라인 오디오로 말이 멈추는 지점에서 자르세요. split은 기본적으로 WAV를 유지하고, 결과의 segment마다 자체 audio_url이 생깁니다. 각 range는 { start, end } 형태이며, end가 없는 range는 파일 끝까지 이어집니다.
POST /v1/tts-1.0/generate로 스크립트 전체를 생성하고, 목소리는 준비된 아바타의avatar_handle로 고르세요.output_format: { "container": "wav", "encoding": "pcm_s16le", "sample_rate": 44100 }으로 WAV를,timestamps: { "words": true }로 단어별 타임스탬프를 요청하세요. 단어 타이밍을 보면 말이 멈추는 지점을 알 수 있습니다.- TTS 요청 하나는 최대 20,000자를 받으며, 1,200초보다 긴 오디오는
tts_duration_exceeded로 실패합니다. 그보다 길다면 파일을 여러 개 생성해 타임라인 오디오concat으로 이어 붙이세요. - 파일을
operation: "split"과 1–20개의ranges와 함께POST /v1/timeline-1.0/audio로 보내세요. 각 range는 말이 멈추는 지점에서 끝나고 바이트 상한보다 작아야 합니다.
curl -X POST https://api.sume.com/v1/timeline-1.0/audio \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: talk-split-001" \
-d '{
"operation": "split",
"url": "https://media.sume.com/artifacts/artf_demo/talk.wav",
"ranges": [
{ "start": 0, "end": 98.6 },
{ "start": 98.6, "end": 196.9 },
{ "start": 196.9, "end": 294.2 },
{ "start": 294.2, "end": 391.5 }
]
}'파트마다 립싱크하고 클립을 이어 붙이려면 어떻게 하나요?
모든 파트를 같은 얼굴에 립싱크한 다음, 나누지 않은 원본 파일 위에 클립을 렌더링하세요.
- 각 파트의
audio_url을POST /v1/veed/fabric-1.0으로 보내세요.duration_seconds에는 측정한 파트 길이를 넣고, 시각 소스는 매번 같은 것을 씁니다.image_url스틸 하나 또는 준비된 아바타 하나의avatar_handle이며, 둘을 함께 쓸 수는 없습니다. POST /v1/timeline-1.0/render로 한 번 렌더링하세요. 전체 WAV를audio.url로, 그 길이를audio.duration_seconds로 두고, 클립마다video[]슬롯을 하나씩 두어start에는 파트 range의 시작 시점을,duration에는 파트 길이를 넣습니다.video[0].start는 0이어야 하고 이후 start 값은 계속 커져야 하며, 슬롯이 덮는 길이는 스파인보다 최대 0.5초까지 짧아도 됩니다.- Timeline은 기본적으로 1080×1920으로 렌더링합니다. 스틸이 세로가 아니라면
output.width와output.height를 스틸의 형태에 맞게 설정하세요. - 말이 멈추는 지점에서 자르세요. 그러면 이음새에서 얼굴이 달라지더라도 아무도 말하지 않는 순간에 일어납니다.
긴 립싱크 영상의 비용은 얼마인가요?
Fabric은 오디오 초 단위로, Job마다 올림해 과금됩니다. 요금은 오디오 초당(720p) $0.1875이며, 480p 요율은 API 요금에 있습니다. 10분짜리 강연은 오디오 600초로, 720p 기준 약 $112.50입니다. 내레이션은 1,000자당 $0.0475, split은 Job당 $0.01이고, 렌더는 출력 분당 $0.10로 나와 있습니다. 각 항목에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
어떤 제한이 있나요?
단계마다 상한이 따로 있고, 할 수 없는 일이 두 가지 있습니다.
- 오디오는 TTS 결과처럼 이미 Sume 미디어 호스트에 있어야 합니다. 에셋 업로드 라우트는 공개 API에 드러나 있지 않으므로, 로컬 녹음 파일을 바로 넣을 수는 없습니다.
- Fabric은 스틸 이미지나 아바타의 스틸을 움직일 뿐 영상 입력은 받지 않으므로, 이미 가진 영상 속 입 모양을 다시 맞출 수는 없습니다. 아바타 영상 더빙은 대신 스틸에서 영상을 다시 만듭니다.
| 단계 | 호출 | 한도 |
|---|---|---|
| 음성 | POST /v1/tts-1.0/generate | 최대 20,000자. 1,200초를 넘는 오디오는 실패. |
| 분할 | POST /v1/timeline-1.0/audio | Sume에 호스팅된 오디오의 range 1–20개. 생성 오디오 최대 1,800초. |
| 립싱크 | POST /v1/veed/fabric-1.0 | 1–300초. Sume에 호스팅된 최대 10 MB 오디오. 480p 또는 720p. |
| 이어 붙이기 | POST /v1/timeline-1.0/render | 오디오 1–1,800초, 슬롯 1–200개. |
출처
관련 글
미디어 도구 카테고리의 다른 글
- 영상을 정사각형으로 만드는 방법: 1:1로 자르거나 맞추기
영상을 정사각형으로 만들려면 가운데 1:1 영역을 잘라 내거나, 화면 전체를 정사각형 안에 넣고 검은 여백을 채우세요. Sume에서는 둘 다 FFmpeg 필터 Job 하나로 됩니다.
- 세로 영상을 가로로 만드는 방법(9:16에서 16:9로)
세로 영상을 가로로 만들려면 9:16 클립을 16:9 프레임에 넣고 양옆을 블러 처리한 사본이나 검은 여백으로 채우세요. Sume로 하는 방법을 정리했습니다.
- 영상을 흑백으로 만드는 방법(또는 한 가지 색만 남기기)
FFmpeg의 hue나 eq 필터로 채도를 0으로 설정하면 영상이 흑백이 되고, colorhold를 쓰면 한 가지 색만 남길 수 있습니다. Sume에서 하는 방법을 정리했습니다.
- 해상도가 다른 영상 두 개를 합치는 방법
해상도가 다른 영상 두 개는 둘 다 한 프레임 크기로 스케일해 합칩니다. 클립마다 크롭, 여백, 블러, 늘이기 중 하나로 맞추고 소리와 함께 이어 붙이세요.
작성자 Sume