토킹 헤드 영상 배경 음악: 목소리 아래에 까는 BGM
배경 음악은 목소리보다 충분히 작게 까세요. Sume 아바타 영상 프리뷰에는 볼륨 0.05~0.4의 사운드트랙을 넣을 수 있고, Timeline은 페이드와 더킹을 더합니다.

토킹 헤드 영상이나 UGC 스타일 영상의 배경 음악은 음성이 만들어진 다음에 섞어 목소리보다 충분히 작게 깔아야 모든 단어가 또렷하게 들립니다. Sume 아바타 영상에서는 아바타 영상 프리뷰로 배경 음악을 넣으세요. 프리뷰의 package.soundtrack은 텍스트 프롬프트로 음악을 생성하거나 링크한 트랙을 섞으며, volume은 0.05에서 0.4까지입니다(기본값 0.15). 이미 워크스페이스의 미디어에 있는 클립이라면 Timeline 1.0 사운드트랙으로 페이드아웃과 더킹을 더할 수 있습니다.
필드와 한도는 2026-09-27에 확인한 Sume API 레퍼런스, 아바타 영상 프리뷰, Timeline 1.0, Music 1.0 (영문)에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다.
Sume 토킹 헤드 영상에는 음악이 들어 있나요?
기본으로는 들어 있지 않습니다. 현재 코드에서 각 아바타 클립에 쓰이는 프롬프트는 음악을 넣지 않도록 요청하며, "No subtitles. No background music."이라는 문구가 들어 있습니다. 음악은 아바타 영상 프리뷰를 통해서든 나중에든 직접 추가하는 단계입니다.
아바타 영상 요청에서 음악은 어떻게 넣나요?
아바타 영상 프리뷰에 package.soundtrack을 넣은 다음, 프리뷰 id로 generate-video를 호출하세요. 프리뷰는 package를 저장해 두었다가 generate-video에서만 적용하며, 프리뷰 스틸에는 절대 먹싱되지 않습니다. POST /v1/avatar-1.0/talking-video에는 package를 보내지 마세요. 레퍼런스에는 나와 있지만, 현재 코드에서 이 라우트는 package를 400 invalid_request로 거부합니다. 프리뷰 흐름은 아바타 영상 프리뷰에서 다룹니다.
curl -X POST https://api.sume.com/v1/avatar-video-previews \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: host-intro-bgm-001" \
-d '{
"avatar_handle": "product_host",
"script": "Three things to know before you pick a travel mug.",
"package": {
"soundtrack": {
"prompt": "Warm lo-fi beat, soft Rhodes, 80 BPM. Instrumental, no vocals, no spoken word.",
"volume": 0.12
}
}
}'음악은 어디서 가져오나요?
soundtrack은 두 가지 소스 중 정확히 하나를 받습니다.
prompt(최대 5,000자): Sume가 Music 1.0으로 배경 음악을 생성하고, 영상 비용에 더해 Music 1.0 추정 비용을 예약합니다. Music 1.0 문서 (영문)에 따르면 Music 1.0은 단계적으로 은퇴하는 중이며 이제 모든 요청이 Music Router를 거쳐 처리됩니다. 문서는 프롬프트를 "Instrumental, no vocals."로 끝내고, 내레이션 아래에 깔 때는 "no spoken word"를 더하라고 권합니다.audio_url: 이미 공개 HTTPS URL에 있는 트랙입니다. Sume는 가능하면 트랙을 자체 미디어 저장소로 미러링한 뒤 섞으며, 음악 비용은 예약하지 않습니다. localhost와 사설 URL은 거부되며, 깨진 링크는generate-video단계에서야 발견되고 그때 소프트 실패합니다.
음악은 얼마나 크게 넣어야 하고, 더킹도 되나요?
volume은 말소리 아래에 깔리는 배경 음악의 선형 레벨로, 범위는 0.05~0.4이고 기본값은 0.15입니다. 기본값에서 시작해 귀로 들으며 조정하세요. package.soundtrack에서 레벨을 조절하는 필드는 이것뿐이며, 페이드나 더킹 필드는 없습니다. 누군가 말하는 동안 배경 음악이 작아지거나 끝에서 페이드아웃되어야 한다면 Timeline 1.0 렌더에서 섞으세요. 레퍼런스는 Timeline의 기본값 −16 dB를 "a bed level under a spine"(스파인 아래에 까는 배경 음악 레벨)이라고 부릅니다.
| 아바타 영상 사운드트랙 | Timeline 1.0 사운드트랙 | |
|---|---|---|
| 적용 대상 | 새 아바타 영상(프리뷰를 거쳐) | 이미 워크스페이스의 미디어에 있는 클립 |
| 음악 소스 | prompt 또는 공개 HTTPS audio_url | 워크스페이스 미디어의 url |
| 레벨 | volume 0.05–0.4, 기본값 0.15(선형) | gain_db −60~12, 기본값 −16 dB |
| 페이드아웃 | 필드 없음 | fade_out_seconds, 최대 10 |
| 더킹 | 필드 없음 | duck_db 0–20: 목소리가 나오는 동안 배경 음악에 적용할 목표 감쇠량 |
음악 단계가 실패하면 어떻게 되나요?
영상은 그래도 받습니다. 사운드트랙이나 먹싱 실패는 소프트 실패로 처리되며, 가장 마지막 단계까지 성공한 영상이 남습니다. 자막도 요청했고 자막이 성공했다면 자막을 넣은 버전, 아니라면 깨끗한 토킹 헤드입니다. GET /v1/avatar-videos/{id}는 package.soundtrack.status를 skipped, pending, ready, failed 중 하나로 알려 주며, 실패에는 soundtrack_unavailable이나 music_generation_failed 같은 public_reason이 붙습니다.
이미 있는 토킹 헤드 영상에 음악을 넣을 수 있나요?
영상이 이미 Sume에 있을 때만 가능합니다. Timeline 1.0은 이전 Sume Job의 출력처럼 워크스페이스의 media.sume.com 미디어만 받습니다. 그 렌더에서는 오디오 분리로 추출한 클립의 음성이 스파인이 되고, 클립이 화면을 채우며, 사운드트랙은 위의 필드들로 그 아래에 깔립니다. 이 렌더는 API로 영상에 배경 음악 넣기에서 단계별로 다룹니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- 토킹 헤드 영상 포맷: 화면 비율, 크기, 파일 형식
토킹 헤드 영상의 포맷은 재생되는 곳에 따라 세로, 16:9, 정사각형, 4:5로 정해집니다. Sume 아바타 영상은 다섯 가지 비율의 720p MP4로 나옵니다.
- 토킹 헤드 영상 API: 아바타 vs 립싱크 vs 모션 컨트롤
가진 입력으로 Sume 토킹 헤드 경로를 고르세요. 스크립트와 준비된 아바타, 직접 만든 오디오와 스틸, 또는 드라이빙 영상입니다. 제한과 초당 가격도 다룹니다.
- AI 아바타 언어: 아바타는 어떤 언어로 말할 수 있나요?
Sume의 Avatar 1.0 말하는 영상은 현재 영어로만 말합니다. 스페인어, 힌디어, 한국어라면 TTS 1.0으로 음성을 만든 뒤 립싱크하세요.
- Sume Avatar 1.0을 소개합니다
Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.
작성자 Sume