AI로 영상에 맞는 음악 만들기: 생성 후 편집본에 맞추기
AI로 영상에 맞는 음악을 만들려면 편집본을 음악 브리프로 설명하고, 영상의 스틸을 보내고, 영상 길이만큼 요청한 뒤 트랙을 영상에 맞추세요.

AI로 영상에 맞는 음악을 만들려면 영상을 짧은 음악 브리프로 설명하고(분위기, 템포, 악기, 에너지가 바뀌어야 하는 초), 대표 스틸을 이미지 입력으로 보내고, 영상과 비슷한 길이를 요청하세요. 그다음 트랙을 편집본에 맞춥니다. 루프하거나 잘라 내고, 페이드아웃하세요. Sume에서는 스틸을 image_url로 넣은 Music Router 요청 한 번에, 필요하면 트랙을 영상 아래에 까는 Timeline 1.0 렌더를 더하면 됩니다. Music Router는 영상이 아니라 텍스트 프롬프트와 이미지 한 장을 받으므로, 타이밍은 브리프에 담아야 합니다.
단계는 2026-09-27에 확인한 Sume의 Music 1.0 (영문), Music Router (영문), 영상 프레임, Timeline 1.0 문서에서 가져왔습니다. 이미 있는 트랙을 믹싱하려면 API로 영상에 배경 음악 넣기를 참고하세요.
음악 브리프에서 영상을 어떻게 설명하나요?
타이머를 켜고 편집본을 보면서 길이, 분위기, 에너지가 올라가거나 내려가야 하는 순간을 적어 두세요. 그 내용을 Sume 문서가 권하는 브리프에 옮깁니다. 감정, 장르, BPM으로 적은 템포, 조성, 질감을 붙인 악기 두 개에서 네 개, 타임스탬프로 짚은 순간 하나, 시대를 적고, 마지막을 “Instrumental, no vocals.”로 맺으세요.
0:28에 공개 장면이 있는 45초짜리 제품 영상이라면 이렇게 씁니다. “Optimistic, warm acoustic pop, 104 BPM, G major. Fingerpicked acoustic guitar, soft kick, claps, a glockenspiel hook. A sparse intro; the full beat drops in at 0:28 for the reveal and resolves on one sustained chord at 0:44. Modern, clean and bright. A 45-second track. Instrumental, no vocals.”
- “no spoken word”는 음악이 내레이션 아래에 깔릴 때만 추가하세요.
- 장면마다 소리가 달라야 한다면 장르군, 템포(최소 12 BPM 차이), 리드 악기를 바꾸세요. 브리프 예시는 AI 음악 프롬프트 예시에 더 있습니다.
영상의 프레임은 프롬프트와 함께 어떻게 보내나요?
대표 스틸 한 장을 공개 HTTPS 이미지인 image_url로 넘기세요. 문서의 프롬프트 가이드도 적절하다면 장면 스틸을 넘기라고 안내합니다. 이미지로 음악 만드는 AI에서 설명하듯, 이미지는 선택 사항이며 가격을 바꾸지 않습니다.
영상이 이미 Sume에 있다면 POST /v1/video-frames가 최대 300초 길이의 클립에서 지정한 초의 정확한 스틸을 내구성 있는 media.sume.com 이미지로 반환하며, 이 호출은 과금되지 않습니다. 자체 영상이라면 편집 도구에서 프레임을 내보내 공개 HTTPS URL에 호스팅하세요.
curl -X POST https://api.sume.com/v1/music-router/generate \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: launch-video-music-001" \
-d '{
"prompt": "Optimistic, warm acoustic pop, 104 BPM, G major. Fingerpicked acoustic guitar, soft kick, claps, a glockenspiel hook. A sparse intro; the full beat drops in at 0:28 for the reveal and resolves on one sustained chord at 0:44. Modern, clean and bright. A 45-second track. Instrumental, no vocals.",
"image_url": "https://media.sume.com/artifacts/artf_demo/frame-28s.jpg"
}'트랙 길이를 영상 길이에 어떻게 맞추나요?
프롬프트에서 길이를 요청하거나(“A 45-second track”) [0:00-0:15] Intro: … 같은 표시로 구간을 배치하세요. duration과 duration_seconds는 거부됩니다. 문서는 브리프의 세부 사항을 결과를 보장하는 설정값이 아니라 창작 방향이라고 설명하므로, 맞추기 전에 반환된 트랙의 길이를 확인하세요.
그다음 편집 도구에서 맞추거나, Sume에 있는 영상이라면 트랙을 soundtrack으로 넣은 Timeline 1.0 렌더에서 맞추세요. loop는 짧은 배경 음악을 스파인이 끝날 때까지 반복하고, fade_out_seconds(최대 10)는 마지막 몇 초 동안 배경 음악을 페이드아웃합니다. 출력 길이는 항상 audio.duration_seconds이므로 더 긴 트랙은 거기서 끝납니다. API로 영상에 배경 음악 넣기에서 설명하듯, 렌더의 소리는 audio 스파인에 그 배경 음악을 더한 것입니다.
| 내 영상 | 스틸 출처 | 트랙을 맞추는 방법 |
|---|---|---|
| Sume에 없음 | 직접 내보내 공개 HTTPS URL에 호스팅한 프레임 | 트랙을 내려받아 자체 도구에서 편집. Timeline 렌더는 Sume에 호스팅된 미디어만 받음. |
| Sume에 있음, 음악만 | POST /v1/video-frames | audio.mode: "silence"로 설정하고 트랙을 soundtrack으로 넣은 렌더. 배경 음악이 작게 깔리지 않도록 gain_db: 0 지정. |
| Sume에 있음, 음성 유지 | POST /v1/video-frames | 오디오 분리로 추출한 영상 자체의 오디오 트랙을 audio 스파인으로, 트랙을 soundtrack으로 넣은 렌더. 스파인에서 말소리가 나오는 동안 음악을 낮추는 duck_db(0–20) 지정. |
비용은 얼마이고, 할 수 없는 것은 무엇인가요?
API 요금 기준으로 음악 생성은 오디오 1건당 $0.125이고 Timeline 렌더 예약 금액은 출력 분당 $0.10이며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다. 렌더는 예약한 금액보다 많이 확정하지 않습니다. 음성 유지 행에 쓰는 오디오 분리는 Job당 과금되고, 영상 프레임은 과금되지 않습니다.
- 컷이나 비트에 맞춘 동기화는 없습니다. 요청에는 프롬프트와 이미지 한 장이 담기므로, 모든 타임스탬프는 브리프에서 나옵니다.
- 분위기가 맞는다는 보장은 없습니다. 문서는 생성된 오디오를 확인하라고 안내합니다.
- 렌더는 앞서 실행한 Sume Job의 출력처럼 이 워크스페이스의
media.sume.com파일만 받으므로, Sume 밖의 영상은 편집 도구에서 다뤄야 합니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- UGC 광고 훅 베리에이션: 훅만 바꾸고 본편은 재사용
UGC 광고 훅 베리에이션은 도입부만 바꿔 만드세요. 같은 본편 클립과 음성 위에 훅마다 Timeline 렌더를 하나씩 만들고, 먼저 무료로 검사합니다.
- 광고 영상은 몇 초가 적당한가요? 플랫폼별 영상 광고 길이
정답인 길이 하나는 없고, 플랫폼마다 자체 기준을 공개합니다. YouTube 범퍼 광고는 6초이고, Facebook은 15초 이하 인스트림 광고를 끝까지 재생합니다.
- AI 아바타 인플루언서 만드는 법: 얼굴 하나, 목소리 하나
AI 인플루언서는 재사용 가능한 얼굴과 목소리 하나입니다. Sume 아바타를 한 번 만들고, 영상과 보이스오버에는 handle을, 새 사진에는 스틸을 재사용하세요.
- AI로 설명 영상 만드는 방법: 두 가지 방식
AI로 설명 영상을 만들려면 대본을 비트로 나눈 뒤, 아바타가 진행하게 하거나 B-roll에 보이스오버를 입히세요. 더 긴 영상은 여러 파트를 이어 붙입니다.
작성자 Sume