AI로 내 노래 뮤직비디오를 만들 수 있나요? 네, 클립 단위로
네, 곡에 맞춰 편집한 짧은 AI 클립들로 만들 수 있습니다. Sume에서 클립 하나는 최대 30초이므로 곡의 구간마다 샷을 하나씩 계획하세요.

네, AI로 내 노래 뮤직비디오에 쓸 영상을 만들 수 있지만, 생성 한 번으로 뮤직비디오 전체를 만들 수는 없습니다. 영상 모델은 한 번에 짧은 클립 하나를 만들며, 그 길이는 Sume에서 최대 30초, 대부분의 모델에서는 15초까지입니다. 그래서 곡 전체는 구간마다 하나 이상의 샷으로 나뉘고, 이 샷들을 곡 위에 이어 붙여 편집합니다.
아래 한도는 2026-09-27에 확인한 Sume의 영상 생성 (영문), Models (영문), Timeline 1.0 문서와 Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 API 코드에서 확인한 것입니다.
AI로 내 노래 뮤직비디오는 어떻게 만드나요?
먼저 곡에 맞춰 샷을 계획한 뒤, 샷을 하나씩 생성하세요.
- 곡의 구조를 정리하세요. 각 벌스, 코러스, 브리지가 어디서 시작하고 끝나는지 적습니다. 구간마다 샷을 하나씩 계획하거나, 컷을 더 원하면 짧은 샷을 여러 개 계획하세요.
- 샷 길이에 맞는 모델을 고르세요.
seedance-2.5는 4–30초,wan-3.0은 2–30초를 받고,minimax-h3는 5–15초를 받으며, 그 밖의 카탈로그 모델은 15초를 넘지 않습니다. - 각 샷은
POST /v1/videos로 생성하세요. 같은 가수나 장소를 다시 등장시키려면 관련된 샷마다 같은 스틸을first_frame으로 보내세요. 문서는 똑같은 모습을 보장하지 않으므로 모든 샷을 검토하세요. - 노래가 사운드트랙이 되므로, 모델이 허용하면
generate_audio: false로 소리 없는 클립을 요청하세요.gemini-omni-flash-1.1은 항상 오디오를 만들고 이 값을 거부하며, 현재 코드에서는minimax-h3와minimax-h3-max도 마찬가지이므로 이 클립들은 편집할 때 음소거하세요. - 각 클립은
GET /v1/jobs/{id}/result에 담긴media.sume.comURL에서 내려받아, 영상 편집기에서 곡에 맞춰 자르세요. 컷 지점은 모두 직접 정합니다. 영상 생성 문서도 Timeline 문서도 비트에 맞춰 자르는 방법은 설명하지 않습니다.
| 영상의 구성 요소 | Sume 호출 | 제약 |
|---|---|---|
| 각 샷 | POST /v1/videos | 모델에 따라 클립당 2–30초 |
| 가이드로 쓰는 곡의 일부 | audio_url을 담은 input_references | Seedance 2.x, Wan 3.0, MiniMax H3, MiniMax H3 Max만 해당 |
| 말에 맞춰 입을 움직이는 얼굴 | POST /v1/veed/fabric-1.0 | 스틸과 Sume에 호스팅된 오디오, 최대 300초. 말하는 클립용으로 설명됨 |
| 렌더 한 번으로 만드는 최종 편집본 | POST /v1/timeline-1.0/render | Sume에 호스팅된 미디어만 가능. 클립 1–200개 아래에 1–1,800초 오디오 스파인 |
Sume가 클립과 내 노래를 대신 합쳐 줄 수 있나요?
이미 있는 트랙이라면 공개 API로는 할 수 없습니다. Timeline 1.0은 순서가 있는 클립 아래에 오디오 스파인 하나를 깔아 MP4 하나로 렌더링하지만, 모든 URL은 이 워크스페이스의 media.sume.com 파일이어야 하고 호스트 밖 URL은 제출할 때 거부됩니다. Sume 공개 API에는 이미 있는 오디오 파일을 업로드하는 경로가 문서화되어 있지 않으므로, 내 노래로 만드는 최종 편집본은 편집기에서 완성해야 합니다.
Sume로 만든 곡은 다릅니다. Music Router 결과는 Sume에 호스팅된 오디오 아티팩트이므로, 생성한 트랙을 Timeline 렌더의 스파인으로 쓸 수 있습니다. 트랙은 음악 생성 API에서, 렌더는 롱폼 영상을 조립하는 방법에서 다룹니다.
클립이 음악을 따라가게 할 수 있나요?
한 번에 샷 하나의 레퍼런스로만 가능하며, 문서가 오디오 레퍼런스를 반영한다고 밝힌 모델에서만 됩니다. Seedance 2.x, Wan 3.0, MiniMax H3, MiniMax H3 Max입니다. 공개 HTTPS URL에 올린 곡의 일부를 input_references에 audio_url 항목으로 보내세요. 문서는 모델이 오디오를 어떻게 쓰는지도, 클립에서 그 오디오가 재생되는지도 밝히지 않으므로, 어느 경우든 노래를 사운드트랙으로 유지하세요. 카탈로그와 API 검사에 따른 현재 상한은 다음과 같습니다.
wan-3.0: 오디오 레퍼런스 최대 5개, 합계 15초.minimax-h3,minimax-h3-max: 최대 3개, 각각 2–15초에 합계 15초이며, 오디오만 레퍼런스로 보낼 수는 없습니다.- Seedance 2.x: 요청당 모든 유형을 합쳐 레퍼런스 최대 12개.
AI 가수가 내 노래에 맞춰 립싱크할 수 있나요?
영상 모델로는 할 수 없습니다. Sume 모델 문서에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않으므로, 먼저 생성한 클립이 나중에 아래에 깐 가사에 맞춰 입을 움직이지는 않습니다. VEED Fabric 1.0은 스틸과 오디오로 말하는 클립을 만들지만, API 레퍼런스는 노래하는 클립이 아니라 말하는 클립을 설명하며, 오디오는 Sume 미디어 호스트에 있어야 합니다. 다른 호스트는 거부됩니다. 요청 방법은 립싱크 API에서 다룹니다.
비용은 얼마인가요?
클립마다 별도의 Job이며, 제출할 때 해당 모델의 공급사 정가 × 1.25로 예약되고 기본적으로 5.5% 에이전트 수수료가 더해집니다. GET /v1/videos/models는 모든 모델의 pricing_skus를 나열하고, 나머지는 API 요금에 있습니다. 곡이 길수록 클립이 많아지고, 다시 생성한 샷은 다시 과금됩니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI 아바타 뉴스 앵커: AI 뉴스 진행자 영상 만드는 법
Sume로 AI 아바타 뉴스 앵커를 만드는 방법입니다. 재사용 아바타 하나가 기사마다 16:9 말하는 영상으로 읽고, 자막을 넣은 뒤 뉴스 한 편으로 이어 붙입니다.
- AI 팟캐스트 생성기: 텍스트에서 대본, 음성, 파일 하나로
AI 팟캐스트 생성기는 화자를 표시한 대본, 진행자마다 음성 하나, 오디오 파일 하나로 합치기의 세 단계입니다. Sume API로 각 단계를 하는 방법을 설명합니다.
- AI 제품 광고 영상 생성 API: Format 또는 직접 만들기
Sume API로 제품 광고를 만들려면 sume-product-commercial이나 sume-cinematic-studio-commercial을 실행하거나, /v1/videos에서 클립을 생성하세요.
- AI 제품 데모 영상 생성 API: 실제 동작 하나 보여 주기
Sume로 제품 데모 영상을 만들려면 팩샷과 동작 하나를 담아 sume-product-usage-demo Format을 실행하거나, 스틸을 영상으로 만든 뒤 Timeline에서 이어 붙이세요.
작성자 Sume