AI로 내 노래 뮤직비디오를 만들 수 있나요? 네, 클립 단위로

네, 곡에 맞춰 편집한 짧은 AI 클립들로 만들 수 있습니다. Sume에서 클립 하나는 최대 30초이므로 곡의 구간마다 샷을 하나씩 계획하세요.

읽는 시간 5분Sume
전체 글

네, AI로 내 노래 뮤직비디오에 쓸 영상을 만들 수 있지만, 생성 한 번으로 뮤직비디오 전체를 만들 수는 없습니다. 영상 모델은 한 번에 짧은 클립 하나를 만들며, 그 길이는 Sume에서 최대 30초, 대부분의 모델에서는 15초까지입니다. 그래서 곡 전체는 구간마다 하나 이상의 샷으로 나뉘고, 이 샷들을 곡 위에 이어 붙여 편집합니다.

아래 한도는 2026-09-27에 확인한 Sume의 영상 생성 (영문), Models (영문), Timeline 1.0 문서와 Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 API 코드에서 확인한 것입니다.

AI로 내 노래 뮤직비디오는 어떻게 만드나요?

먼저 곡에 맞춰 샷을 계획한 뒤, 샷을 하나씩 생성하세요.

  • 곡의 구조를 정리하세요. 각 벌스, 코러스, 브리지가 어디서 시작하고 끝나는지 적습니다. 구간마다 샷을 하나씩 계획하거나, 컷을 더 원하면 짧은 샷을 여러 개 계획하세요.
  • 샷 길이에 맞는 모델을 고르세요. seedance-2.5는 4–30초, wan-3.0은 2–30초를 받고, minimax-h3는 5–15초를 받으며, 그 밖의 카탈로그 모델은 15초를 넘지 않습니다.
  • 각 샷은 POST /v1/videos로 생성하세요. 같은 가수나 장소를 다시 등장시키려면 관련된 샷마다 같은 스틸을 first_frame으로 보내세요. 문서는 똑같은 모습을 보장하지 않으므로 모든 샷을 검토하세요.
  • 노래가 사운드트랙이 되므로, 모델이 허용하면 generate_audio: false로 소리 없는 클립을 요청하세요. gemini-omni-flash-1.1은 항상 오디오를 만들고 이 값을 거부하며, 현재 코드에서는 minimax-h3와 minimax-h3-max도 마찬가지이므로 이 클립들은 편집할 때 음소거하세요.
  • 각 클립은 GET /v1/jobs/{id}/result에 담긴 media.sume.com URL에서 내려받아, 영상 편집기에서 곡에 맞춰 자르세요. 컷 지점은 모두 직접 정합니다. 영상 생성 문서도 Timeline 문서도 비트에 맞춰 자르는 방법은 설명하지 않습니다.
영상 생성 (영문), Models (영문), Timeline 1.0, Sume API 레퍼런스 기준, 2026-09-27 확인.
영상의 구성 요소Sume 호출제약
각 샷POST /v1/videos모델에 따라 클립당 2–30초
가이드로 쓰는 곡의 일부audio_url을 담은 input_referencesSeedance 2.x, Wan 3.0, MiniMax H3, MiniMax H3 Max만 해당
말에 맞춰 입을 움직이는 얼굴POST /v1/veed/fabric-1.0스틸과 Sume에 호스팅된 오디오, 최대 300초. 말하는 클립용으로 설명됨
렌더 한 번으로 만드는 최종 편집본POST /v1/timeline-1.0/renderSume에 호스팅된 미디어만 가능. 클립 1–200개 아래에 1–1,800초 오디오 스파인

Sume가 클립과 내 노래를 대신 합쳐 줄 수 있나요?

이미 있는 트랙이라면 공개 API로는 할 수 없습니다. Timeline 1.0은 순서가 있는 클립 아래에 오디오 스파인 하나를 깔아 MP4 하나로 렌더링하지만, 모든 URL은 이 워크스페이스의 media.sume.com 파일이어야 하고 호스트 밖 URL은 제출할 때 거부됩니다. Sume 공개 API에는 이미 있는 오디오 파일을 업로드하는 경로가 문서화되어 있지 않으므로, 내 노래로 만드는 최종 편집본은 편집기에서 완성해야 합니다.

Sume로 만든 곡은 다릅니다. Music Router 결과는 Sume에 호스팅된 오디오 아티팩트이므로, 생성한 트랙을 Timeline 렌더의 스파인으로 쓸 수 있습니다. 트랙은 음악 생성 API에서, 렌더는 롱폼 영상을 조립하는 방법에서 다룹니다.

클립이 음악을 따라가게 할 수 있나요?

한 번에 샷 하나의 레퍼런스로만 가능하며, 문서가 오디오 레퍼런스를 반영한다고 밝힌 모델에서만 됩니다. Seedance 2.x, Wan 3.0, MiniMax H3, MiniMax H3 Max입니다. 공개 HTTPS URL에 올린 곡의 일부를 input_references에 audio_url 항목으로 보내세요. 문서는 모델이 오디오를 어떻게 쓰는지도, 클립에서 그 오디오가 재생되는지도 밝히지 않으므로, 어느 경우든 노래를 사운드트랙으로 유지하세요. 카탈로그와 API 검사에 따른 현재 상한은 다음과 같습니다.

  • wan-3.0: 오디오 레퍼런스 최대 5개, 합계 15초.
  • minimax-h3, minimax-h3-max: 최대 3개, 각각 2–15초에 합계 15초이며, 오디오만 레퍼런스로 보낼 수는 없습니다.
  • Seedance 2.x: 요청당 모든 유형을 합쳐 레퍼런스 최대 12개.

AI 가수가 내 노래에 맞춰 립싱크할 수 있나요?

영상 모델로는 할 수 없습니다. Sume 모델 문서에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않으므로, 먼저 생성한 클립이 나중에 아래에 깐 가사에 맞춰 입을 움직이지는 않습니다. VEED Fabric 1.0은 스틸과 오디오로 말하는 클립을 만들지만, API 레퍼런스는 노래하는 클립이 아니라 말하는 클립을 설명하며, 오디오는 Sume 미디어 호스트에 있어야 합니다. 다른 호스트는 거부됩니다. 요청 방법은 립싱크 API에서 다룹니다.

비용은 얼마인가요?

클립마다 별도의 Job이며, 제출할 때 해당 모델의 공급사 정가 × 1.25로 예약되고 기본적으로 5.5% 에이전트 수수료가 더해집니다. GET /v1/videos/models는 모든 모델의 pricing_skus를 나열하고, 나머지는 API 요금에 있습니다. 곡이 길수록 클립이 많아지고, 다시 생성한 샷은 다시 과금됩니다.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume