이미지로 음악 만드는 AI: 사진으로 트랙 생성하기

이미지로 음악을 만드는 AI는 사진을 트랙의 입력으로 씁니다. Sume에서는 텍스트 프롬프트와 함께 image_url을 Music Router로 보내며, 가격은 그대로입니다.

읽는 시간 4분Sume
전체 글

이미지로 음악을 만드는 AI는 사진을 입력 중 하나로 삼아 음악 트랙을 만듭니다. Sume에서는 사진을 텍스트 프롬프트와 함께 보냅니다. POST /v1/music-router/generate 요청에서 필수 필드인 prompt 옆에 공개 HTTPS image_url을 추가하세요. 이미지는 선택적인 시각 조건이며, 문서에 따르면 가격을 바꾸지 않습니다.

세부 내용은 2026-09-27에 확인한 Sume의 Music 1.0 (영문)과 Music Router (영문) 문서, 그리고 Sume API 레퍼런스의 Music Router 스키마에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다. 나머지 요청 필드는 모두 음악 생성 API에서 다룹니다.

API로 이미지를 음악으로 바꾸려면 어떻게 하나요?

프롬프트와 이미지 URL을 요청 하나에 담아 보낸 뒤, Job을 폴링하고 오디오를 내려받으세요. 아래 요청은 문서에 있는 이미지 조건 예제를 Music Router로 보낸 것입니다.

  • POST /v1/music-router/generate는 Job을 만듭니다. 기본값인 sume/music-auto를 쓰려면 model을 생략하세요.
  • GET /v1/jobs/{id}/status는 진행 상황을 알려 주고, GET /v1/jobs/{id}/result는 완료된 Job을 반환합니다.
  • 트랙은 result.artifacts[]에서 type이 audio인 항목이며, 보통 media.sume.com의 audio/mpeg입니다.
curl -X POST https://api.sume.com/v1/music-router/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: music-image-001" \
  -d '{
    "prompt": "Cinematic ambient underscore matching the mood of the reference still, instrumental only",
    "image_url": "https://example.com/moodboard.png"
  }'

사진을 보낼 때 프롬프트에는 무엇을 적어야 하나요?

문서의 예제는 프롬프트를 짧게 쓰고 스틸을 가리킵니다. 뻔한 음악적 선택을 피하도록 문서는 장면에 맞춘 완전한 브리프를 권하며, 사진은 그 브리프와 함께 보낼 수 있습니다. 감정, 장르, BPM으로 적은 템포, 조성, 질감을 붙인 악기 두 개에서 네 개, 구체적으로 짚은 순간 하나, 시대를 적고, 마지막에 “Instrumental, no vocals.”를 붙이세요.

비 내리는 밤 도시 거리 사진이라면 이렇게 쓸 수 있습니다. “Moody, rain-soaked synthwave, 92 BPM, F minor. Warm analog pads, gated snare, a lonely saxophone line. A slow start; the drums enter at 0:15 and the sax takes the melody at 0:30. 1980s production, wide and wet. A 1-minute track. Instrumental, no vocals.” 브리프 예시는 AI 음악 프롬프트 예시에 더 있습니다.

이미지는 무엇을 바꾸고, 무엇을 바꾸지 않나요?

이미지는 설정이 아니라 입력입니다. 프롬프트를 대신하지도, 길이를 정하지도, 청구 금액을 늘리지도 않습니다.

Music 1.0 (영문), Music Router (영문), Sume API 레퍼런스, API 요금 기준, 2026-09-27 확인. 카탈로그 플래그는 Sume의 코드에서 확인했습니다.
질문답
이미지가 필수인가요?아니요. prompt는 필수이며 1–5,000자, image_url은 선택.
어떤 이미지 URL을 쓸 수 있나요?공개 HTTPS URL. null은 요청 객체를 재사용하는 클라이언트에서 이미지를 비울 때만 보냄.
가격이 달라지나요?아니요. 문서에 따르면 가격은 이미지 조건에 따라 달라지지 않음. API 요금에는 음악 생성이 오디오 1건당 $0.125로 나와 있고, 기본적으로 5.5% 에이전트 수수료가 더해짐.
길이를 정하나요?아니요. 길이 필드가 없으며 duration과 duration_seconds는 거부됨. 길이는 프롬프트로 요청.
어떤 모델이 받나요?카탈로그가 모델마다 capabilities.image_conditioning을 알려 줌. 현재 코드에서는 sume/music-auto, lyria-3.5, lyria-3-pro에서 true.
무엇을 돌려받나요?Sume에 호스팅된 오디오 아티팩트. 원본 프로바이더 URL은 공개 출력이 아님.

이미지는 어디서 가져올 수 있나요?

자체 사이트나 스토리지 버킷처럼 공개 HTTPS URL에 있는 이미지라면 무엇이든 됩니다. 이미 Sume에 있는 영상에 쓸 음악이라면 영상 프레임(POST /v1/video-frames)이 최대 300초 길이의 클립에서 지정한 초의 정확한 스틸을 내구성 있는 media.sume.com 이미지로 반환하며, 이 호출은 과금되지 않습니다. 이 경우는 AI로 영상에 맞는 음악 만들기에서 차례대로 다룹니다.

Sume에서 이미지로 음악을 만들 때 할 수 없는 것은 무엇인가요?

  • 분위기가 맞는다고 보장할 수 없습니다. 문서는 브리프의 세부 사항을 결과를 보장하는 설정값이 아니라 창작 방향이라고 설명하며, 생성된 오디오를 확인하라고 안내합니다.
  • 사진을 여러 장 받을 수 없습니다. image_url은 URL 하나입니다.
  • 가사를 입력으로 받을 수 없습니다. 요청에 가사 필드가 없습니다. 배경 음악이라면 프롬프트를 “Instrumental, no vocals.”로 끝내세요.
  • 네거티브 프롬프트를 쓸 수 없습니다. 비어 있지 않은 negative_prompt는 negative_prompt_unsupported와 함께 HTTP 400을 반환하므로, 제외할 내용은 대신 프롬프트에 적으세요.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume