이미지로 음악 만드는 AI: 사진으로 트랙 생성하기
이미지로 음악을 만드는 AI는 사진을 트랙의 입력으로 씁니다. Sume에서는 텍스트 프롬프트와 함께 image_url을 Music Router로 보내며, 가격은 그대로입니다.

이미지로 음악을 만드는 AI는 사진을 입력 중 하나로 삼아 음악 트랙을 만듭니다. Sume에서는 사진을 텍스트 프롬프트와 함께 보냅니다. POST /v1/music-router/generate 요청에서 필수 필드인 prompt 옆에 공개 HTTPS image_url을 추가하세요. 이미지는 선택적인 시각 조건이며, 문서에 따르면 가격을 바꾸지 않습니다.
세부 내용은 2026-09-27에 확인한 Sume의 Music 1.0 (영문)과 Music Router (영문) 문서, 그리고 Sume API 레퍼런스의 Music Router 스키마에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다. 나머지 요청 필드는 모두 음악 생성 API에서 다룹니다.
API로 이미지를 음악으로 바꾸려면 어떻게 하나요?
프롬프트와 이미지 URL을 요청 하나에 담아 보낸 뒤, Job을 폴링하고 오디오를 내려받으세요. 아래 요청은 문서에 있는 이미지 조건 예제를 Music Router로 보낸 것입니다.
POST /v1/music-router/generate는 Job을 만듭니다. 기본값인sume/music-auto를 쓰려면model을 생략하세요.GET /v1/jobs/{id}/status는 진행 상황을 알려 주고,GET /v1/jobs/{id}/result는 완료된 Job을 반환합니다.- 트랙은
result.artifacts[]에서type이audio인 항목이며, 보통 media.sume.com의audio/mpeg입니다.
curl -X POST https://api.sume.com/v1/music-router/generate \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: music-image-001" \
-d '{
"prompt": "Cinematic ambient underscore matching the mood of the reference still, instrumental only",
"image_url": "https://example.com/moodboard.png"
}'사진을 보낼 때 프롬프트에는 무엇을 적어야 하나요?
문서의 예제는 프롬프트를 짧게 쓰고 스틸을 가리킵니다. 뻔한 음악적 선택을 피하도록 문서는 장면에 맞춘 완전한 브리프를 권하며, 사진은 그 브리프와 함께 보낼 수 있습니다. 감정, 장르, BPM으로 적은 템포, 조성, 질감을 붙인 악기 두 개에서 네 개, 구체적으로 짚은 순간 하나, 시대를 적고, 마지막에 “Instrumental, no vocals.”를 붙이세요.
비 내리는 밤 도시 거리 사진이라면 이렇게 쓸 수 있습니다. “Moody, rain-soaked synthwave, 92 BPM, F minor. Warm analog pads, gated snare, a lonely saxophone line. A slow start; the drums enter at 0:15 and the sax takes the melody at 0:30. 1980s production, wide and wet. A 1-minute track. Instrumental, no vocals.” 브리프 예시는 AI 음악 프롬프트 예시에 더 있습니다.
이미지는 무엇을 바꾸고, 무엇을 바꾸지 않나요?
이미지는 설정이 아니라 입력입니다. 프롬프트를 대신하지도, 길이를 정하지도, 청구 금액을 늘리지도 않습니다.
| 질문 | 답 |
|---|---|
| 이미지가 필수인가요? | 아니요. prompt는 필수이며 1–5,000자, image_url은 선택. |
| 어떤 이미지 URL을 쓸 수 있나요? | 공개 HTTPS URL. null은 요청 객체를 재사용하는 클라이언트에서 이미지를 비울 때만 보냄. |
| 가격이 달라지나요? | 아니요. 문서에 따르면 가격은 이미지 조건에 따라 달라지지 않음. API 요금에는 음악 생성이 오디오 1건당 $0.125로 나와 있고, 기본적으로 5.5% 에이전트 수수료가 더해짐. |
| 길이를 정하나요? | 아니요. 길이 필드가 없으며 duration과 duration_seconds는 거부됨. 길이는 프롬프트로 요청. |
| 어떤 모델이 받나요? | 카탈로그가 모델마다 capabilities.image_conditioning을 알려 줌. 현재 코드에서는 sume/music-auto, lyria-3.5, lyria-3-pro에서 true. |
| 무엇을 돌려받나요? | Sume에 호스팅된 오디오 아티팩트. 원본 프로바이더 URL은 공개 출력이 아님. |
이미지는 어디서 가져올 수 있나요?
자체 사이트나 스토리지 버킷처럼 공개 HTTPS URL에 있는 이미지라면 무엇이든 됩니다. 이미 Sume에 있는 영상에 쓸 음악이라면 영상 프레임(POST /v1/video-frames)이 최대 300초 길이의 클립에서 지정한 초의 정확한 스틸을 내구성 있는 media.sume.com 이미지로 반환하며, 이 호출은 과금되지 않습니다. 이 경우는 AI로 영상에 맞는 음악 만들기에서 차례대로 다룹니다.
Sume에서 이미지로 음악을 만들 때 할 수 없는 것은 무엇인가요?
- 분위기가 맞는다고 보장할 수 없습니다. 문서는 브리프의 세부 사항을 결과를 보장하는 설정값이 아니라 창작 방향이라고 설명하며, 생성된 오디오를 확인하라고 안내합니다.
- 사진을 여러 장 받을 수 없습니다.
image_url은 URL 하나입니다. - 가사를 입력으로 받을 수 없습니다. 요청에 가사 필드가 없습니다. 배경 음악이라면 프롬프트를 “Instrumental, no vocals.”로 끝내세요.
- 네거티브 프롬프트를 쓸 수 없습니다. 비어 있지 않은
negative_prompt는negative_prompt_unsupported와 함께 HTTP 400을 반환하므로, 제외할 내용은 대신 프롬프트에 적으세요.
출처
관련 글
모델 카테고리의 다른 글
- Image-to-Video와 Reference-to-Video의 차이는?
이미지로 영상 만들기는 이미지를 첫 프레임으로 쓰고, 레퍼런스로 영상 만들기는 이미지·클립·오디오를 가이드로 씁니다. 언제 무엇을 쓰고, 함께 보내면 무엇이 우선하는지 정리했습니다.
- 한국어 TTS API: 한글 대본에 language ko 지정하기
한국어 TTS는 한글로 쓴 대본에 언어를 ko로 지정해 보내면 됩니다. Sume TTS API가 한국어를 읽는 방식, 음성 검사, 과금 방식을 설명합니다.
- AI로 사진을 움직이게 하는 법: 원하는 움직임 고르기
사진을 이미지로 영상 만들기 모델에 첫 프레임으로 넣고 움직임을 설명하세요. 춤을 따라 하게 하려면 모션 컨트롤, 얼굴이 말하게 하려면 립싱크를 씁니다.
- 다국어 TTS API: 언어마다 요청을 하나씩 보내기
여러 언어로 음성을 만들려면 언어마다 번역한 대본과 그 언어 코드를 담아 TTS 요청을 하나씩 보내세요. Sume가 이를 처리하는 방식을 설명합니다.
작성자 Sume