제품을 든 AI 모델: API로 사진과 영상 만들기

Sume API로 AI 모델이 제품과 포즈를 잡게 하세요. 스틸은 sume-model-product-portrait, 영상은 sume-beauty-studio를 쓰거나 이미지 편집을 직접 제어하세요.

읽는 시간 5분Sume
전체 글

Sume API로 AI 모델이 제품을 든 사진이나 영상을 만들려면, 팩샷을 첨부하고 instruction에 원하는 포즈를 적어 POST /v1/formats/sume/{slug}/runs로 카탈로그 Format을 실행하세요. sume-model-product-portrait는 스틸을, sume-beauty-studio는 영상을 만듭니다. 단계마다 직접 제어하려면 제품과 모델 레퍼런스 이미지로 POST /v1/images에서 스틸을 만든 뒤, 그 스틸을 첫 프레임으로 삼아 POST /v1/videos에서 영상으로 만드세요.

아래 내용은 2026-09-27에 확인한 Sume 문서 Format 카탈로그 (영문), Format API (영문), Image API (영문), 영상 생성 (영문) 페이지에서 가져왔습니다. 제품에 대해 말하는 진행자는 다른 경로이며, API로 제품과 배경을 넣은 AI 아바타 영상 만들기에서 다룹니다.

스틸은 어떤 Format이, 영상은 어떤 Format이 만드나요?

두 설명 모두 뷰티에 관한 것으로, 스킨케어와 화장품을 언급합니다. 출력 종류는 마지막 구절에서 알 수 있습니다. “Not for: animated or motion deliverables”(애니메이션·모션 결과물용 아님)는 스틸을, “Not for: static campaign deliverables”(정적인 캠페인 결과물용 아님)는 영상을 가리킵니다. 인용한 문구는 각 Format이 명시한 목표일 뿐, 개별 결과에 대한 보장이 아닙니다.

GET /v1/formats/sume/{slug}가 반환하는 각 Format의 description에서 인용, slug는 Format 카탈로그 (영문) 기준, 2026-09-27 확인.
Slug출력명시된 목표적합한 브리프
sume-model-product-portrait이미지“intimate beauty framing, natural skin, accurate packaging, and editorial composure”(친밀한 뷰티 프레이밍, 자연스러운 피부, 정확한 패키지, 에디토리얼다운 차분함)“skincare endorsements, cosmetic portrait campaigns, and model-led product stills”(스킨케어 추천 광고, 화장품 인물 캠페인, 모델 중심의 제품 스틸)
sume-beauty-studio영상“a model, cosmetic product, soft editorial lighting, and polished tabletop or vanity styling”(모델, 화장품, 부드러운 에디토리얼 조명, 세련된 테이블 위 또는 화장대 스타일링)“skincare launches, makeup campaigns, beauty product reels, and clean studio brand films”(스킨케어 출시, 메이크업 캠페인, 뷰티 제품 릴스, 깔끔한 스튜디오 브랜드 필름)

모델이 제품을 들게 할 수 있나요?

어느 설명에도 제품을 어떤 포즈로 연출하는지는 나와 있지 않습니다. instruction에 포즈를 적으세요. 예를 들면 “the model holds the jar at chin height”(턱 높이에서 용기를 든 모델)처럼 씁니다. instruction은 Format 본문 뒤에 조합되어 둘이 어긋나면 우선하지만, 여전히 요청일 뿐이므로 돌아온 결과를 검토하세요.

팩샷은 공개 HTTPS URL을 담은 input_image로 첨부하세요. 특정 인물의 사진도 첨부할 수 있지만, sume-virtual-fitting의 설명(“on a supplied person”, 제공된 인물에게)과 달리 포트레이트 Format의 설명에는 제공된 인물을 받는다는 말이 없습니다. 사진 사용에 동의한 사람의 사진만 보내세요.

curl -sS -X POST "https://api.sume.com/v1/formats/sume/sume-model-product-portrait/runs" \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: serum-portrait-v1" \
  -d '{
    "instruction": "The model holds the serum bottle at chin height.",
    "attachments": [
      { "type": "input_image", "image_url": "https://example.com/serum.png" }
    ],
    "generation_spend_cap_usd": 10
  }'

스틸을 직접 만들려면 어떻게 하나요?

팩샷과 모델 사진을 input_references로 POST /v1/images에 보내세요. ChatGPT Image 2.5(openai/gpt-image-2.5)는 이미지 레퍼런스를 최대 16개까지 받습니다. 다른 모델은 각자의 input_references 범위를 GET /v1/images/models에 공개하며, 최댓값이 0인 모델은 텍스트로 이미지 만들기만 지원합니다. 레퍼런스 URL은 공개 HTTPS여야 합니다.

  • 응답의 data[].url은 Sume에 호스팅된 서명된 URL입니다. 고른 스틸을 영상 프레임으로 다시 쓰기 전에 직접 관리하는 공개 HTTPS URL에 호스팅하세요.
curl -X POST https://api.sume.com/v1/images \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-image-2.5",
    "prompt": "Beauty portrait: the model holds the serum bottle at chin height, soft window light",
    "input_references": [
      { "type": "image_url", "image_url": { "url": "https://example.com/serum.png" } },
      { "type": "image_url", "image_url": { "url": "https://example.com/model.jpg" } }
    ]
  }'

포트레이트를 영상으로 만들려면 어떻게 하나요?

같은 팩샷으로 sume-beauty-studio를 실행하거나, 고른 스틸을 frame_type: "first_frame"과 함께 frame_images에 넣어 POST /v1/videos로 보내고 prompt에 움직임을 설명하세요. 이 항목이 클립의 첫 프레임을 지정합니다. 먼저 GET /v1/videos/models에서 모델의 supported_durations와 supported_aspect_ratios를 확인하세요. 패키지를 다룰 때 첫 프레임과 레퍼런스가 어떻게 다른지는 Image-to-Video 제품 로고 왜곡에서 다룹니다.

영상 모델은 생성한 TTS나 나중에 입힌 보이스오버에 립싱크하지 않으므로, 말하는 모델이 필요하다면 위에서 링크한 아바타 경로를 쓰세요.

경로별 비용은 얼마인가요?

Format 실행의 생성은 API 요금의 요율로 계량되고, 실행당 최대 $500인 generation_spend_cap_usd로 상한이 정해집니다. 이미지 생성은 전부 아니면 전무 방식입니다. 완료된 생성은 전액 과금되고, 실패하거나 취소된 생성은 과금되지 않습니다. GET /v1/images/models/{model_id}/endpoints에 나온 이미지 모델별 pricing 항목에는 Sume 마진이 이미 포함되어 있습니다. 영상 Job은 제출 시 공급사 정가 × 1.25로 예약되고, 기본 5.5% 에이전트 수수료가 더해집니다.

어떤 제한이 있나요?

경로마다 입력에 한도가 있습니다.

Format API (영문), Format 호출하기 (영문), Image API (영문) 기준, 2026-09-27 확인.
입력한도
Format 실행 attachments이미지 최대 30장. JPEG, PNG, WebP, GIF, AVIF, 장당 30 MB, 실행당 500 MB.
Format 실행 instruction최대 8,000자. 그중 앞쪽 약 4,000자가 프롬프트 텍스트로 실행에 전달됨.
ChatGPT Image 2.5 input_references이미지 최대 16장.
POST /v1/images n호출당 이미지 1–10장. 모델별 상한은 이보다 낮음.
POST /v1/images 대기최대 30초까지 기다리며 200으로 응답. 더 오래 걸리는 생성은 폴링할 Job과 함께 202로 응답.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume