이미지 여러 장으로 AI 영상 만들기: 프레임, 레퍼런스, 스틸
Sume에서 AI 클립 하나는 이미지 두 장을 첫 프레임과 마지막 프레임으로 받습니다. 그보다 많다면 두 장씩 클립을 잇거나, 레퍼런스로 쓰거나, 스틸로 보여 주세요.

이미지 여러 장으로 AI 영상 하나를 만들 수 있지만, Sume에서 생성 한 번에 프레임으로 고정할 수 있는 이미지는 최대 두 장입니다. 한 장은 첫 프레임, 다른 한 장은 마지막 프레임입니다. 이미지 두 장이면 전환 클립 하나가 됩니다. 이미지가 더 많다면 방법은 세 가지입니다. 이웃한 두 장마다 클립을 하나씩 생성해 잇거나, 이미지를 레퍼런스로 보내 클립 하나를 가이드하거나, 편집한 시퀀스 안에서 스틸로 보여 주는 것입니다.
필드와 한도는 2026-09-27에 확인한 Sume의 영상 생성 (영문), Video Router (영문), Timeline 1.0 문서에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 API 코드에서 확인한 것입니다.
이미지 두 장으로 AI 영상을 어떻게 만드나요?
POST /v1/videos의 frame_images에 두 이미지를 모두 보내세요. 한 항목은 frame_type: "first_frame", 다른 항목은 "last_frame"으로 지정합니다. 이것이 이미지로 영상 만들기이며, 그 사이에 일어나는 일은 프롬프트로 설명합니다. 배열에는 항목을 최대 두 개까지 넣을 수 있고, 마지막 프레임을 보내려면 같은 요청에 첫 프레임이 있어야 하며, 모델이 GET /v1/videos/models의 supported_frame_images에 last_frame을 나열해야 합니다. 어떤 모델이 각 프레임을 받는지는 Image-to-Video API: 첫 프레임과 마지막 프레임에 정리되어 있습니다.
{
"model": "seedance-2",
"prompt": "Slow push-in as the street goes from morning to night and the shop lights come on",
"frame_images": [
{
"type": "image_url",
"image_url": { "url": "https://example.com/street-day.png" },
"frame_type": "first_frame"
},
{
"type": "image_url",
"image_url": { "url": "https://example.com/street-night.png" },
"frame_type": "last_frame"
}
],
"duration": 8
}이미지가 두 장보다 많으면 영상 하나로 어떻게 만드나요?
이미지가 맡을 역할에 따라 방법을 고르세요. 모든 이미지를 순서대로 거쳐 가려면 두 장씩 이으세요. 이미지 1에서 2로, 다음은 2에서 3으로, 이런 식으로 이어 가면 각 클립은 다음 클립이 시작하는 이미지에서 끝납니다. 이미지 네 장이면 클립 세 개가 되고, 클립마다 Job도 청구도 따로입니다. 그런 다음 클립을 이으세요. Timeline 1.0은 Sume에 호스팅된 클립 URL로 렌더 한 번에 이어 줍니다.
| 방법 | 이미지 | 결과 | 알아 둘 규칙 |
|---|---|---|---|
| 첫 프레임과 마지막 프레임 | 요청당 2장 | 한 이미지로 시작해 다른 이미지로 끝나는 클립 하나 | last_frame에는 first_frame이 필요함 |
| 두 장씩 잇기 | 클립당 2장. 이미지 N장이면 클립 N − 1개 | 끝과 시작이 맞물리는 클립들 | 클립마다 별도로 생성함 |
| 이미지 레퍼런스 | minimax-h3, minimax-h3-max는 최대 9장, wan-3.0, gemini-omni-flash-1.1은 10장, Seedance 2.x는 레퍼런스 합계 12개 | 이미지 묶음이 가이드하는 클립 하나 | 같은 요청에 보낸 프레임이 우선하고, 레퍼런스는 버려짐 |
| 타임라인의 스틸 | 슬롯 1–200개 | 슬라이드쇼: 각 이미지가 정지 화면으로 유지됨 | Sume에 호스팅된 이미지만 가능. 전환 효과는 최대 1초 |
AI 클립 하나에 이미지를 한꺼번에 모두 쓸 수 있나요?
네, 레퍼런스로 쓸 수 있습니다. 레퍼런스로 영상 만들기를 하려면 각 이미지를 input_references의 image_url 항목으로 보내세요. 문서는 레퍼런스를 정확한 프레임이 아니라 모델이 사용하는 스타일·콘텐츠 가이드로 설명하므로, 모든 이미지가 클립에 나온다는 보장도, 어떤 순서로 나온다는 보장도 없습니다. 현재 카탈로그에서 kling-3와 grok-imagine-video-1.5는 레퍼런스를 받지 않습니다.
Gemini Omni Flash 1.1에서는 프롬프트가 위치로 레퍼런스를 가리킬 수 있습니다. Gemini Omni Flash 1.1 영상 API에서 다루듯, <IMAGE_REF_0>은 첫 번째 이미지이며 목록 순서대로 0부터 셉니다. 레퍼런스와 프레임은 함께 쓸 수 없습니다. 요청에 둘 다 있으면 frame_images가 우선하고, 요청은 이미지로 영상 만들기로 처리됩니다.
사진을 순서대로 보여 주기만 하려면 어떻게 하나요?
이전 Sume 출력물처럼 이미지가 이미 Sume에 있다면 아무것도 생성할 필요가 없습니다. Timeline 1.0은 영상 슬롯에 넣은 스틸을 정지 화면으로 유지하므로, 각 이미지는 슬롯의 duration 동안 화면에 머물고, 슬롯 사이에는 최대 1초의 페이드, 와이프, 슬라이드, 디졸브를 선택적으로 넣을 수 있습니다. 오디오 스파인 하나 또는 audio.mode: "silence"가 필요합니다. 내 사진 파일은 바로 넣을 수 없습니다. 모든 슬롯은 이 워크스페이스의 media.sume.com 파일이어야 하고, 공개 API에는 업로드 경로가 문서화되어 있지 않습니다. 전체 요청은 이미지 슬라이드쇼 영상 API에 있습니다.
어떤 제한이 있나요?
- 생성 한 번에 프레임은 첫 프레임과 마지막 프레임 두 장이며, 프레임 URL은 공개 HTTPS여야 합니다.
- 클립 길이는 모델에 따라 2–30초이며, 모델별
supported_durations는GET /v1/videos/models에 나옵니다. - 이미지 N장을 이으려면 생성이 N − 1번 필요하며, 두 프레임 사이의 움직임이 어떻게 보일지는 문서가 보장하지 않습니다.
- 레퍼런스 상한은 모델마다 다르며, 현재 코드에서는 상한을 넘는 요청이
400 unsupported_capability로 거부됩니다. - Timeline은 Sume에 호스팅된 미디어만 받으며, 렌더당 슬롯은 1–200개입니다.
출처
관련 글
모델 카테고리의 다른 글
- AI 영상 네거티브 프롬프트: 클립에서 원치 않는 요소 빼는 법
Sume 영상 API에는 네거티브 프롬프트 필드가 없고, 현재는 보내면 400이 반환됩니다. 원하는 샷을 설명한 뒤 샷의 프레임, 룩, 소리를 고정하세요.
- 프롬프트 AI 음성 생성기: 화자를 설명해 목소리 만들기
프롬프트 기반 AI 음성 생성기는 글로 쓴 설명으로 새 목소리를 디자인합니다. Sume에서는 에셋 → 보이스에서 사람을 설명한 뒤, 그 목소리를 TTS에 쓰세요.
- 내 목소리로 AI 보이스오버 만들기: 한 번 클론해 TTS에 재사용
내 목소리로 AI 보이스오버를 만들려면 Sume의 Voices 라이브러리에서 짧은 클립으로 목소리를 한 번 클론한 뒤, 그 ID를 TTS 음성으로 쓰세요.
- AI로 사진 두 장을 한 장으로 합치는 방법
네, AI로 사진 두 장을 한 장으로 합칠 수 있습니다. 두 사진을 레퍼런스로 이미지 모델에 보내고 원하는 장면 하나를 설명하세요. Sume로 하는 방법을 소개합니다.
작성자 Sume