Image-to-Video와 Reference-to-Video의 차이는?
이미지로 영상 만들기는 이미지를 첫 프레임으로 쓰고, 레퍼런스로 영상 만들기는 이미지·클립·오디오를 가이드로 씁니다. 언제 무엇을 쓰고, 함께 보내면 무엇이 우선하는지 정리했습니다.

이미지로 영상 만들기(image-to-video)는 여러분의 이미지에서 클립을 시작합니다. 이미지가 첫 프레임이 되고, 대부분의 모델에서는 다른 이미지로 마지막 프레임도 정할 수 있습니다. 레퍼런스로 영상 만들기(reference-to-video)는 이미지, 클립, 오디오를 가이드로만 쓰므로 출력의 어떤 프레임도 입력에 고정되지 않습니다. 텍스트로 영상 만들기(text-to-video)는 글만으로 시작하고, 영상 편집(video-to-video)은 이미 있는 클립을 편집합니다.
Sume에서는 모드를 따로 지정하지 않습니다. POST /v1/videos에 보내는 필드가 모드를 정합니다. 필드 규칙은 영상 생성 문서 (영문)에서, 모델별 지원 여부는 GET /v1/videos/models가 제공하는 카탈로그에서 가져왔으며, 2026-09-27에 확인했습니다.
네 가지 모드는 어떻게 다른가요?
모드마다 시작하는 입력이 다르고, 모든 모델이 모든 모드를 제공하지는 않습니다.
| 모드 | 보내는 것 | 입력의 역할 | Sume의 모델 |
|---|---|---|---|
| 텍스트로 영상 만들기 | prompt만 | 글만 사용. 모든 프레임을 모델이 생성함 | grok-imagine-video-1.5를 제외한 모든 모델 |
| 이미지로 영상 만들기 | frame_images: first_frame 하나, 선택적으로 last_frame | 클립의 첫 프레임을 정하고, 보내면 마지막 프레임도 정함 | 모든 모델. grok-imagine-video-1.5는 첫 프레임만 받음 |
| 레퍼런스로 영상 만들기 | input_references: 이미지, 영상, 오디오 | 어떤 프레임도 고정하지 않고 클립의 방향을 잡음 | Seedance 2.x, wan-3.0, minimax-h3, minimax-h3-max(세 유형 모두), gemini-omni-flash-1.1(이미지와 영상). kling-3와 grok-imagine-video-1.5는 지원하지 않음 |
| 영상 편집(video-to-video) | Video Router의 video_url | 이미 있는 클립을 바꿈. 편집 내용은 프롬프트로 설명함 | gemini-omni-flash-1.1만 |
이미지로 영상 만들기란 무엇인가요?
이미지로 영상 만들기는 스틸 이미지를 움직이게 합니다. 이미지가 시작 프레임이 되고, 모델이 프롬프트에 따라 그 뒤의 움직임을 생성합니다. 이미지는 frame_type: "first_frame"과 함께 frame_images에 담아 보내세요. last_frame 항목은 클립이 끝나는 장면을 정하며, 현재 코드는 첫 프레임 없이 보낸 마지막 프레임을 거부합니다. 프레임 이미지는 공개 HTTPS URL이어야 합니다.
아래는 문서의 이미지로 영상 만들기 예제입니다. 모델별 첫 프레임·마지막 프레임 규칙은 Image-to-Video API: 첫 프레임과 마지막 프레임 지정에 있습니다.
{
"model": "seedance-2",
"prompt": "A character walking through a forest",
"frame_images": [
{
"type": "image_url",
"image_url": { "url": "https://example.com/first-frame.png" },
"frame_type": "first_frame"
}
],
"resolution": "1080p"
}레퍼런스로 영상 만들기란 무엇인가요?
레퍼런스로 영상 만들기는 입력을 힌트로 다룹니다. 문서의 표현으로는 모델이 입력을 "as visual guidance rather than exact frames"(정확한 프레임이 아니라 시각적 가이드로) 쓰므로, 클립이 여러분의 이미지 그대로 시작하거나 그 이미지를 그대로 담아야 하는 것은 아닙니다. input_references는 image_url, video_url, audio_url 세 가지 유형을 받습니다. 모델은 supported_input_references에 나열된 유형만 받습니다.
문서의 레퍼런스 예제는 이미지 하나를 보냅니다. 개수와 모델별 규칙은 Reference-to-Video API에 있습니다.
{
"model": "seedance-2",
"prompt": "A colossal solar flare beside a planet",
"input_references": [
{
"type": "image_url",
"image_url": { "url": "https://example.com/style-ref.png" }
}
],
"resolution": "1080p"
}프레임과 레퍼런스를 함께 보내면 어떻게 되나요?
프레임이 우선합니다. 요청에 frame_images와 input_references가 모두 있으면 Sume는 이를 이미지로 영상 만들기로 처리하며, 현재 코드에서는 레퍼런스를 모델에 전달하지 않고 버립니다. 요청 하나에는 모드 하나만 고르세요.
어떤 것을 써야 하나요?
지금 있는 입력과 반드시 고정해야 하는 부분에서 출발하세요.
- 이미지가 없다면: 프롬프트만으로 텍스트로 영상 만들기.
- 제품 샷이나 움직이고 싶은 사진처럼 클립이 반드시 여러분의 이미지로 시작해야 한다면: 이미지로 영상 만들기. 끝 장면도 고정하려면
last_frame을 추가하세요. 팩샷은 AI 영상에서 제품을 정확하게 유지하기에서 다룹니다. - 어떤 프레임도 고정하지 않고 이미지 속 캐릭터, 제품, 스타일의 룩을 가져오거나, 레퍼런스 영상이나 오디오 트랙으로 클립의 방향을 잡고 싶다면: 레퍼런스로 영상 만들기. 첫 프레임 방식과 레퍼런스 방식은 여러 샷에서 캐릭터 일관성 유지하기에서 비교합니다.
- 이미 있는 클립에서 무언가를 바꾸고 싶다면:
gemini-omni-flash-1.1의 영상 편집(video-to-video). 프롬프트로 영상 편집하기에서 다룹니다.
출처
관련 글
모델 카테고리의 다른 글
- 한국어 TTS API: 한글 대본에 language ko 지정하기
한국어 TTS는 한글로 쓴 대본에 언어를 ko로 지정해 보내면 됩니다. Sume TTS API가 한국어를 읽는 방식, 음성 검사, 과금 방식을 설명합니다.
- AI로 사진을 움직이게 하는 법: 원하는 움직임 고르기
사진을 이미지로 영상 만들기 모델에 첫 프레임으로 넣고 움직임을 설명하세요. 춤을 따라 하게 하려면 모션 컨트롤, 얼굴이 말하게 하려면 립싱크를 씁니다.
- 다국어 TTS API: 언어마다 요청을 하나씩 보내기
여러 언어로 음성을 만들려면 언어마다 번역한 대본과 그 언어 코드를 담아 TTS 요청을 하나씩 보내세요. Sume가 이를 처리하는 방식을 설명합니다.
- AI로 사진을 그림으로 바꾸는 방법: 유화·수채화 스타일
AI로 사진을 그림으로 바꾸려면 사진을 레퍼런스 이미지로 보내고, 프롬프트에 스타일을 적고, aspect_ratio auto로 사진의 모양을 유지하세요.
작성자 Sume