Image-to-Video와 Reference-to-Video의 차이는?

이미지로 영상 만들기는 이미지를 첫 프레임으로 쓰고, 레퍼런스로 영상 만들기는 이미지·클립·오디오를 가이드로 씁니다. 언제 무엇을 쓰고, 함께 보내면 무엇이 우선하는지 정리했습니다.

읽는 시간 5분Sume
전체 글

이미지로 영상 만들기(image-to-video)는 여러분의 이미지에서 클립을 시작합니다. 이미지가 첫 프레임이 되고, 대부분의 모델에서는 다른 이미지로 마지막 프레임도 정할 수 있습니다. 레퍼런스로 영상 만들기(reference-to-video)는 이미지, 클립, 오디오를 가이드로만 쓰므로 출력의 어떤 프레임도 입력에 고정되지 않습니다. 텍스트로 영상 만들기(text-to-video)는 글만으로 시작하고, 영상 편집(video-to-video)은 이미 있는 클립을 편집합니다.

Sume에서는 모드를 따로 지정하지 않습니다. POST /v1/videos에 보내는 필드가 모드를 정합니다. 필드 규칙은 영상 생성 문서 (영문)에서, 모델별 지원 여부는 GET /v1/videos/models가 제공하는 카탈로그에서 가져왔으며, 2026-09-27에 확인했습니다.

네 가지 모드는 어떻게 다른가요?

모드마다 시작하는 입력이 다르고, 모든 모델이 모든 모드를 제공하지는 않습니다.

영상 생성 (영문), Video Router (영문), GET /v1/videos/models가 제공하는 카탈로그 기준, 2026-09-27 확인.
모드보내는 것입력의 역할Sume의 모델
텍스트로 영상 만들기prompt만글만 사용. 모든 프레임을 모델이 생성함grok-imagine-video-1.5를 제외한 모든 모델
이미지로 영상 만들기frame_images: first_frame 하나, 선택적으로 last_frame클립의 첫 프레임을 정하고, 보내면 마지막 프레임도 정함모든 모델. grok-imagine-video-1.5는 첫 프레임만 받음
레퍼런스로 영상 만들기input_references: 이미지, 영상, 오디오어떤 프레임도 고정하지 않고 클립의 방향을 잡음Seedance 2.x, wan-3.0, minimax-h3, minimax-h3-max(세 유형 모두), gemini-omni-flash-1.1(이미지와 영상). kling-3와 grok-imagine-video-1.5는 지원하지 않음
영상 편집(video-to-video)Video Router의 video_url이미 있는 클립을 바꿈. 편집 내용은 프롬프트로 설명함gemini-omni-flash-1.1만

이미지로 영상 만들기란 무엇인가요?

이미지로 영상 만들기는 스틸 이미지를 움직이게 합니다. 이미지가 시작 프레임이 되고, 모델이 프롬프트에 따라 그 뒤의 움직임을 생성합니다. 이미지는 frame_type: "first_frame"과 함께 frame_images에 담아 보내세요. last_frame 항목은 클립이 끝나는 장면을 정하며, 현재 코드는 첫 프레임 없이 보낸 마지막 프레임을 거부합니다. 프레임 이미지는 공개 HTTPS URL이어야 합니다.

아래는 문서의 이미지로 영상 만들기 예제입니다. 모델별 첫 프레임·마지막 프레임 규칙은 Image-to-Video API: 첫 프레임과 마지막 프레임 지정에 있습니다.

{
  "model": "seedance-2",
  "prompt": "A character walking through a forest",
  "frame_images": [
    {
      "type": "image_url",
      "image_url": { "url": "https://example.com/first-frame.png" },
      "frame_type": "first_frame"
    }
  ],
  "resolution": "1080p"
}

레퍼런스로 영상 만들기란 무엇인가요?

레퍼런스로 영상 만들기는 입력을 힌트로 다룹니다. 문서의 표현으로는 모델이 입력을 "as visual guidance rather than exact frames"(정확한 프레임이 아니라 시각적 가이드로) 쓰므로, 클립이 여러분의 이미지 그대로 시작하거나 그 이미지를 그대로 담아야 하는 것은 아닙니다. input_references는 image_url, video_url, audio_url 세 가지 유형을 받습니다. 모델은 supported_input_references에 나열된 유형만 받습니다.

문서의 레퍼런스 예제는 이미지 하나를 보냅니다. 개수와 모델별 규칙은 Reference-to-Video API에 있습니다.

{
  "model": "seedance-2",
  "prompt": "A colossal solar flare beside a planet",
  "input_references": [
    {
      "type": "image_url",
      "image_url": { "url": "https://example.com/style-ref.png" }
    }
  ],
  "resolution": "1080p"
}

프레임과 레퍼런스를 함께 보내면 어떻게 되나요?

프레임이 우선합니다. 요청에 frame_images와 input_references가 모두 있으면 Sume는 이를 이미지로 영상 만들기로 처리하며, 현재 코드에서는 레퍼런스를 모델에 전달하지 않고 버립니다. 요청 하나에는 모드 하나만 고르세요.

어떤 것을 써야 하나요?

지금 있는 입력과 반드시 고정해야 하는 부분에서 출발하세요.

  • 이미지가 없다면: 프롬프트만으로 텍스트로 영상 만들기.
  • 제품 샷이나 움직이고 싶은 사진처럼 클립이 반드시 여러분의 이미지로 시작해야 한다면: 이미지로 영상 만들기. 끝 장면도 고정하려면 last_frame을 추가하세요. 팩샷은 AI 영상에서 제품을 정확하게 유지하기에서 다룹니다.
  • 어떤 프레임도 고정하지 않고 이미지 속 캐릭터, 제품, 스타일의 룩을 가져오거나, 레퍼런스 영상이나 오디오 트랙으로 클립의 방향을 잡고 싶다면: 레퍼런스로 영상 만들기. 첫 프레임 방식과 레퍼런스 방식은 여러 샷에서 캐릭터 일관성 유지하기에서 비교합니다.
  • 이미 있는 클립에서 무언가를 바꾸고 싶다면: gemini-omni-flash-1.1의 영상 편집(video-to-video). 프롬프트로 영상 편집하기에서 다룹니다.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume