AI로 사진을 움직이게 하는 법: 원하는 움직임 고르기

사진을 이미지로 영상 만들기 모델에 첫 프레임으로 넣고 움직임을 설명하세요. 춤을 따라 하게 하려면 모션 컨트롤, 얼굴이 말하게 하려면 립싱크를 씁니다.

읽는 시간 5분Sume
전체 글

AI로 사진을 움직이게 하려면 사진을 이미지로 영상 만들기(image-to-video) 모델에 클립의 첫 프레임으로 넣고, 프롬프트에 움직임을 설명하세요. 이어지는 몇 초는 모델이 생성합니다. 다른 영상의 움직임을 따라 하게 하려면 모션 컨트롤을, 얼굴이 말하게 하려면 립싱크를 쓰세요.

아래 단계는 Sume를 기준으로 합니다. Sume에서 이미지로 만드는 영상 클립 하나는 모델에 따라 2–30초입니다. 내용은 2026-09-27에 확인한 영상 생성 (영문) 문서와 Models 개요 (영문) 문서, Sume API 레퍼런스를 뒷받침하는 OpenAPI 문서, Sume의 영상 카탈로그에서 가져왔습니다.

원하는 대로 사진을 움직이려면 어떤 AI 도구를 써야 하나요?

움직임을 어디서 가져오느냐에 따라 다릅니다.

영상 생성 (영문), Models 개요 (영문), Sume API 레퍼런스 기준, 2026-09-27 확인.
원하는 움직임사용할 것보내는 것클립 길이
말로 설명할 수 있는 움직임: 미소, 고개 돌리기, 나무를 흔드는 바람이미지로 영상 만들기, POST /v1/videosfirst_frame으로 넣은 사진과 프롬프트모델에 따라 2–30초
춤처럼 다른 영상에 담긴 움직임Kling 3.0 Motion Control, POST /v1/kling/3.0/motion-control사진과 드라이빙 영상드라이빙 영상을 따름, 최대 30초
말하는 얼굴VEED Fabric 1.0 립싱크, POST /v1/veed/fabric-1.0사진과 텍스트 음성 변환 클립 같은 Sume 호스팅 오디오최대 300초 오디오

이미지로 영상 만들기로 사진은 어떻게 움직이나요?

  • 사진을 공개 HTTPS URL에 올리세요. localhost URL, 사설 네트워크 URL, HTTPS가 아닌 URL, 서명된·비공개 URL은 Job이 제출되기 전에 거부됩니다.
  • 모델을 고르세요. 모든 영상 모델이 첫 프레임을 받으며, grok-imagine-video-1.5는 이미지로 영상 만들기만 합니다.
  • prompt에 움직임을 설명하세요. 문서는 움직임, 카메라 앵글, 조명, 장면 구성을 자세히 적으라고 권합니다.
  • duration은 모델의 범위 안에서 정하세요. seedance-2.5와 wan-3.0은 30초까지, 나머지는 15초 이하까지입니다. 모델별 범위는 모델별 AI 영상 길이 제한에 정리되어 있습니다.
  • status가 completed가 될 때까지 Job을 폴링한 뒤, API 키로 클립을 내려받으세요.
curl -X POST https://api.sume.com/v1/videos \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: photo-move-001" \
  -d '{
    "model": "wan-3.0",
    "prompt": "The woman in the photo turns toward the camera and smiles as wind moves her hair",
    "frame_images": [
      {
        "type": "image_url",
        "image_url": { "url": "https://example.com/photo.jpg" },
        "frame_type": "first_frame"
      }
    ],
    "resolution": "720p",
    "duration": 5
  }'

다른 영상의 움직임을 따라 하게 할 수 있나요?

네, Kling 3.0 Motion Control로 할 수 있습니다. 직접 제공한 드라이빙 영상의 움직임으로 스틸 이미지를 움직이며, 출력 길이는 그 영상을 따르고 드라이빙 영상은 최대 30초까지 쓸 수 있습니다. 선택 사항인 프롬프트는 외형 세부만 조정하며, 움직임과 프레이밍은 드라이빙 영상에서 옵니다. 필드와 가격은 모션 컨트롤 API: 드라이빙 영상으로 이미지 움직이기에 있습니다.

사진 속 인물이 말하게 할 수 있나요?

이미지로 영상 만들기로는 할 수 없습니다. Sume 문서에 따르면 영상 모델은 생성된 음성이나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않습니다. 대신 VEED Fabric 1.0을 쓰세요. 스틸 이미지와 텍스트 음성 변환 클립 같은 Sume 호스팅 오디오를 받아 말하는 클립으로 만듭니다. 요청 방법은 립싱크 API 가이드에서 다룹니다.

제한 사항은 무엇인가요?

  • Sume의 편집 타임라인에 올린 스틸 이미지는 움직이지 않습니다. Timeline 1.0 렌더에서 스틸은 정적 홀드이며, 스틸의 motion 필드는 받기는 하지만 무시됩니다.
  • 여러분의 사진은 첫 프레임뿐입니다. 그 뒤의 프레임은 생성되며, 얼굴이나 디테일을 똑같이 유지하는 설정은 문서화되어 있지 않으므로 쓰기 전에 클립을 확인하세요.
  • 사진은 공개 HTTPS URL에 있어야 합니다. 서명된 링크나 내 컴퓨터에 있는 파일로는 안 됩니다.
  • 클립 하나는 최대 30초입니다. 더 긴 영상은 클립 여러 개를 생성해 이어 붙이세요.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume