AI로 사진을 움직이게 하는 법: 원하는 움직임 고르기
사진을 이미지로 영상 만들기 모델에 첫 프레임으로 넣고 움직임을 설명하세요. 춤을 따라 하게 하려면 모션 컨트롤, 얼굴이 말하게 하려면 립싱크를 씁니다.

AI로 사진을 움직이게 하려면 사진을 이미지로 영상 만들기(image-to-video) 모델에 클립의 첫 프레임으로 넣고, 프롬프트에 움직임을 설명하세요. 이어지는 몇 초는 모델이 생성합니다. 다른 영상의 움직임을 따라 하게 하려면 모션 컨트롤을, 얼굴이 말하게 하려면 립싱크를 쓰세요.
아래 단계는 Sume를 기준으로 합니다. Sume에서 이미지로 만드는 영상 클립 하나는 모델에 따라 2–30초입니다. 내용은 2026-09-27에 확인한 영상 생성 (영문) 문서와 Models 개요 (영문) 문서, Sume API 레퍼런스를 뒷받침하는 OpenAPI 문서, Sume의 영상 카탈로그에서 가져왔습니다.
원하는 대로 사진을 움직이려면 어떤 AI 도구를 써야 하나요?
움직임을 어디서 가져오느냐에 따라 다릅니다.
| 원하는 움직임 | 사용할 것 | 보내는 것 | 클립 길이 |
|---|---|---|---|
| 말로 설명할 수 있는 움직임: 미소, 고개 돌리기, 나무를 흔드는 바람 | 이미지로 영상 만들기, POST /v1/videos | first_frame으로 넣은 사진과 프롬프트 | 모델에 따라 2–30초 |
| 춤처럼 다른 영상에 담긴 움직임 | Kling 3.0 Motion Control, POST /v1/kling/3.0/motion-control | 사진과 드라이빙 영상 | 드라이빙 영상을 따름, 최대 30초 |
| 말하는 얼굴 | VEED Fabric 1.0 립싱크, POST /v1/veed/fabric-1.0 | 사진과 텍스트 음성 변환 클립 같은 Sume 호스팅 오디오 | 최대 300초 오디오 |
이미지로 영상 만들기로 사진은 어떻게 움직이나요?
- 사진을 공개 HTTPS URL에 올리세요. localhost URL, 사설 네트워크 URL, HTTPS가 아닌 URL, 서명된·비공개 URL은 Job이 제출되기 전에 거부됩니다.
- 모델을 고르세요. 모든 영상 모델이 첫 프레임을 받으며,
grok-imagine-video-1.5는 이미지로 영상 만들기만 합니다. prompt에 움직임을 설명하세요. 문서는 움직임, 카메라 앵글, 조명, 장면 구성을 자세히 적으라고 권합니다.duration은 모델의 범위 안에서 정하세요.seedance-2.5와wan-3.0은 30초까지, 나머지는 15초 이하까지입니다. 모델별 범위는 모델별 AI 영상 길이 제한에 정리되어 있습니다.status가completed가 될 때까지 Job을 폴링한 뒤, API 키로 클립을 내려받으세요.
curl -X POST https://api.sume.com/v1/videos \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: photo-move-001" \
-d '{
"model": "wan-3.0",
"prompt": "The woman in the photo turns toward the camera and smiles as wind moves her hair",
"frame_images": [
{
"type": "image_url",
"image_url": { "url": "https://example.com/photo.jpg" },
"frame_type": "first_frame"
}
],
"resolution": "720p",
"duration": 5
}'다른 영상의 움직임을 따라 하게 할 수 있나요?
네, Kling 3.0 Motion Control로 할 수 있습니다. 직접 제공한 드라이빙 영상의 움직임으로 스틸 이미지를 움직이며, 출력 길이는 그 영상을 따르고 드라이빙 영상은 최대 30초까지 쓸 수 있습니다. 선택 사항인 프롬프트는 외형 세부만 조정하며, 움직임과 프레이밍은 드라이빙 영상에서 옵니다. 필드와 가격은 모션 컨트롤 API: 드라이빙 영상으로 이미지 움직이기에 있습니다.
사진 속 인물이 말하게 할 수 있나요?
이미지로 영상 만들기로는 할 수 없습니다. Sume 문서에 따르면 영상 모델은 생성된 음성이나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않습니다. 대신 VEED Fabric 1.0을 쓰세요. 스틸 이미지와 텍스트 음성 변환 클립 같은 Sume 호스팅 오디오를 받아 말하는 클립으로 만듭니다. 요청 방법은 립싱크 API 가이드에서 다룹니다.
제한 사항은 무엇인가요?
- Sume의 편집 타임라인에 올린 스틸 이미지는 움직이지 않습니다. Timeline 1.0 렌더에서 스틸은 정적 홀드이며, 스틸의
motion필드는 받기는 하지만 무시됩니다. - 여러분의 사진은 첫 프레임뿐입니다. 그 뒤의 프레임은 생성되며, 얼굴이나 디테일을 똑같이 유지하는 설정은 문서화되어 있지 않으므로 쓰기 전에 클립을 확인하세요.
- 사진은 공개 HTTPS URL에 있어야 합니다. 서명된 링크나 내 컴퓨터에 있는 파일로는 안 됩니다.
- 클립 하나는 최대 30초입니다. 더 긴 영상은 클립 여러 개를 생성해 이어 붙이세요.
출처
관련 글
모델 카테고리의 다른 글
- 다국어 TTS API: 언어마다 요청을 하나씩 보내기
여러 언어로 음성을 만들려면 언어마다 번역한 대본과 그 언어 코드를 담아 TTS 요청을 하나씩 보내세요. Sume가 이를 처리하는 방식을 설명합니다.
- AI로 사진을 그림으로 바꾸는 방법: 유화·수채화 스타일
AI로 사진을 그림으로 바꾸려면 사진을 레퍼런스 이미지로 보내고, 프롬프트에 스타일을 적고, aspect_ratio auto로 사진의 모양을 유지하세요.
- 끊김 없는 AI 루프 영상: 시작 장면으로 끝나는 클립 만들기
AI 영상을 루프로 만들려면 이미지 하나를 첫 프레임과 마지막 프레임으로 모두 보내고, 반복 재생하기 전에 양 끝을 비교하세요. 끝 프레임을 받는 모델도 정리했습니다.
- Seedance 2.5 API: 30초 클립, 해상도, 레퍼런스
Sume의 Seedance 2.5는 seedance-2.5로, 480p, 720p, 1080p의 4–30초 클립을 만듭니다. Seedance ID별로 문서화된 한도, 입력, 과금을 정리했습니다.
작성자 Sume