AI로 스토리를 영상으로 만들 수 있나요? 네, 샷 단위로
네, AI는 스토리를 짧은 샷의 연속으로 영상화합니다. 샷마다 스틸을 승인해 움직이게 하고, 대사에 목소리를 입힌 뒤, 샷을 순서대로 이으세요.

네, AI로 스토리를 영상으로 만들 수 있지만, 긴 생성 한 번이 아니라 짧은 샷을 이어 붙이는 방식입니다. 스토리를 샷으로 나누고, 샷마다 스틸을 만들어 승인한 뒤, 몇 초 길이의 클립으로 움직이게 하고, 내레이션과 대사는 텍스트 음성 변환으로 목소리를 입힌 다음, 모든 것을 스토리 순서대로 사운드트랙 하나 아래에 이으세요.
Sume에서는 에이전트 탭의 에이전트에게 스토리를 맡기거나, API로 각 단계를 직접 실행할 수 있습니다. 아래 단계는 2026-09-27에 확인한 Sume의 빠른 시작, Models (영문), 영상 생성 (영문), Timeline 1.0 문서와 Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다.
스토리는 어떻게 AI 영상이 되나요?
샷 리스트부터 만드세요. 샷마다 화면에 무엇이 나오는지, 누가 말하는지, 얼마나 이어지는지를 적습니다. 생성한 클립 하나는 모델에 따라 2–30초이므로, 더 긴 장면은 여러 샷이 됩니다. 그다음 샷의 종류마다 거치는 단계가 따로 있습니다.
| 스토리의 구성 요소 | 단계 | Sume 호출 |
|---|---|---|
| 아무도 말하지 않는 장면 | 스틸을 만들어 승인한 뒤 클립으로 움직이게 함 | POST /v1/images 다음 POST /v1/videos |
| 내레이션과 대사 | 텍스트 음성 변환, 단락이나 대사마다 파일 하나 | POST /v1/tts-1.0/generate |
| 카메라 앞에서 말하는 캐릭터 | 승인한 스틸과 그 대사의 음성 오디오 | POST /v1/veed/fabric-1.0 |
| 완성 영상 | 모든 대사를 담은 오디오 스파인 하나 위에 스토리 순서대로 놓은 모든 클립 | POST /v1/timeline-1.0/render |
클립마다 먼저 스틸을 만드는 이유는 무엇인가요?
Sume 문서는 대사 없는 장면을 이미지, 검사, 영상 순서로 처리하도록 안내하며, Sume가 자체 에이전트에게 주는 가이드도 영상에 비용을 쓰기 전에 스틸을 승인하라고 합니다. 스틸은 샷이 어떻게 시작하는지, 즉 배경, 캐릭터, 프레이밍을 정합니다. 승인한 스틸을 frame_images에 클립의 first_frame으로 보내면 클립이 그 스틸로 시작하며, 이때 프롬프트는 움직임, 카메라, 빛을 설명합니다.
여러 샷에 다시 나오는 캐릭터라면 매번 같은 소스 이미지를 보내세요. 입력별 비교는 여러 AI 영상 샷에서 캐릭터 일관성 유지하기에 있으며, 똑같은 모습을 보장한다고 문서화된 입력은 없습니다. Image API는 스틸을 서명된 URL로 반환하므로, 승인한 스틸을 프레임으로 보내기 전에 공개 HTTPS URL에 호스팅하세요.
AI 스토리 영상에서 캐릭터는 어떻게 말하나요?
별도의 립싱크 단계를 거칩니다. Sume 문서에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않으며, 문서는 카메라 앞에서 말하는 모든 샷을 VEED Fabric 1.0으로 안내합니다. 승인한 스틸에 TTS 오디오를 더하는 방식입니다. 대사는 TTS 1.0으로 음성을 만드세요. 최대 20,000자의 transcript, 아바타의 목소리나 voice.id를 보내고, 영어가 아닌 대사에는 language를 지정합니다. 그런 다음 스틸과 Sume에 호스팅된 오디오를 Fabric에 보내세요. 이 요청은 립싱크 API에서 다룹니다.
샷은 어떻게 하나로 합치나요?
Timeline 1.0이 렌더 한 번으로 합칩니다. 스토리 순서대로 놓은 클립 1–200개 아래에 1–1,800초의 오디오 스파인 하나를 깔고, 클립 사이에는 최대 1초의 페이드, 와이프, 슬라이드, 디졸브를 넣을 수 있습니다. 소리는 스파인에서 나오며, 현재 코드에서는 클립 자체의 오디오가 섞이지 않으므로, 대사도 각각 해당 말하는 클립이 시작하는 시점에 맞춰 스파인에 있어야 합니다. audio.parts[]는 내레이션 단락과 대사 같은 오디오 조각을 최대 20개까지 이어 틈 없는 스파인 하나로 만듭니다.
모든 URL은 Sume에 호스팅된 파일이어야 하며, 생성한 클립과 TTS 오디오는 Sume에 호스팅된 아티팩트로 반환됩니다. 요청은 롱폼 영상을 조립하는 방법에서 다루고, 생성한 샷 위에 내레이션을 까는 예는 얼굴 없는 영상 API에 있습니다.
Sume 에이전트가 스토리 영상 전체를 대신 만들어 줄 수 있나요?
여러분과 함께 단계를 진행할 수 있습니다. 에이전트 탭에서는 도구 호출이 아니라 결과물을 설명합니다. 에이전트가 모델을 고르고 비용을 쓰기 전에 먼저 물어보며, 스레드에 모든 아티팩트와 승인 기록이 남습니다. Sume 문서는 에이전트가 B-roll, 보이스오버, 타임라인 조립을 엮어 클립 하나로는 만들 수 없는, 바로 게시할 수 있는 영상을 만든다고 설명합니다. 직접 작성한 코드에서는 Agent Completions가 같은 브리프를 instruction으로 받으며, generation_spend_cap_usd가 필수입니다.
어떤 제한이 있나요?
- 생성 클립당 2–30초이며, Timeline 렌더당 출력은 최대 1,800초입니다.
- 모든 샷에서 캐릭터가 똑같아 보인다고 보장하는 입력은 없으므로, 샷을 잇기 전에 각 샷을 검토하세요.
- 말하는 얼굴에는 Fabric 같은 스틸+오디오 립싱크 단계가 필요합니다. 생성한 클립은 나중에 더한 목소리에 맞춰 립싱크하지 않습니다.
- Timeline은 Sume에 호스팅된 미디어만, Fabric은 Sume에 호스팅된 오디오만 받습니다.
- 모든 단계는 별도의 Job이며, API 요금에 나온 각각의 요율로 과금됩니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- 모바일 앱 광고 영상 생성 API: 크리에이터 데모와 엔드 카드
Sume API로 모바일 앱 광고를 만드세요. 앱 스크린샷으로 sume-mobile-app-ugc를 실행하고, 로고 엔드 카드를 더한 뒤, Timeline 1.0으로 두 클립을 이어 붙이면 됩니다.
- 여러 제품 사진을 AI 이미지 한 장으로 합치는 API
여러 제품 사진을 AI 이미지 한 장으로 합치려면 SKU마다 팩샷을 Sume의 sume-editorial-product-set Format에 첨부하거나 POST /v1/images로 보내세요.
- Format으로 제품 사진 한 장에서 마케팅 에셋 만들기
Sume로 제품 사진 한 장에서 마케팅 에셋을 만들려면 에셋마다 카탈로그 Format을 한 번씩 실행해 같은 팩샷을 첨부하고, 실행마다 멱등성 키와 지출 상한을 두세요.
- 개인화 영상 대량 제작: 레시피 하나, 사람마다 실행 하나
개인화 영상을 대량으로 만들려면 레시피 하나를 고정하고, 사람마다 정보를 입력으로 넘겨 요청당 최대 100명씩 묶은 뒤, ID로 영상을 다시 연결하세요.
작성자 Sume