AI로 설명 영상 만드는 방법: 두 가지 방식

AI로 설명 영상을 만들려면 대본을 비트로 나눈 뒤, 아바타가 진행하게 하거나 B-roll에 보이스오버를 입히세요. 더 긴 영상은 여러 파트를 이어 붙입니다.

읽는 시간 6분Sume
전체 글

설명 영상(익스플레이너 영상)을 만들려면 짧은 대본을 쓰고, 문제, 작동 방식, 다음에 할 일처럼 비트로 나눈 뒤, 비트마다 보여 줄 화면을 정하고, 보이스오버를 녹음하고, 자막과 음악을 넣어 비트를 하나로 편집하세요. Sume에서 AI로 만든다면 두 경로 중 하나를 고릅니다. 아바타 진행자가 4–60초 길이의 다중 장면 Avatar 1.0 영상 하나에서 비트를 말하게 하거나, 생성한 B-roll에 텍스트 음성 변환 보이스오버를 입혀 Timeline 1.0 렌더로 만드는 방식입니다. 더 긴 설명 영상은 여러 파트를 타임라인 하나에 이어 붙입니다.

이 글의 내용은 2026-09-27에 확인한 Sume의 아바타 영상 생성, Models 개요 (영문), Timeline 1.0, 영상 캡션 문서와 Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다. 각 방식은 별도의 글에서 다루며, 아래에 링크했습니다.

AI로 설명 영상을 만들 수 있나요?

네, 말하거나 그림으로 보여 주는 부분은 만들 수 있습니다. 목소리, 진행자, B-roll, 음악, 영상에 입힌 자막이 그렇습니다. 생성으로 얻을 수 없는 것은 실제 제품을 찍은 영상입니다. 생성한 클립은 묘사할 뿐 기록하지 않습니다. 화면 시연 영상은 여러분의 녹화 도구와 편집기에서 만듭니다. Timeline은 Sume에 호스팅된 파일만 받고, Sume의 공개 API에는 로컬 파일을 업로드하는 라우트가 없기 때문입니다.

설명 영상에는 진행자와 보이스오버 중 무엇을 써야 하나요?

시청자가 들으면서 무엇을 봐야 하는지에 따라 고르세요. 진행자는 카메라를 보고 말하는 설명 영상에 맞고, B-roll은 여러 가지를 보여 주는 설명 영상에 맞습니다.

아바타 영상 생성, 아바타 영상 프리뷰, Timeline 1.0, 영상 캡션, Sume API 레퍼런스 기준, 2026-09-27 확인.
항목아바타 진행자보이스오버와 B-roll
Job당 길이추정 4–60초, 장면 최대 20개렌더당 최대 1,800초
배경영상 전체에 공유 장면 하나슬롯마다 Sume에 호스팅된 아무 클립, 슬롯 최대 200개
목소리아바타 자체의 목소리, 현재 코드에서는 영어만TTS 1.0 음성, 다른 언어에는 language 지정
자막프리뷰에 저장했다가 generate-video에서 입힘TTS 단어 타이밍을 쓴 자막 Job

진행자 버전은 어떻게 만드나요?

script 하나 대신 비트를 순서 있는 video_inputs 장면으로 보내세요. 말하는 비트는 script를 담은 voice.type: "text"이고, 화면을 보여 주려고 멈추는 비트는 duration을 담은 voice.type: "silence"입니다. 현재 실행은 영상 하나에 아바타 하나를 지원하고 장면 배경이 공유 장면 하나로 해석되기를 기대하므로, 진행자가 비트마다 다른 스크린숏 앞에 설 수는 없습니다. 비트 중간에 B-roll을 보여 주려면 Sume API로 말하는 아바타 영상에 B-roll 넣기처럼 아바타의 목소리가 계속 나오는 동안 Timeline에서 컷어웨이하세요. 장면 필드는 다중 장면 아바타 영상 API에 나와 있습니다.

curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: explainer-presenter-001" \
  -d '{
    "avatar_handle": "acme",
    "aspect_ratio": "16:9",
    "video_inputs": [
      { "id": "problem", "voice": { "type": "text", "script": "Invoices get lost when nobody owns them." } },
      { "id": "visual", "voice": { "type": "silence", "duration": 3 } },
      { "id": "how", "voice": { "type": "text", "script": "Acme gives every invoice one owner and a reminder." } }
    ]
  }'

보이스오버 버전은 어떻게 만드나요?

TTS 1.0으로 대본의 음성을 만들고, POST /v1/videos로 비트마다 클립을 하나씩 생성한 뒤, Timeline 1.0 렌더 한 번으로 내레이션 위에 클립을 깔고 배경 음악을 더하세요. B-roll에는 말하는 사람을 넣지 마세요. Sume 문서에 따르면 영상 모델은 생성한 TTS나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않습니다. TTS 단어 타이밍으로 넣는 자막을 포함해 모든 호출은 얼굴 없는 영상 API에서 단계별로 설명합니다.

60초보다 긴 설명 영상은 어떻게 만드나요?

대본을 최대 60초 길이의 파트로 나누고 파트마다 영상을 만드세요. 자막은 파트가 짧을 때 파트마다 넣으세요. 현재 자막 Job은 60초보다 긴 소스를 거부합니다. 그런 다음 Timeline 1.0 렌더 한 번으로 파트를 이어 붙이세요. 현재 렌더의 소리는 오디오 스파인과 사운드트랙뿐이므로, 아바타 파트마다 POST /v1/audio-detach로 오디오를 추출해 그 파일들을 순서대로 audio.parts[](최대 20개)로 넘기고, 짝이 맞는 영상은 video[]에 넣으세요. 이어 붙이는 방법은 60초보다 긴 AI 아바타 영상을 만드는 방법에서 보여 줍니다.

제한은 무엇이고, 비용은 얼마인가요?

  • 현재 코드에서 Avatar 1.0은 영어만 말합니다. 다른 언어라면 language를 지정한 TTS 1.0으로 대본의 음성을 만든 뒤, VEED Fabric 1.0으로 진행자 스틸을 그 오디오에 립싱크하세요(립싱크 API).
  • Timeline과 미디어 도구는 이전 Sume 출력물처럼 워크스페이스의 media.sume.com 파일만 받습니다.
  • 아바타 영상은 품질 등급별로 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 내레이션은 1,000자당 $0.0475, 렌더는 건마다 출력 분당 $0.10로 나와 있으며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume