온라인 강의용 AI 아바타: 수업 영상 만들고 업데이트하기
AI 아바타를 온라인 강의의 강사로 쓰세요. 재사용 아바타 하나로 섹션마다 짧은 말하는 영상을 만들고, 자막을 넣어 수업마다 Timeline으로 한 번 이어 붙입니다.
AI 아바타는 수업 하나하나를 짧은 발표자 세그먼트로 구성하면 온라인 강의의 강사로 쓸 수 있습니다. Sume에서는 강의 전체에 쓸 재사용 가능한 아바타를 하나 만들고, 섹션마다 최대 60초 길이의 말하는 영상을 하나씩 렌더링하고, 세그먼트마다 자막을 넣은 뒤, 수업 하나의 세그먼트들을 Timeline 1.0으로 이어 붙이세요. 섹션 내용이 바뀌면 그 세그먼트만 다시 렌더링하고 수업을 다시 이어 붙이면 됩니다.
Sume 관련 사실은 2026-09-27에 확인한 아바타 영상 생성, Timeline 1.0, Generation admission 문서에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 이어 붙이기 요청 자체는 60초보다 긴 AI 아바타 영상을 만드는 방법에서 다룹니다.
강의 전체에 쓸 AI 강사는 어떻게 준비하나요?
강사는 POST /v1/avatar-1.0/generate로 한 번만 만들고, 고정된 avatar_handle을 주세요. 프롬프트, 특성을 담은 프로필, 레퍼런스 사진 중 하나로 만들 수 있습니다. 문서는 앱이 생성된 id 대신 간단한 이름을 재사용하도록 고정 handle을 권장합니다. 아바타 생성 비용은 아바타당 $0.95이며, 요청은 재사용 가능한 AI 아바타 만들기에 나와 있습니다.
그런 다음 강의 전체의 화면을 고정하세요. 모든 세그먼트에 같은 avatar_handle, scene, aspect_ratio, quality를 보냅니다. 영상 하나는 아바타 하나와 공유 장면 하나로 해석되므로, 모든 수업의 scene으로 교실 프롬프트 하나나 촬영 세트 사진 한 장을 고르세요.
수업 하나를 아바타 세그먼트로 어떻게 나누나요?
수업의 섹션마다 POST /v1/avatar-1.0/talking-video Job을 하나씩 만드세요.
- Sume는 추정 길이가 4–60초인 스크립트를 받습니다. 현재 추정은 초당 2.8단어로 세고 클립 단위로 올림하므로, 섹션 하나에는 최대 약 165단어가 들어갑니다. 계산 방식은 60초에 들어가는 단어 수에서 설명합니다.
- 아래 예시처럼 각
Idempotency-Key에 강의, 수업, 섹션, 버전을 넣으세요. - 수업 하나의 세그먼트는 한꺼번에 제출하세요. 동시에 처리되는 개수는 워크스페이스의
concurrency_limit이 정합니다. 이를 넘는 유효한 Job은queued로 기다리며, 큐까지 가득 찼을 때만 제출이429 queue_full로 실패합니다. - 이어 붙이기 전에
POST /v1/video-captions나, 아바타 영상 프리뷰에 저장한 자막으로 세그먼트마다 자막을 넣으세요. 현재 캡션 Job은 60초보다 긴 소스를 거부하므로 완성된 수업에는 쓸 수 없습니다. - 자막을 넣은 세그먼트는 수업마다
POST /v1/timeline-1.0/render하나로 이어 붙이세요. 오디오는POST /v1/audio-detach로 분리한 세그먼트 자체의 오디오를 씁니다.
curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: course-101-lesson-02-section-03-v1" \
-d '{
"avatar_handle": "course_instructor",
"script": "In this section, we set up the project folder and run the first build.",
"scene": { "type": "prompt", "prompt": "Bright classroom, whiteboard behind the presenter" },
"aspect_ratio": "16:9",
"quality": "plus"
}'수업 전체를 다시 만들지 않고 섹션 하나만 어떻게 수정하나요?
세그먼트 하나를 바꾸고 그 수업의 렌더만 다시 만드세요.
- 바뀐 섹션은 새 스크립트로,
…-section-03-v2같은 새 키를 붙여 다시 렌더링하세요. 문서는 같은 작업과 페이로드에만 키를 재사용하라고 안내하며, 같은 키에 바뀐 본문을 보내면409 idempotency_conflict가 돌아옵니다. - 첫 버전 때와 마찬가지로 새 세그먼트에 자막을 넣고 오디오를 분리하세요.
- 예전 세그먼트와 오디오 자리에 새 세그먼트와 오디오를 넣고, 바뀌지 않은 세그먼트는 그대로 재사용해 수업을 다시 렌더링하세요. 길이가 달라졌다면 뒤쪽 슬롯의
start값을 그에 맞게 옮기세요. 강의 전체가 아니라 그 수업의 Timeline 렌더만 다시 실행됩니다.
어떤 제한이 있나요?
구성 요소마다 상한이 따로 있습니다.
- 현재 코드에서는 영어 음성만 지원합니다. 클립 프롬프트가 영어를 요청하고, 아바타 목소리도 영어로 복제됩니다. 다른 언어로 된 강의라면
language를 지정한 TTS 1.0으로 음성을 만든 뒤 VEED Fabric 1.0으로 립싱크하는 경로를 쓰세요. - Timeline은 워크스페이스의
media.sume.com파일만 받고 에셋 업로드 라우트는 공개 API에 드러나 있지 않으므로, 직접 만든 슬라이드나 화면 녹화는 이 방법으로 넣을 수 없습니다. audio.parts[]는 파일을 최대 20개까지 받으므로, 이 방식으로는 수업 렌더 하나에 세그먼트를 최대 20개까지 이어 붙일 수 있습니다.
| 구성 요소 | 한도 |
|---|---|
| 세그먼트 하나 | 추정 4–60초, 아바타 하나, 공유 장면 하나. |
| 형태와 크기 | 1:1, 3:4, 9:16(기본값), 4:3, 16:9 중 하나. resolution은 현재 720p. |
| 캡션 Job 하나 | 들리는 음성이 있는 공개 HTTPS 영상, 현재 최대 60초. |
| 수업 렌더 하나 | 오디오 1–1,800초와 슬롯 1–200개, 모두 Sume에 호스팅된 파일. |
AI 아바타 강의 영상의 비용은 얼마인가요?
세그먼트는 품질 등급별로 영상 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 기본 plus 등급에서 10분짜리 수업의 아바타 영상 비용은 $147.00입니다. 수업 렌더는 건마다 출력 분당 $0.10로 나와 있고, 캡션 Job은 최대 60초 클립 하나에 고정 금액을 예약하며 금액은 GET /v1/catalog에 나와 있습니다. 이 모든 항목에는 기본적으로 5.5% 에이전트 수수료가 더해지며, 수정할 때는 새 세그먼트, 그 세그먼트의 자막과 오디오 분리, 해당 수업의 렌더만 다시 과금됩니다. 분당 요금표는 AI 아바타 영상 요금에 있습니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- PowerPoint 발표용 말하는 AI 아바타: 슬라이드별 클립
PowerPoint용 말하는 아바타 발표자를 만드세요. 슬라이드마다 최대 60초짜리 Sume 클립을 슬라이드에 맞춰 16:9나 4:3으로 만들고 MP4로 삽입합니다.
- YouTube 영상용 AI 아바타: Shorts와 롱폼 만들기
YouTube 영상에 AI 아바타를 쓰는 방법입니다. Shorts는 최대 60초의 9:16 말하는 영상 하나로, 롱폼은 16:9 세그먼트를 영상 하나로 이어 붙여 만듭니다.
- AI 아바타 언어 튜터: 천천히 말하고 자막이 있는 레슨 영상
AI 아바타 언어 튜터 영상 만들기: 레슨 문장마다 TTS 1.0으로 천천히 읽히고, Fabric으로 튜터 아바타를 립싱크한 뒤, 클립마다 자막을 입히세요.
- AI 책 표지 생성기: 1600×2560 Kindle 전자책 표지
Amazon KDP는 전자책 표지로 높이 2,560픽셀, 너비 1,600픽셀을 권장합니다. Sume의 ChatGPT Image 2.5는 1600 × 2560을 정확히 받으며, 제목과 저자명은 직접 넣으세요.
작성자 Sume