온라인 강의용 AI 아바타: 수업 영상 만들고 업데이트하기

AI 아바타를 온라인 강의의 강사로 쓰세요. 재사용 아바타 하나로 섹션마다 짧은 말하는 영상을 만들고, 자막을 넣어 수업마다 Timeline으로 한 번 이어 붙입니다.

읽는 시간 5분Sume
전체 글

AI 아바타는 수업 하나하나를 짧은 발표자 세그먼트로 구성하면 온라인 강의의 강사로 쓸 수 있습니다. Sume에서는 강의 전체에 쓸 재사용 가능한 아바타를 하나 만들고, 섹션마다 최대 60초 길이의 말하는 영상을 하나씩 렌더링하고, 세그먼트마다 자막을 넣은 뒤, 수업 하나의 세그먼트들을 Timeline 1.0으로 이어 붙이세요. 섹션 내용이 바뀌면 그 세그먼트만 다시 렌더링하고 수업을 다시 이어 붙이면 됩니다.

Sume 관련 사실은 2026-09-27에 확인한 아바타 영상 생성, Timeline 1.0, Generation admission 문서에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 이어 붙이기 요청 자체는 60초보다 긴 AI 아바타 영상을 만드는 방법에서 다룹니다.

강의 전체에 쓸 AI 강사는 어떻게 준비하나요?

강사는 POST /v1/avatar-1.0/generate로 한 번만 만들고, 고정된 avatar_handle을 주세요. 프롬프트, 특성을 담은 프로필, 레퍼런스 사진 중 하나로 만들 수 있습니다. 문서는 앱이 생성된 id 대신 간단한 이름을 재사용하도록 고정 handle을 권장합니다. 아바타 생성 비용은 아바타당 $0.95이며, 요청은 재사용 가능한 AI 아바타 만들기에 나와 있습니다.

그런 다음 강의 전체의 화면을 고정하세요. 모든 세그먼트에 같은 avatar_handle, scene, aspect_ratio, quality를 보냅니다. 영상 하나는 아바타 하나와 공유 장면 하나로 해석되므로, 모든 수업의 scene으로 교실 프롬프트 하나나 촬영 세트 사진 한 장을 고르세요.

수업 하나를 아바타 세그먼트로 어떻게 나누나요?

수업의 섹션마다 POST /v1/avatar-1.0/talking-video Job을 하나씩 만드세요.

  • Sume는 추정 길이가 4–60초인 스크립트를 받습니다. 현재 추정은 초당 2.8단어로 세고 클립 단위로 올림하므로, 섹션 하나에는 최대 약 165단어가 들어갑니다. 계산 방식은 60초에 들어가는 단어 수에서 설명합니다.
  • 아래 예시처럼 각 Idempotency-Key에 강의, 수업, 섹션, 버전을 넣으세요.
  • 수업 하나의 세그먼트는 한꺼번에 제출하세요. 동시에 처리되는 개수는 워크스페이스의 concurrency_limit이 정합니다. 이를 넘는 유효한 Job은 queued로 기다리며, 큐까지 가득 찼을 때만 제출이 429 queue_full로 실패합니다.
  • 이어 붙이기 전에 POST /v1/video-captions나, 아바타 영상 프리뷰에 저장한 자막으로 세그먼트마다 자막을 넣으세요. 현재 캡션 Job은 60초보다 긴 소스를 거부하므로 완성된 수업에는 쓸 수 없습니다.
  • 자막을 넣은 세그먼트는 수업마다 POST /v1/timeline-1.0/render 하나로 이어 붙이세요. 오디오는 POST /v1/audio-detach로 분리한 세그먼트 자체의 오디오를 씁니다.
curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: course-101-lesson-02-section-03-v1" \
  -d '{
    "avatar_handle": "course_instructor",
    "script": "In this section, we set up the project folder and run the first build.",
    "scene": { "type": "prompt", "prompt": "Bright classroom, whiteboard behind the presenter" },
    "aspect_ratio": "16:9",
    "quality": "plus"
  }'

수업 전체를 다시 만들지 않고 섹션 하나만 어떻게 수정하나요?

세그먼트 하나를 바꾸고 그 수업의 렌더만 다시 만드세요.

  • 바뀐 섹션은 새 스크립트로, …-section-03-v2 같은 새 키를 붙여 다시 렌더링하세요. 문서는 같은 작업과 페이로드에만 키를 재사용하라고 안내하며, 같은 키에 바뀐 본문을 보내면 409 idempotency_conflict가 돌아옵니다.
  • 첫 버전 때와 마찬가지로 새 세그먼트에 자막을 넣고 오디오를 분리하세요.
  • 예전 세그먼트와 오디오 자리에 새 세그먼트와 오디오를 넣고, 바뀌지 않은 세그먼트는 그대로 재사용해 수업을 다시 렌더링하세요. 길이가 달라졌다면 뒤쪽 슬롯의 start 값을 그에 맞게 옮기세요. 강의 전체가 아니라 그 수업의 Timeline 렌더만 다시 실행됩니다.

어떤 제한이 있나요?

구성 요소마다 상한이 따로 있습니다.

  • 현재 코드에서는 영어 음성만 지원합니다. 클립 프롬프트가 영어를 요청하고, 아바타 목소리도 영어로 복제됩니다. 다른 언어로 된 강의라면 language를 지정한 TTS 1.0으로 음성을 만든 뒤 VEED Fabric 1.0으로 립싱크하는 경로를 쓰세요.
  • Timeline은 워크스페이스의 media.sume.com 파일만 받고 에셋 업로드 라우트는 공개 API에 드러나 있지 않으므로, 직접 만든 슬라이드나 화면 녹화는 이 방법으로 넣을 수 없습니다.
  • audio.parts[]는 파일을 최대 20개까지 받으므로, 이 방식으로는 수업 렌더 하나에 세그먼트를 최대 20개까지 이어 붙일 수 있습니다.
아바타 영상 생성, 영상 캡션, Timeline 1.0 기준, 2026-09-27 확인.
구성 요소한도
세그먼트 하나추정 4–60초, 아바타 하나, 공유 장면 하나.
형태와 크기1:1, 3:4, 9:16(기본값), 4:3, 16:9 중 하나. resolution은 현재 720p.
캡션 Job 하나들리는 음성이 있는 공개 HTTPS 영상, 현재 최대 60초.
수업 렌더 하나오디오 1–1,800초와 슬롯 1–200개, 모두 Sume에 호스팅된 파일.

AI 아바타 강의 영상의 비용은 얼마인가요?

세그먼트는 품질 등급별로 영상 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 기본 plus 등급에서 10분짜리 수업의 아바타 영상 비용은 $147.00입니다. 수업 렌더는 건마다 출력 분당 $0.10로 나와 있고, 캡션 Job은 최대 60초 클립 하나에 고정 금액을 예약하며 금액은 GET /v1/catalog에 나와 있습니다. 이 모든 항목에는 기본적으로 5.5% 에이전트 수수료가 더해지며, 수정할 때는 새 세그먼트, 그 세그먼트의 자막과 오디오 분리, 해당 수업의 렌더만 다시 과금됩니다. 분당 요금표는 AI 아바타 영상 요금에 있습니다.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume