YouTube 영상용 AI 아바타: Shorts와 롱폼 만들기
YouTube 영상에 AI 아바타를 쓰는 방법입니다. Shorts는 최대 60초의 9:16 말하는 영상 하나로, 롱폼은 16:9 세그먼트를 영상 하나로 이어 붙여 만듭니다.
YouTube 영상에 AI 아바타를 쓰려면 아바타를 한 번 만들고, 스크립트를 읽게 한 다음, 영상마다 형식에 맞는 형태로 렌더링하세요. Shorts는 세로 9:16, 일반 롱폼 영상은 16:9입니다. YouTube는 최대 3분 길이의 정사각형이나 세로 업로드를 Shorts로 분류하므로, 롱폼 영상에는 더 넓은 프레임이 필요합니다. Sume에서는 최대 60초의 9:16 말하는 영상 하나가 Shorts 영상 하나가 될 수 있고, 롱폼 영상은 16:9 세그먼트를 최대 30분 길이의 파일 하나로 이어 붙여 만듭니다.
YouTube 규칙은 2026-09-27에 확인한 YouTube Shorts 업로드하기와 삼 분 길이 YouTube Shorts 이해하기에서 인용했습니다. Sume 관련 사실은 아바타 영상 생성, Timeline 1.0, Sume API 레퍼런스에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다.
YouTube 채널용 AI 아바타는 어떻게 만드나요?
진행자는 POST /v1/avatar-1.0/generate로 한 번만 만들고, 모든 영상에 함께 보낼 고정된 avatar_handle을 주세요. 텍스트 프롬프트, 특성을 담은 프로필, 레퍼런스 사진 중 하나로 만들 수 있습니다. 문서는 앱이 생성된 id 대신 간단한 이름을 재사용하도록 고정 handle을 권장합니다. 아바타 생성 비용은 아바타당 $0.95입니다.
AI 아바타로 YouTube Shorts 영상은 어떻게 만드나요?
aspect_ratio: "9:16"을 담아 POST /v1/avatar-1.0/talking-video를 한 번 보내세요. 이 비율은 기본값이기도 합니다. Sume는 추정 길이가 4–60초인 스크립트를 받습니다. 현재 추정은 초당 2.8단어로 세고 클립 단위로 올림하므로, 60초짜리 Shorts 영상에는 최대 약 165단어가 들어갑니다.
- 60초보다 길고 YouTube 상한인 3분 이내인 Shorts 영상이라면 9:16 세그먼트를 최대 세 개 렌더링하고, 아래 롱폼 단계처럼 세그먼트에서 분리한 오디오 위에 180초 이하의 Timeline 렌더 하나로 이어 붙이세요. Timeline의 기본 프레임 1080×1920은 이미 세로입니다.
- 완료된 결과에는 공개
media.sume.com영상 아티팩트가 포함될 수 있으며, MP4를 YouTube에 올리는 일은 직접 해야 합니다. 파일을 YouTube 권장 설정과 비교한 내용은 YouTube Shorts 영상 규격에 있습니다.
curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: channel-short-0927" \
-d '{
"avatar_handle": "channel_host",
"script": "Three budgeting mistakes almost everyone makes, and one easy fix for each.",
"aspect_ratio": "9:16",
"quality": "plus"
}'AI 아바타로 YouTube 롱폼 영상은 어떻게 만드나요?
롱폼 영상은 최대 1,800초 길이의 POST /v1/timeline-1.0/render 하나입니다. 기본 프레임이 1080×1920이므로 output.width를 1920으로, output.height를 1080으로 설정하세요. 영상 소재는 다음 두 가지 방법 중 하나로 만듭니다.
- 아바타 세그먼트: 각각 최대 60초인 16:9 말하는 영상을 같은
avatar_handle,scene,quality로 만들고, 세그먼트에서 분리한 오디오 위에 이어 붙입니다. 요청은 60초보다 긴 AI 아바타 영상을 만드는 방법에 나와 있습니다. - 내레이션과 립싱크:
POST /v1/tts-1.0/generate로 아바타의 목소리(목소리가 준비되면 그 아바타의avatar_handle)로 스크립트를 읽게 하고, 오디오를 파트로 나눈 뒤,POST /v1/veed/fabric-1.0으로 파트마다 스틸을 립싱크합니다. Job 하나는 Sume에 호스팅된 오디오를 최대 300초, 10 MB까지 받습니다. 나누는 과정은 긴 영상 립싱크하기에서 단계별로 설명합니다. - 클립의 형태가 다른 슬롯은
fit에 따라 배치됩니다. 값은cover(기본값),contain,stretch,blur입니다.
어떤 제한이 있나요?
영상마다 다음 상한에 맞춰 계획하세요.
- 현재 코드에서 아바타 말하는 영상은 영어 음성만 지원합니다. 클립 프롬프트가 영어를 요청하고, 아바타 목소리도 영어로 복제됩니다. 다른 언어라면 립싱크 경로를 쓰고 TTS의
language를 설정하세요. - 자막은 조각 단위로 넣습니다. 현재 캡션 Job은 60초보다 긴 소스를 거부하므로, 이어 붙이기 전에 아바타 세그먼트마다 자막을 넣으세요. 그보다 긴 립싱크 클립은 Job 하나로 자막을 넣을 수 없습니다.
- 아바타 영상의
resolution은 현재720p이며, 이어 붙인 파일의 프레임은 Timeline이 정합니다.
| 구성 요소 | 한도 |
|---|---|
| YouTube Shorts 영상 | 최대 3분, 정사각형 또는 세로. |
| 아바타 영상 하나 | 추정 4–60초. 기본값 9:16, 롱폼은 16:9. |
| 립싱크 클립 하나 | Sume에 호스팅된 오디오 1–300초, 최대 10 MB. |
| Timeline 렌더 하나 | 1–1,800초, 슬롯 1–200개. |
AI 아바타 YouTube 영상의 비용은 얼마인가요?
아바타 영상은 품질 등급별로 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 기본 plus 등급에서 60초짜리 Shorts 영상은 $14.70, 롱폼 아바타 영상 10분은 $147.00입니다. 이어 붙이기는 출력 분당 $0.10로 나와 있습니다. 립싱크 경로에서는 내레이션이 1,000자당 $0.0475, Fabric이 오디오 초당(720p) $0.1875입니다. 각 항목에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI 아바타 언어 튜터: 천천히 말하고 자막이 있는 레슨 영상
AI 아바타 언어 튜터 영상 만들기: 레슨 문장마다 TTS 1.0으로 천천히 읽히고, Fabric으로 튜터 아바타를 립싱크한 뒤, 클립마다 자막을 입히세요.
- AI 책 표지 생성기: 1600×2560 Kindle 전자책 표지
Amazon KDP는 전자책 표지로 높이 2,560픽셀, 너비 1,600픽셀을 권장합니다. Sume의 ChatGPT Image 2.5는 1600 × 2560을 정확히 받으며, 제목과 저자명은 직접 넣으세요.
- AI 북트레일러 만들기: 책 소개글과 표지를 영상으로
AI 북트레일러는 책 소개글과 표지를 짧은 영상으로 만듭니다. 내레이션, 표지로 끝나는 분위기 샷, 음악, 화면에 띄운 제목으로 구성됩니다.
- AI 색칠공부 도안 생성기: 프롬프트나 사진으로 만들기
용지에 맞는 세로 크기로, 음영 없이 흰 바탕에 검은 윤곽선만 그려 달라고 요청하세요. 사진을 레퍼런스로 보내면 색칠공부 도안으로 바꿀 수 있습니다.
작성자 Sume