AI 아바타 스크립트: 60초에 몇 단어가 들어가나요?
AI 아바타 스크립트는 아바타가 말하는 대사입니다. 현재 Sume의 추정기는 초당 2.8단어로 세므로, 60초에는 약 165단어가 들어갑니다.
AI 아바타 스크립트는 아바타가 그대로 말할 텍스트이므로, 소리 내어 말하기 좋게 쓰고 도구의 길이 제한에 맞춰 줄여야 합니다. Sume에서 말하는 영상 하나는 Sume가 추정한 길이가 4~60초인 스크립트를 받으며, 현재 코드는 초당 2.8단어로 셉니다. Sume 자체 테스트에서 끊김 없이 한 덩어리로 이어진 165단어는 정확히 60초로 추정되고, 169단어는 64초로 추정되어 거부됩니다.
4–60초 범위는 2026-09-27에 확인한 아바타 영상 생성 문서에서 가져왔습니다. 단어 속도, 세는 규칙, 영어 전용 규칙은 Sume의 현재 코드에서 확인한 것이므로, 문서로 약속된 내용이 아니라 지금의 동작을 설명합니다. 일 분을 넘는 분량은 60초보다 긴 AI 아바타 영상을 만드는 방법을 참고하세요.
60초 AI 아바타 영상에는 몇 단어가 들어가나요?
약 165단어지만, 고정된 수는 아닙니다. 초당 2.8단어로 계산하면 60초는 168단어입니다. 하지만 Sume는 스크립트 전체를 한꺼번에 나누어 계산하지 않습니다. 현재 코드는 스크립트를 클립으로 자르고, 클립마다 단어 수를 2.8로 나눈 값을 초 단위로 올림해 길이를 추정하며, 모든 클립을 최소 4초, 최대 12초로 계산한 뒤 클립 길이를 모두 더합니다. 합계가 4~60초(양 끝 포함)에 들어오면 요청이 접수됩니다.
Sume 자체 테스트를 보면 합계가 어떻게 달라지는지 알 수 있습니다.
| 스크립트 | 추정 길이 | 결과 |
|---|---|---|
| 1단어 | 4초 | 접수됨. 클립은 4초 미만으로 계산되지 않음. |
| 끊김 없이 한 덩어리로 이어진 165단어 | 60초 | 접수됨. |
| 끊김 없이 한 덩어리로 이어진 169단어 | 64초 | 400 invalid_request로 거부됨. |
| 열 문장으로 된 170단어 | 70초 | 거부됨. |
한도는 왜 정확한 단어 수로 정해지지 않나요?
올림이 클립 단위로 일어나고, 클립은 길이뿐 아니라 문장에 따라서도 달라지기 때문입니다. 코드는 ., !, ?(그리고 전각 。, !, ?)에서 문장을 나누고, 공백과 줄바꿈에서 단어를 나눕니다. 짧은 문장들은 클립 하나로 묶고, 길게 이어진 단어 덩어리는 균형 잡힌 여러 부분으로 자릅니다. 그래서 길이가 거의 같은 두 스크립트도 추정 길이가 꽤 다를 수 있습니다. 열 문장으로 쓴 170단어 테스트 스크립트는 70초로 추정되지만, 끊김 없이 한 덩어리로 이어진 169단어는 64초로 추정됩니다.
- 한도에 가까우면 단어 수만으로는 스크립트가 들어갈지 알 수 없습니다. 일단 보내 보고, Sume가 거부하면 줄이세요.
- 다중 장면 요청은 모든 장면이 같은 4–60초 범위를 나눠 쓰며, 현재 코드에서 무음 장면은 최소한 그 장면의
duration만큼 계산됩니다. AI 아바타 영상용 UGC 광고 스크립트는 이 범위 안에서 훅, 무음 비트, 콜투액션의 길이를 배분합니다.
스크립트가 너무 길면 어떻게 되나요?
Sume는 요청을 400 invalid_request로 거부합니다. 현재 코드에서는 오류의 details.errors에 있는 script 항목이 "Avatar video script is estimated at 64 seconds; maximum is 60 seconds. Shorten the script or split it into multiple videos."처럼 추정 길이를 알려 줍니다. 문서도 같은 두 가지 방법, 즉 스크립트를 줄이거나 여러 Job으로 나누는 방법을 안내합니다. 나눈 파트를 나중에 이어 붙이는 방법은 60초보다 긴 AI 아바타 영상을 만드는 방법에서 설명합니다.
현재 코드에는 사실상 최소 길이가 없습니다. 빈 스크립트는 거부되지만, 단어 하나만으로도 범위의 하한인 4초로 추정됩니다.
스크립트는 어떤 언어와 표현으로 써야 하나요?
현재 코드 기준으로는 영어입니다. 각 클립에 쓰이는 프롬프트에는 "Spoken language: English only."라는 문구가 있고, 번역하거나 바꿔 말하거나 즉흥으로 만들거나 덧붙이는 것 없이 "only the exact English dialogue"(정확한 영어 대사만)를 요구합니다. 그래서 스크립트는 다음과 같이 써야 합니다.
- 말할 단어만 쓰세요.
script에 넣은 내용은 모두 대사로 영상 모델에 전달되므로, "(smiles)" 같은 메모도 단어로 계산되고 대사의 일부가 됩니다. - 배경 설정은 스크립트가 아니라 요청의
scene프롬프트나 사진에 넣으세요. - 다른 언어로 말하게 하려면 TTS 1.0으로 오디오를 만들고(
language필드는 Sume API 레퍼런스에 문서화되어 있습니다), 립싱크 API 가이드에서처럼 VEED Fabric 1.0으로 스틸 이미지를 그 오디오에 립싱크하세요.
스크립트는 요청의 어디에 넣나요?
POST /v1/avatar-1.0/talking-video에 준비된 아바타의 avatar_handle과 함께 script로 보내세요. 요청에는 script와 video_inputs 중 정확히 하나가 들어갑니다. 장면별로 나눈 버전은 다중 장면 아바타 영상 API에서, 품질·화면 비율·장면 옵션은 말하는 아바타 영상 API에서 다룹니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- 토킹 헤드 영상 배경 음악: 목소리 아래에 까는 BGM
배경 음악은 목소리보다 충분히 작게 까세요. Sume 아바타 영상 프리뷰에는 볼륨 0.05~0.4의 사운드트랙을 넣을 수 있고, Timeline은 페이드와 더킹을 더합니다.
- 토킹 헤드 영상 포맷: 화면 비율, 크기, 파일 형식
토킹 헤드 영상의 포맷은 재생되는 곳에 따라 세로, 16:9, 정사각형, 4:5로 정해집니다. Sume 아바타 영상은 다섯 가지 비율의 720p MP4로 나옵니다.
- 토킹 헤드 영상 API: 아바타 vs 립싱크 vs 모션 컨트롤
가진 입력으로 Sume 토킹 헤드 경로를 고르세요. 스크립트와 준비된 아바타, 직접 만든 오디오와 스틸, 또는 드라이빙 영상입니다. 제한과 초당 가격도 다룹니다.
- Sume Avatar 1.0을 소개합니다
Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.
작성자 Sume