AI 아바타 인플루언서 만드는 법: 얼굴 하나, 목소리 하나
AI 인플루언서는 재사용 가능한 얼굴과 목소리 하나입니다. Sume 아바타를 한 번 만들고, 영상과 보이스오버에는 handle을, 새 사진에는 스틸을 재사용하세요.

AI 아바타 인플루언서를 만들려면 재사용 가능한 디지털 페르소나 하나를 만들고, 모든 게시물에 같은 얼굴과 목소리를 쓰세요. Sume에서는 텍스트 프롬프트, 프로필, 사진 중 하나로 아바타를 한 번 만들고 그 handle을 보관합니다. handle을 넣은 텍스트 음성 변환은 아바타의 목소리로 말하고, handle로 만든 말하는 영상과 립싱크 클립은 아바타의 얼굴을 쓰며, 아바타의 공개 스틸은 레퍼런스 이미지로 새 사진의 방향을 잡아 줄 수 있습니다.
Sume 관련 사실은 2026-09-27에 확인한 아바타 만들기, 아바타 영상 생성, Image API (영문), Sume API 레퍼런스에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 이 글은 페르소나를 만드는 방법을 다루며, 오디언스를 키우는 방법은 다루지 않습니다.
AI 인플루언서란 무엇인가요?
가상 크리에이터입니다. 사람 크리에이터처럼 사진, 말하는 영상, 광고에 등장하는 생성된 인물을 말합니다. 비슷하게 생긴 인물의 나열이 아니라 페르소나 하나가 되게 하는 것은 일관성, 즉 매번 같은 얼굴과 같은 목소리입니다. 출발점은 재사용 가능한 아바타입니다. 아이덴티티를 한 번 생성한 뒤에는, 이후의 모든 요청에서 인물을 다시 설명하는 대신 그 아바타를 가리키세요.
인플루언서의 외모는 어떻게 만드나요?
avatar_handle과 세 가지 입력 중 하나를 담아 POST /v1/avatar-1.0/generate를 보낸 다음 Job을 폴링하세요. 요청 예시는 재사용 가능한 AI 아바타 만들기에 있습니다. API 요금에 나온 생성 비용은 아바타당 $0.95이며, 기본적으로 5.5% 에이전트 수수료가 더해집니다.
- 프롬프트: 인물을 글로 설명합니다. 현재 코드에서 Sume는 입력한 텍스트에 "Realistic vertical smartphone portrait, natural daylight"를 덧붙이고 양식화된 일러스트는 피하도록 요청하므로, 프롬프트는 만화가 아니라 사실적인 인물 사진을 목표로 합니다.
- 프로필:
ethnicity(나열된 여덟 가지 값 중 하나),sex(male또는female), 20~80 사이의age. - 사진: 공개 HTTPS 이미지 URL.
- handle은 글자, 숫자, 밑줄, 마침표로 이루어진 2~30자이며, 마침표나 밑줄은 맨 앞이나 맨 뒤에 오거나 두 번 연속으로 올 수 없고,
sume_접두사는 Sume 자체 아바타용으로 예약되어 있습니다.
영상과 사진에서 인플루언서를 어떻게 재사용하나요?
아래의 모든 경로는 페르소나를 참조로 받습니다.
| 출력 | 호출 | 페르소나를 전달하는 값 |
|---|---|---|
| 말하는 영상 | POST /v1/avatar-1.0/talking-video | avatar_handle과 4–60초 스크립트. 현재 코드에서는 음성이 아바타의 목소리로 변환됨 |
| 보이스오버 | POST /v1/tts-1.0/generate | avatar_handle: Sume가 그 아바타의 목소리를 씀 |
| Sume에 호스팅된 오디오에 립싱크 | POST /v1/veed/fabric-1.0 | 아바타의 아이덴티티 스틸로 해석되는 avatar_handle. 목소리는 보낸 오디오 그대로 |
| 사진 | POST /v1/images | input_references에 넣은 아바타의 preview_image_url |
인플루언서와 닮은 사진은 어떻게 만드나요?
아바타의 preview_image_url(Sume에 호스팅된 공개 이미지)을 읽어 POST /v1/images에 레퍼런스 이미지로 넘기세요. 모델은 레퍼런스를 받는 것으로 고르세요. 문서에 따르면 ChatGPT Image 2.5(openai/gpt-image-2.5)는 최대 16장을 받고, input_references의 카탈로그 디스크립터가 {"min": 0, "max": 0}인 모델은 레퍼런스를 거부합니다. 반환되는 data[].url은 서명된 URL이므로, 보관할 이미지는 내려받으세요. 자세한 내용은 AI 이미지 캐릭터 일관성 유지하기에서 다룹니다.
Image 1.0은 "face-in-still ads"(스틸 속 얼굴 광고)용으로 여전히 avatar_handle을 직접 받지만, 문서에 "Retiring soon"(곧 은퇴)으로 표시되어 있으므로 새 작업은 /v1/images에서 하세요. Image 1.0과 Video 1.0에서 옮기기를 참고하세요.
인플루언서의 목소리는 어떻게 하나요?
목소리는 아바타와 함께 생깁니다. API 레퍼런스는 아바타마다 음성 준비 상태인 voice.status가 있다고 설명하며, handle을 넣은 텍스트 음성 변환은 그 목소리로 말합니다. 아바타 생성은 프롬프트, 프로필, 사진을 받으며, 음성 입력은 없습니다.
- 현재 코드에서 말하는 영상은 영어로만 말합니다. 클립 프롬프트에 "Spoken language: English only."라고 적혀 있습니다.
- 다른 언어라면 텍스트 음성 변환에
language를 지정하고, VEED Fabric 1.0으로 아바타를 그 오디오에 립싱크하세요. 다만 현재 코드에서 아바타 목소리는 영어로 클론된다는 점을 기억하세요. - 다른 목소리를 클론하거나 새로 만드는 일은 API가 아니라 Sume 앱에서 합니다. 앱의 Voices(보이스) 페이지에는 "Clone a voice or invent one from a prompt, then pin it in Agents chat with @."라고 적혀 있습니다.
- 현재 실행은 말하는 영상 하나당 해석된 아바타 하나를 지원하므로, 두 번째 페르소나와의 콜라보는 별도 Job으로 만들어야 합니다. AI 아바타 대화 영상을 참고하세요.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI로 설명 영상 만드는 방법: 두 가지 방식
AI로 설명 영상을 만들려면 대본을 비트로 나눈 뒤, 아바타가 진행하게 하거나 B-roll에 보이스오버를 입히세요. 더 긴 영상은 여러 파트를 이어 붙입니다.
- IVR(ARS) TTS: 메뉴 안내 멘트를 전화용 오디오 포맷으로
IVR 안내 멘트와 음성사서함 인사말을 TTS로 만드세요. 멘트마다 요청 하나를 보내고, 8 kHz μ-law나 A-law WAV, 또는 MP3나 다른 PCM으로 받습니다.
- Image-to-Video 제품 로고 왜곡: 프레임 vs 레퍼런스
Sume의 이미지로 영상 만들기 API에서 frame_images에 넣은 팩샷은 첫 프레임을 지정하고, input_references는 가이드 역할만 합니다. 추출한 스틸로 라벨을 확인하세요.
- 로고 애니메이션 API: 브랜드 마크를 아이덴트·엔드 카드로
Sume API로 로고 애니메이션을 만들려면 마크를 첨부해 sume-logo-motion-design을 호출하거나 첫 프레임으로 넣어 직접 움직이게 하고, 엔드 카드로 붙이세요.
작성자 Sume