AI로 나를 클론하는 방법: 내 얼굴과 내 목소리
AI로 나를 클론하려면 내 얼굴 사진과 내 목소리 클론을 짝지으세요. Sume에서는 목소리를 클론하고, TTS 1.0으로 말하게 한 뒤, Fabric으로 립싱크합니다.

AI로 나를 클론하려면 내 목소리와 내 얼굴, 두 가지를 복제합니다. 목소리 클론은 내 녹음으로 만든 합성 음성이고, 립싱크 모델은 그 목소리로 된 음성에 맞춰 내 사진을 움직이므로, 녹음한 적 없는 대사를 내가 말하는 것처럼 보입니다. Sume에서는 앱에서 목소리를 클론하고, TTS 1.0으로 대본을 읽힌 뒤, VEED Fabric 1.0으로 내 사진을 립싱크합니다.
이 글의 내용은 2026-09-27에 확인한 Sume의 아바타 만들기와 Models 개요 (영문) 문서, 그리고 Sume API 레퍼런스의 요청 스키마에서 가져왔습니다. 보이스(Voices) 단계와 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 나 자신이나 동의한 사람만 클론하세요.
나를 클론하려면 무엇이 필요한가요?
- 립싱크 단계에 쓸, 공개 HTTPS URL에 있는 내 얼굴 사진.
- 내 목소리 녹음. 현재 코드에서 클론 업로드는 최대 20 MB의 wav, mp3, m4a, mp4, webm, ogg 파일을 받고, 앱 안의 녹음기는 30초에서 멈춥니다.
- 음성 합성과 립싱크 Job에 쓸 Sume API 키.
내 목소리는 어떻게 클론하나요?
현재 Sume 앱에서는 에셋 → 보이스(Assets → Voices)를 열고 새로운 보이스 추가하기(Add a new voice)를 누른 다음 목소리 클론하기(Clone a voice)를 고르고, 오디오를 업로드하거나 녹음하세요. 음성에 이름을 붙이고 성별과 언어를 고르세요. ID 복사하기(Copy ID)로 voi_ ID를 얻을 수 있으며, 음성이 준비되면 TTS가 이 ID를 voice.id로 받습니다. 준비되기 전에는 현재 코드가 400 invalid_voice_id로 응답합니다.
클론은 API가 아니라 앱에서 합니다. 이 단계는 내 목소리로 AI 보이스오버 만들기에서 더 자세히 다룹니다.
내 클론이 새 대본을 말하게 하려면 어떻게 하나요?
Job 두 개로 대본을 내가 말하는 영상으로 만듭니다.
POST /v1/tts-1.0/generate로 대본을 음성으로 만드세요.transcript, 내voi_ID를 넣은voice.id, 그리고 대본이 영어가 아니면language를 보냅니다.timestamps.words: true를 넣으면 현재 코드가audio_url옆에 오디오의duration_seconds를 알려 줍니다.POST /v1/veed/fabric-1.0으로 립싱크하세요. 내 사진은image_url에, TTS 파일은audio_url에, 그 길이(1–300초)는duration_seconds에 넣습니다. 이 요청은 AI로 사진을 말하게 하는 방법에 나와 있습니다.
curl -X POST https://api.sume.com/v1/tts-1.0/generate \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: my-clone-line-001" \
-d '{
"transcript": "Quick update from me: the new plan starts on Monday.",
"voice": { "id": "voi_…" },
"language": "en",
"timestamps": { "words": true }
}'대신 나를 Avatar 1.0 아바타로 만들어야 하나요?
아바타를 만들면 재사용할 수 있는 handle이 생기지만, 아바타는 나를 그대로 복제한 것이 아닙니다.
- 사진으로 만들면 현재 코드는 "Photo of this person"이라는 프롬프트로 이미지 모델이 나를 다시 그리게 하므로, 아바타는 내 사진 그대로가 아니라 생성된 닮은 모습입니다.
- 음성도 생성됩니다. 현재 코드에서는 그 사람의 외모에 맞춰 샘플을 만든 뒤 영어로 클론합니다. Avatar 1.0 말하는 영상은 음성 필드를 받지 않으므로, 그 영상에는 내 목소리 클론을 쓸 수 없습니다.
- 현재 코드에서 사진은 PNG, JPEG, WebP, GIF 중 하나여야 하고, 가로와 세로가 모두 64 px 이상이며, 긴 변이 짧은 변의 6배 이하여야 합니다. 오류 메시지는 선명한 정면 이미지를 쓰라고 안내합니다.
- 생성 비용은 아바타당 $0.95입니다. 그래도 아바타와 내 목소리를 짝지을 수는 있습니다. TTS에는
voice.id만 보내고, Fabric에는 아바타의avatar_handle을 보내세요. 아바타와 그 아바타와 다른voice.id를 함께 담은 TTS 요청은400으로 실패합니다.
영상으로 디지털 트윈을 만들 수 있나요?
한 번에는 만들 수 없습니다. 아바타 생성은 프롬프트, 프로필, 사진을 받으며 영상은 받지 않습니다. 대신 녹화 영상을 두 번 활용하세요. 얼굴이 선명하게 나온 프레임을 사진으로 쓰고, 녹화 영상의 오디오를 위의 업로드 한도 안에 드는 클립으로 저장해 목소리를 클론하세요. 결과물은 녹화 영상 자체의 움직임이 아니라 그 프레임 하나를 바탕으로 움직입니다.
한도는 무엇이고, 비용은 얼마인가요?
TTS는 1,000자당 $0.0475, Fabric은 오디오 초당(720p) $0.1875이며, 각각 기본적으로 5.5% 에이전트 수수료가 더해집니다. Fabric은 오디오 길이를 초 단위로 올림해 셉니다.
| 구성 요소 | 위치 | 한도 |
|---|---|---|
| 목소리 클론 | Sume 앱, 에셋 → 보이스 | 최대 20 MB 업로드 또는 최대 30초 녹음. 공개 API 경로 없음 |
| 음성 | POST /v1/tts-1.0/generate | 요청당 최대 20,000자 |
| 말하는 영상 | POST /v1/veed/fabric-1.0 | 스틸 하나. Sume 미디어 호스트에 있는 1–300초 오디오, 최대 10 MB |
| 아바타(선택) | POST /v1/avatar-1.0/generate | 프롬프트, 프로필, 사진 중 하나. 영상 입력 없음 |
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI 립싱크 번역: 아바타 영상을 더빙하는 방법
Sume는 기존 영상의 입 모양을 다시 맞추지 못합니다. 아바타 영상을 더빙하려면 대본을 번역하고, TTS 1.0으로 읽힌 뒤, Fabric으로 얼굴을 립싱크하세요.
- 사진으로 영상 얼굴 바꾸기(페이스 스왑): 먼저 아바타 만들기
Sume의 Face Swap(베타)은 사진이 아니라 준비된 아바타를 받습니다. 먼저 사진으로 아바타를 만든 뒤, 4–15초 길이의 공개 영상에 그 얼굴을 입히세요.
- 부동산 중개사 AI 영상: 모든 매물에 아바타 하나로
부동산 중개사는 촬영 없이 AI 영상을 만들 수 있습니다. 사진으로 아바타를 한 번 만든 뒤, 매물 사진을 장면으로 삼아 영상마다 스크립트를 쓰세요.
- AI 아바타 스크립트: 60초에 몇 단어가 들어가나요?
AI 아바타 스크립트는 아바타가 말하는 대사입니다. 현재 Sume의 추정기는 초당 2.8단어로 세므로, 60초에는 약 165단어가 들어갑니다.
작성자 Sume