내 목소리로 AI 보이스오버 만들기: 한 번 클론해 TTS에 재사용

내 목소리로 AI 보이스오버를 만들려면 Sume의 Voices 라이브러리에서 짧은 클립으로 목소리를 한 번 클론한 뒤, 그 ID를 TTS 음성으로 쓰세요.

읽는 시간 5분Sume
전체 글

내 목소리로 AI 보이스오버를 만들려면 짧은 녹음으로 목소리를 한 번 클론한 뒤, 대본을 음성으로 바꿀 때마다 그 클론을 음성으로 고르세요. 모든 대사를 녹음할 필요 없이 샘플 하나만 녹음하면 됩니다. 현재 Sume 앱에서는 에셋 → 보이스(Assets → Voices)에서 업로드하거나 녹음한 클립으로 목소리를 클론합니다. 그다음 그 음성의 voi_ ID를 POST /v1/tts-1.0/generate의 voice.id에 넣거나, Sume 에이전트 채팅에서 @로 그 음성을 태그하면 됩니다.

클론은 Sume 앱에서 하며, 공개 API에는 음성을 만드는 경로가 없습니다. 아래 앱 단계는 Sume 앱의 현재 코드에서, 음성 합성 관련 사실은 Sume API 레퍼런스의 TTS 1.0 스키마에서 가져왔으며, 2026-09-27에 확인했습니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다.

Sume에서 내 목소리는 어떻게 클론하나요?

  • 에셋 → 보이스를 열고 새로운 보이스 추가하기를 누른 다음, 목소리 클론하기(“Upload or record audio”, 오디오 업로드 또는 녹음)를 고르세요.
  • 음성 이름(필수)을 입력하고, 성별과 그 음성이 말하는 언어를 고르세요.
  • 클립을 업로드하거나 브라우저에서 녹음하세요. 한도는 아래 표에 있습니다.
  • 음성이 준비되면 더 보기 메뉴를 열고 ID 복사하기를 골라 voi_ ID를 복사하세요.
  • 내 목소리나 사용 허락을 받은 목소리만 클론하세요.
Sume 앱의 현재 코드와 Sume API 레퍼런스의 TTS 1.0 스키마 기준, 2026-09-27 확인.
입력현재 동작
업로드 형식wav, mp3, m4a, mp4, webm, ogg 중 하나
업로드 크기최대 20 MB
앱 내 녹음30초에서 멈춤
성별남성, 여성, 논바이너리 중 하나
언어16개 중 하나: en, ko, ja, zh, es, fr, de, pt, it, hi, nl, pl, ru, sv, tr, tl
TTS voice.idvoi_ 뒤에 hex 문자 32개

클론한 음성으로 보이스오버는 어떻게 만드나요?

그 ID를 voice.id로 보내세요. TTS 1.0은 Job이 큐에 들어가기 전에 Voices 라이브러리 ID를 저장된 음성으로 해석합니다. 현재 코드에서는 ID가 존재하지 않거나, 아직 준비되지 않았거나, 워크스페이스에서 쓸 수 없으면 400 invalid_voice_id로 실패하고 Job은 만들어지지 않습니다. 나머지 요청 필드는 텍스트 음성 변환 API에서 다룹니다.

현재 Sume 에이전트 채팅에서는 저장된 음성을 @로 태그하고 대사를 요청할 수 있습니다. 에이전트의 현재 지침은 그 턴의 음성 합성에 태그된 음성을 우선 쓰도록 되어 있습니다.

curl -X POST https://api.sume.com/v1/tts-1.0/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: promo-voiceover-v1" \
  -d '{
    "transcript": "Hi, I am the founder. Here is what we built this year.",
    "voice": { "id": "voi_…" },
    "language": "en"
  }'

클론한 목소리로 다른 언어도 말할 수 있나요?

한 번 더 확인하는 단계를 거치면 요청할 수 있습니다. 현재 각 음성에는 표에 있는 16개 언어 중 하나가 기록되고, 합성되는 음성의 언어는 TTS 요청의 language가 정합니다. language를 생략하면 영어가 기본값이므로, 영어가 아닌 대본에는 모두 지정하세요.

음성에 기록된 언어가 요청의 언어와 다르면, 현재 API는 Job을 만들거나 과금하기 전에 409 tts_voice_language_mismatch로 응답하며, 메시지에서 발음이 부자연스러울 수 있다고 경고합니다. 확인했다면 같은 요청을 confirm_language_mismatch: true와 함께 다시 보내세요. 확인해도 음성이나 언어는 바뀌지 않습니다.

클론한 목소리로 음성을 만들면 비용은 얼마인가요?

클론한 목소리로 만드는 음성도 다른 TTS Job과 똑같이 과금됩니다. 요금은 1,000자당 $0.0475이고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 공백과 문장 부호도 글자 수에 포함되며, 요청당 최대 20,000자까지 보낼 수 있습니다. 출력은 기본적으로 MP3이며, output_format을 설정하면 WAV로 받을 수 있습니다.

그 목소리를 얼굴에 입히려면 스틸 이미지를 TTS 오디오에 립싱크하세요. 이 방법은 AI로 나를 클론하는 방법에서 다룹니다.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume