프롬프트 AI 음성 생성기: 화자를 설명해 목소리 만들기

프롬프트 기반 AI 음성 생성기는 글로 쓴 설명으로 새 목소리를 디자인합니다. Sume에서는 에셋 → 보이스에서 사람을 설명한 뒤, 그 목소리를 TTS에 쓰세요.

읽는 시간 5분Sume
전체 글

프롬프트 기반 AI 음성 생성기는 실제 녹음을 복제하는 대신, 화자가 누구이고 목소리가 어떻게 들리는지 같은 글 설명으로 새로운 합성 음성을 만듭니다. 그런 다음 그 음성을 다른 음성처럼 써서 대본을 읽게 합니다. 현재 Sume 앱에서는 에셋 → 보이스 → 목소리 텍스트로 생성하기(Assets → Voices → Generate a voice from text)가 20자 이상의 페르소나 설명을 받습니다. Sume가 페르소나를 만들고 5초 클립을 생성해 그 목소리를 클론하며, 각 결과는 TTS에 다시 쓸 수 있는 voi_ 음성이 됩니다.

음성 디자인은 Sume 앱과 앱의 에이전트에서 하며, 공개 API에는 음성을 만드는 경로가 없습니다. 아래 앱 동작은 Sume 앱의 현재 코드에서, 음성 합성 관련 사실은 Sume API 레퍼런스의 TTS 1.0 스키마에서 가져왔으며, 2026-09-27에 확인했습니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다.

Sume에서 설명으로 목소리를 어떻게 생성하나요?

  • 에셋 → 보이스를 열고 새로운 보이스 추가하기를 누른 다음, 목소리 텍스트로 생성하기를 고르세요. 이 옵션에는 “Describe a person. We invent a persona, generate a 5s clip, and clone that voice.”(사람을 설명하면 페르소나를 만들고 5초 클립을 생성해 그 목소리를 클론함)라고 적혀 있습니다.
  • 음성 이름을 정하고, 성별과 언어를 고르세요.
  • 페르소나 설명을 쓰세요. 설명이 20자가 되면 양식을 제출할 수 있습니다.
  • 현재 코드에서 에셋 양식은 설명 하나로 음성 3개를 만들므로, 하나씩 들어 보고 쓸 음성을 고를 수 있습니다.
  • 또는 Sume 에이전트 채팅에서 요청하세요. 예를 들어 보이스 페이지의 에이전트와 함께 제작하기 버튼에서 시작할 수 있습니다. 현재 채팅은 기본적으로 음성 1개를 만들고, 여러 후보를 요청하면 3개를 만들며, 결과를 에셋 → 보이스에 저장합니다. 팀원도 나중에 그 음성을 @로 태그할 수 있습니다.
Sume 앱의 현재 코드와 Sume API 레퍼런스의 TTS 1.0 스키마 기준, 2026-09-27 확인.
설정현재 동작
페르소나 설명20자 이상 2,000자 이하
설명당 음성 수에셋 양식에서 3개, 채팅에서는 기본 1개
샘플5초 클립, 이후 클론됨
성별남성, 여성, 논바이너리 중 하나
언어16개 중 하나: en, ko, ja, zh, es, fr, de, pt, it, hi, nl, pl, ru, sv, tr, tl
TTS voice.id그 음성의 voi_ ID

음성 프롬프트에는 무엇을 설명해야 하나요?

용도가 아니라 사람을 설명하세요. 양식에 있는 예시는 “A Korean man in his 20s. Usually overflowing with confidence. His voice is strong too — not husky, but bright and cheerful.”(20대 한국 남성, 평소 자신감이 넘치고 목소리에도 힘이 있지만 허스키하지 않고 밝고 쾌활함)입니다. 화자가 누구인지, 성격이 어떤지, 목소리 자체가 어떻게 들리는지를 담고 있습니다.

  • 아나운서나 진행자 음성이 필요하다면 그 일을 할 사람을 설명하세요. 나이, 기질, 목소리의 전달력을 적습니다.
  • 설명은 결과를 이끌지만 특정 억양이나 음높이를 보장하지는 않으므로, 고르기 전에 샘플을 들어 보세요.
  • 고른 언어는 음성에 기록됩니다. 나중에 그 음성으로 다른 언어를 말하게 하면, 현재 API는 먼저 한 번 더 확인하도록 멈춥니다.

생성한 음성을 TTS에서 어떻게 쓰나요?

음성의 더 보기 메뉴를 열고 ID 복사하기를 고른 다음, 그 ID를 POST /v1/tts-1.0/generate의 voice.id로 보내세요. API는 Job이 큐에 들어가기 전에 Voices 라이브러리 ID를 저장된 음성으로 해석합니다. 요청과 언어 확인 과정은 내 목소리로 AI 보이스오버 만들기에서 보여 줍니다.

읽는 방식은 음성에 저장되지 않고 요청마다 정합니다. generation_config.speed(0.6–1.5), volume(0.5–2.0), 그리고 최대 64자의 선택적 emotion 가이드가 있으며, API 레퍼런스는 emotion에 정해진 값을 나열하지 않습니다.

목소리 클론과는 무엇이 다른가요?

클론은 업로드하거나 직접 녹음한 파일에서 목소리를 복제하고, 텍스트로 생성하기는 설명으로 새 목소리를 만들어 냅니다. 둘 다 같은 Voices 라이브러리에 들어가며 TTS에서 똑같이 동작합니다. 사용 허락을 받은 목소리만 클론하세요.

생성한 음성으로 합성하면 비용은 얼마인가요?

다른 TTS Job과 똑같이 과금됩니다. 요금은 1,000자당 $0.0475이고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 공백과 문장 부호도 글자 수에 포함되며, 요청당 최대 20,000자까지 보낼 수 있습니다. 디자인한 음성 여러 개를 오디오 하나에 쓰려면 여러 목소리로 TTS 만들기를 참고하세요.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume