Claude 텍스트 음성 변환(TTS): MCP로 오디오 파일 만들기

Claude에서 텍스트 음성 변환을 하려면 MCP로 TTS 도구를 연결하세요. Claude가 대본과 음성을 보내고, 오디오 파일 링크를 돌려줍니다.

읽는 시간 5분Sume
전체 글

Claude에서 텍스트 음성 변환(TTS)으로 내려받아 다시 쓸 수 있는 오디오 파일을 만들려면, MCP로 텍스트 음성 변환 도구를 연결하세요. Claude가 대본과 음성을 도구에 보내고, Job을 기다린 뒤, 완성된 오디오의 링크를 돌려줍니다. https://mcp.sume.com/mcp의 Sume 호스팅 MCP 서버에서는 그 도구가 tts_create입니다. 호출당 최대 20,000자를 받으며, WAV나 raw 오디오를 요청하지 않으면 MP3를 반환합니다.

Claude 쪽 내용은 Anthropic 도움말 센터의 커스텀 커넥터 문서와 Claude Code MCP 문서에서, Sume 쪽 내용은 MCP 빠른 시작, MCP 도구와 게이트, Sume API 레퍼런스의 TTS 1.0 스키마에서 가져왔습니다. 모두 2026-09-27에 확인했습니다. Sume 기초 페이지는 호스팅 MCP가 여전히 동작하지만 현재 주 경로는 아니라고 설명합니다. 백엔드에서는 대신 텍스트 음성 변환 API의 REST 경로를 호출하세요.

Claude에 텍스트 음성 변환 도구를 어떻게 추가하나요?

Sume에는 전용 Claude 커넥터가 없습니다. Sume 호스팅 MCP 서버를 직접 한 번 추가한 뒤 유료 호출을 허용하세요.

  • Claude, Claude Desktop, Cowork: https://mcp.sume.com/mcp를 커스텀 커넥터로 추가하세요. 단계는 Claude 커스텀 커넥터로 Sume 추가하기에 있습니다.
  • Claude Code: claude mcp add --transport http sume https://mcp.sume.com/mcp를 실행한 다음 claude mcp login sume 명령을 실행하세요.
  • Sume 동의 페이지에서 Write를 켜세요. 기본 로그인은 읽기 전용(mcp:read)이며, 세션에 mcp:write도 생기기 전까지 tts_create 같은 유료 도구는 insufficient_scope를 반환합니다.

Claude는 tts_create에 무엇을 보내나요?

모든 음성 필드는 필수 값인 idempotency_key와 나란히 payload 안에 들어갑니다. dry_run: true를 넣으면 호출은 Job을 만들지 않고 접수와 비용 프리뷰를 반환하므로, Claude에게 비용부터 보여 달라고 하세요. 단어별 타이밍과 문장마다 클립 하나를 받는 기능은 선택 사항이며, 텍스트 음성 변환 API에서 다룹니다.

Sume API 레퍼런스의 TTS 1.0 스키마와 MCP 도구와 게이트 기준, 2026-09-27 확인.
필드역할
transcript대본. 1–20,000자. 공백과 문장 부호도 사용량에 포함.
voice.id, avatar_id, avatar_handle 중 하나음성. voi_로 시작하는 Voices 라이브러리 ID 같은 음성 ID, 또는 목소리가 준비된 Sume 아바타.
language말하는 언어. 생략하면 영어가 기본값이므로, 다른 언어라면 지정.
output_format기본값은 44,100 Hz, 128 kbps의 MP3. 다른 컨테이너는 wav와 raw.
{
  "idempotency_key": "launch-voiceover-v1",
  "dry_run": true,
  "payload": {
    "transcript": "Meet the new dashboard. Setup takes one minute.",
    "avatar_handle": "narrator",
    "language": "en"
  }
}

Claude는 오디오 파일을 어떻게 돌려받나요?

tts_create는 오디오가 아니라 Job id로 응답합니다. 도구 호출을 두 번 더 하면 작업이 끝납니다. 먼저 jobs_wait를 호출하는데, 호출당 최대 55초 동안 대기하며 Job이 끝날 때까지 같은 id로 반복합니다. 그다음 jobs_result를 호출합니다. 완료된 결과에는 오디오가 media.sume.com에 미러링된 아티팩트로 나오며, 현재 코드에서는 그 링크가 audio_url로도 담깁니다. 링크는 공개되어 있으므로 채팅 밖에서도 파일을 열거나 내려받을 수 있습니다.

Claude로 음악도 만들 수 있나요?

네, 같은 서버의 다른 도구로 만들 수 있습니다. 현재 코드에서 music_create는 Music 1.0 Job을 제출합니다. 최대 5,000자의 prompt와 선택 사항인 image_url을 받고, 길이 설정은 없으며, duration 필드는 거부됩니다. Sume 문서는 Music 1.0을 은퇴 예정으로 표시하며, 이제 그 요청은 Music Router를 거쳐 처리됩니다. 요율표에는 음악 생성이 오디오 1건당 $0.125로 나와 있습니다.

비용은 얼마이고, 한도는 어떻게 되나요?

tts_create는 1,000자당 $0.0475로 과금되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. dry_run: true는 예상 금액을 먼저 보여 주고, max_spend_usd는 값을 넘기면 호출의 상한이 됩니다.

  • 호출당 최대 20,000자입니다. 합성된 오디오가 1,200초를 넘으면 tts_duration_exceeded로 실패하고 크레딧은 확정되지 않습니다.
  • 실시간 음성은 지원하지 않습니다. TTS 1.0은 스트림이 아니라, 폴링하거나 웹훅으로 결과를 받는 비동기 Job입니다.
  • 현재 코드에서는 음성에 기록된 주 언어가 요청한 언어와 다르면, Job이나 과금이 생기기 전에 호출이 음성 언어 불일치 경고와 함께 돌아옵니다. 확인한 뒤에는 payload 안에 confirm_language_mismatch: true를 넣어 재시도합니다.
  • 내 목소리를 쓰려면 내 목소리로 AI 보이스오버 만들기를 참고하세요.

출처

관련 글

에이전트 카테고리의 다른 글

에이전트 글 전체 보기

작성자 Sume