다국어 TTS API: 언어마다 요청을 하나씩 보내기
여러 언어로 음성을 만들려면 언어마다 번역한 대본과 그 언어 코드를 담아 TTS 요청을 하나씩 보내세요. Sume가 이를 처리하는 방식을 설명합니다.

텍스트 음성 변환(TTS) API로 여러 언어의 음성을 만들려면 먼저 대본을 번역한 다음, 언어마다 번역한 텍스트와 그 언어 코드를 담아 요청을 하나씩 보내세요. Sume의 POST /v1/tts-1.0/generate는 요청 하나에 language를 하나만 받고 생략하면 영어를 기본값으로 쓰므로, 다섯 개 언어의 보이스오버는 요청 다섯 개이며 각 요청은 자기 글자 수대로 따로 과금됩니다.
필드는 2026-09-27에 확인한 Sume API 레퍼런스의 TTS 스키마와 타임라인 오디오 문서에서 가져왔습니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서, 가격은 API 요금 페이지를 만드는 코드에서 확인했습니다.
API에 어떤 언어로 말할지 어떻게 알려 주나요?
language를 ko, ja, en 같은 BCP-47 / ISO-639 코드로 보내세요. 스키마는 이 필드를 음성이 대본을 읽을 언어로 설명하며, 영어가 아닌 대본에는 모두 지정하라고 안내합니다. TTS는 transcript를 적힌 그대로 읽으므로 번역은 별도 단계입니다. 직접 쓰는 도구로 번역하거나, API로 영상 보이스오버 번역하기에서처럼 Sume 에이전트 실행을 쓰세요.
| 요청 | 사용되는 언어 |
|---|---|
language를 보냄 | 그 언어. |
| 생략, 한글로만 된 대본 | ko(보조 수단으로 추론). |
| 생략, 가나로만 된 대본 | ja(보조 수단으로 추론). |
| 생략, 라틴 문자 같은 다른 문자 체계의 텍스트 | 영어(공급사 기본값). |
| 생략, 여러 문자 체계가 섞인 대본 | 한글이나 가나가 라틴 문자보다 많을 때만 ko 또는 ja(현재 코드). 그 밖에는 영어. |
Sume TTS는 어떤 언어를 말할 수 있나요?
스키마는 코드 예시로 ko, ja, en을 들고, 지원 언어 목록은 공개하지 않습니다. language는 2–16자의 자유 형식 코드입니다. Sume가 스스로 추론하는 언어는 한국어와 일본어뿐입니다. 새 언어로 대본 전체를 맡기기 전에 그 언어로 짧은 문장 하나를 합성해 들어 보세요.
음성 하나로 여러 언어를 말할 수 있나요?
음성과 언어는 별도 필드이므로, 같은 아바타(avatar_id 또는 avatar_handle)나 voice.id를 언어마다 그 언어 코드와 함께 보낼 수 있습니다. 현재 코드에서는 기록된 음성의 주 언어가 요청 언어와 다르면 confirm_language_mismatch: true로 다시 보낼 때까지 제출이 409 tts_voice_language_mismatch로 멈추며, 이때는 Job도 요금도 생기기 전입니다. 이 재확인 절차는 API로 영상 보이스오버 번역하기에서 단계별로 다룹니다.
여러 언어가 섞인 대본은 어떻게 하나요?
요청 하나에는 language가 하나만 들어가므로, 섞인 대본을 언어별 구간으로 나누고 각 구간을 그 언어 코드와 같은 음성으로 합성한 뒤 클립을 순서대로 이어 붙이세요. 타임라인 오디오 concat은 워크스페이스의 media.sume.com 오디오 part 1–20개를 순서대로, 이음새에 무음을 넣지 않고 이어 붙이며, 모든 part는 같은 채널 레이아웃이어야 합니다. 이어 붙이는 과정은 여러 목소리로 TTS 만들기에서 단계별로 다룹니다.
언어별 버전은 길이가 얼마나 되나요?
버전마다 길이가 다르므로 첫 언어의 타이밍을 재사용하지 말고 직접 재세요. timestamps: { "words": true }를 보내면 현재 코드는 결과에 duration_seconds와 words[]를 추가합니다. 어떤 버전에 맞춰 화면이나 자막을 자르기 전에 이 값을 읽으세요. 0.6에서 1.5 사이의 배수인 generation_config.speed는 버전을 정해진 길이의 슬롯에 맞춰야 할 때 말하는 속도를 바꿔 줍니다.
다국어 TTS 비용은 얼마인가요?
언어별 버전은 각각 별도 요청이며, 공백과 문장 부호를 포함한 대본 글자 수에 따라 1,000자당 $0.0475로 과금되고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 요청 하나는 최대 20,000자를 받으며, 합성된 오디오가 1,200초를 넘으면 tts_duration_exceeded로 실패하고 크레딧은 확정되지 않습니다.
출처
관련 글
모델 카테고리의 다른 글
- AI로 사진을 그림으로 바꾸는 방법: 유화·수채화 스타일
AI로 사진을 그림으로 바꾸려면 사진을 레퍼런스 이미지로 보내고, 프롬프트에 스타일을 적고, aspect_ratio auto로 사진의 모양을 유지하세요.
- 끊김 없는 AI 루프 영상: 시작 장면으로 끝나는 클립 만들기
AI 영상을 루프로 만들려면 이미지 하나를 첫 프레임과 마지막 프레임으로 모두 보내고, 반복 재생하기 전에 양 끝을 비교하세요. 끝 프레임을 받는 모델도 정리했습니다.
- Seedance 2.5 API: 30초 클립, 해상도, 레퍼런스
Sume의 Seedance 2.5는 seedance-2.5로, 480p, 720p, 1080p의 4–30초 클립을 만듭니다. Seedance ID별로 문서화된 한도, 입력, 과금을 정리했습니다.
- AI로 스케치를 이미지로 바꾸기: 드로잉을 완성된 그림으로
AI로 스케치를 이미지로 바꾸려면 그림을 레퍼런스로 보내고 완성된 결과를 설명한 뒤, 호출 한 번에 버전을 최대 네 개까지 요청하세요.
작성자 Sume