오디오 파일을 영어로 번역하기: 전사, 번역, 음성 합성
오디오를 영어로 번역하는 세 단계입니다. 언어 감지와 함께 녹음을 전사하고, 텍스트를 번역한 뒤, 필요하면 TTS로 영어 음성을 만듭니다.

오디오를 영어로 번역하려면 녹음을 원래 말한 언어로 전사하고, 그 전사문을 영어 텍스트로 번역한 뒤, 영어 오디오가 필요하면 텍스트 음성 변환(TTS) 음성으로 번역문을 읽히세요. Sume API로는 말한 언어가 감지되도록 language_code 없이 STT 1.0(POST /v1/stt-1.0/transcribe)을 호출하고, 영어 텍스트는 직접 고른 번역 도구나 Sume Agent Completion으로 만든 다음, 영어 음성은 TTS 1.0(POST /v1/tts-1.0/generate)으로 만듭니다.
Sume 관련 사실은 Sume API 레퍼런스의 STT 1.0·TTS 1.0 스키마와 Agent Completions 문서에서 가져왔으며, 2026-09-27에 확인했습니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다. 대신 영상 속 음성을 바꾸려면 API로 영상 보이스오버 번역하기를 참고하세요.
원래 말과 그 언어는 어떻게 알아내나요?
녹음 파일의 공개 HTTPS URL을 STT 1.0으로 보내고 language_code는 빼세요. API 레퍼런스는 자동 감지를 원하면 이 값을 생략하라고 안내합니다. 결과에는 있는 경우 language_code와 language_probability가 담기므로, 번역하기 전에 어떤 언어가 감지됐는지 확인할 수 있습니다. 언어를 이미 알고 있다면 대신 힌트로 보내세요. 한국어 녹음이라면 "language_code": "ko"처럼 보냅니다. 언어 감지만 따로 다루는 글은 말하는 언어 감지하기입니다.
문장 단위 결과도 함께 요청하세요. "segmentation": { "mode": "sentence" }를 넣으면 segments의 각 항목에 index, 문장 text, 초 단위의 start와 end가 담기므로, 번역할 단위를 순서대로 얻을 수 있습니다.
curl -X POST https://api.sume.com/v1/stt-1.0/transcribe \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: memo-0042-stt" \
-d '{
"audio_url": "https://example.com/audio/voice-memo.m4a",
"duration_seconds": 95,
"segmentation": { "mode": "sentence" }
}'전사문은 누가 영어로 번역하나요?
여러분이 고른 번역 도구가 번역합니다. STT 1.0에는 번역 옵션이 없고, 목표 언어를 지정하는 요청 필드도 없습니다. 각 문장의 index를 텍스트와 함께 보내고, start와 end는 여러분 쪽에 보관하고, 보낸 줄 수만큼 돌아왔는지 확인한 뒤, 음성 합성 비용을 내기 전에 영어 문장을 검토하세요.
Sume 안에서 처리하려면 POST /v1/agent/completions로 Agent Completion을 시작하세요. 이 실행은 비동기이므로 폴링한 다음 output에서 영어 문장을 읽습니다. 자막 줄에 쓰는 전체 요청은 영상 자막 번역 API에 나와 있습니다.
instruction: 작업 내용입니다. 예를 들어 각 줄을 영어로 번역하라는 지시입니다.input: 문장들입니다. 문서에 따르면input은 지시문이 아니라 항상 데이터로 다뤄집니다.output_schema: 돌려받을 영어 문장의 형태입니다.generation_spend_cap_usd: 필수이며 기본값이 없습니다.
영어 텍스트를 영어 오디오로 어떻게 바꾸나요?
번역문을 최대 20,000자의 transcript로 담아 음성과 함께 TTS 1.0에 보내세요. 음성은 voice.id, 또는 목소리가 준비된 아바타의 avatar_id나 avatar_handle로 지정합니다. 영어가 기본값이므로 language를 생략하면 영어 음성이 되며, 명시하려면 "language": "en"을 보내세요. 음성은 원래 화자의 목소리가 아니라 여러분이 고른 목소리입니다.
- 영어 파일 하나: 번역문 전체를 보내세요.
output_format을 지정하지 않으면 결과는 44,100 Hz, 128 kbps의 MP3입니다. - 문장마다 클립 하나:
output_format에서 WAV를 요청하고"timestamps": { "words": true }와"segmentation": { "mode": "sentence" }를 함께 보내세요. 그러면 세그먼트마다 자체audio_url이 붙습니다. MP3로는 클립 없이 타이밍만 받습니다. - 영어 오디오는 고유한 속도로 진행됩니다. TTS는 원래 녹음의 타이밍이 아니라 빈틈없이 이어지는 새 문장 타이밍을 반환합니다.
- 현재 코드에서는 음성에 기록된 주 언어가 영어가 아니면, Job이나 과금이 생기기 전에 TTS가 음성 언어 불일치 경고와 함께
409로 응답합니다. 확인한 뒤confirm_language_mismatch: true를 넣어 다시 보내세요.
단계별 비용은 얼마인가요?
Sume 호출은 각각 따로 과금되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 잔액이 제출 요청의 예상 금액을 감당하지 못하면 제출은 402 insufficient_credits로 실패하고 Job은 시작되지 않습니다.
| 단계 | 호출 | 받는 것 | 가격 |
|---|---|---|---|
| 전사 | POST /v1/stt-1.0/transcribe | text, language_code, segments | 오디오 분당 $0.01 |
| 번역 | 직접 고른 번역 도구 또는 POST /v1/agent/completions | 영어 문장 | 번역 도구의 가격, 또는 Sume 지갑에서 차감되는 에이전트 자체 턴 비용 |
| 음성 합성(선택) | POST /v1/tts-1.0/generate | MP3 하나, 또는 문장마다 WAV 클립 하나 | 1,000자당 $0.0475. 공백과 문장 부호도 포함 |
한도는 어떻게 되나요?
- STT 1.0은 요청당 최대 10분 분량의 오디오를 받습니다. 더 긴 녹음은 먼저 나누세요. 긴 오디오 파일 전사하기를 참고하세요.
- TTS 1.0은 요청당 최대 20,000자를 받으며, 합성된 오디오가 1,200초를 넘으면
tts_duration_exceeded로 실패하고 크레딧은 확정되지 않습니다. - 오디오는 공개 HTTPS URL로 입력하고, 영어 오디오는 Sume에 호스팅된 파일로 돌아옵니다.
- 화자 라벨은 없습니다.
diarize는 서버 쪽에서 고정되어 있으며 현재 코드에서는 꺼진 채 실행됩니다.
출처
관련 글
미디어 도구 카테고리의 다른 글
- 이미지를 3000x3000(또는 원하는 크기)으로 업스케일하는 방법
목표 크기를 현재 크기로 나눠 업스케일 배율을 구한 뒤 실행하세요. 1000×1000을 3배 하면 3000×3000입니다. Sume는 1에서 4 사이의 어떤 배율이든 받습니다.
- 영상 편집 API: 편집 작업별로 쓸 Sume 엔드포인트
Sume 영상 편집 API의 작업별 엔드포인트 지도입니다. 자르기, 크롭, 자막, 잇기, 음성 교체에 어떤 호출을 쓰고 어떤 가이드를 보면 되는지 정리했습니다.
- AI 생성 클립을 위한 X(트위터) 영상 업로드 규격
X는 30 또는 60 fps의 H.264와 1280x720 또는 720x1280을 권장하고, 기본 계정의 Post 영상을 20분으로 제한합니다. Sume 클립을 항목별로 대조합니다.
- YouTube 범퍼 광고 규격: 6초, 16:9, 건너뛰기 불가
YouTube 범퍼 광고는 YouTube에 호스팅되는 5–6초짜리 건너뛸 수 없는 영상이며, 규격으로 16:9 1920×1080이 나와 있습니다. Sume로 6초에 맞춰 자르는 방법입니다.
작성자 Sume