한국어 음성 인식(STT) API: 한국어 오디오 전사하기

API로 한국어 음성을 텍스트로 전사하려면 오디오 URL을 language_code ko와 함께 보내거나 자동 감지에 맡기세요. 단어별 타이밍이 담긴 전사문을 받습니다.

읽는 시간 5분Sume
전체 글

한국어 음성을 텍스트로 변환하려면 녹음을 한국어 언어 코드 ko와 함께 음성 인식 API로 보내고, 단어마다 시작 시각과 끝 시각이 붙은 전사문을 받으세요. Sume STT 1.0에서는 오디오의 공개 HTTPS URL과 "language_code": "ko"를 담은 POST /v1/stt-1.0/transcribe 요청 하나면 됩니다. 코드를 빼면 언어가 자동으로 감지됩니다.

STT 1.0은 Sume API 레퍼런스의 바탕이 되는 OpenAPI 문서에 명세되어 있으며, API 레퍼런스 문서 페이지는 정확한 요청·응답 형태의 기준으로 이 문서를 안내합니다. 2026-09-27에 확인했습니다. 어떤 언어에나 적용되는 폴링과 웹훅은 단어별 타임스탬프를 주는 음성 인식 API에서 다룹니다.

한국어 오디오는 어떻게 전사하나요?

언어 힌트로 ko를 넘기세요. API 레퍼런스에 있는 STT 요청 예시도 그렇게 합니다. 본문에는 다음 필드를 넣습니다.

  • audio_url: 공개 HTTPS URL에 있는 녹음 파일입니다. 레퍼런스 예시는 .m4a와 .wav 파일을 가리킵니다.
  • language_code: ko 같은 2–16자의 선택적 힌트입니다. 생략하면 자동으로 감지하며, 이때 결과는 값이 있는 경우 찾아낸 language_code를 알려 줍니다.
  • duration_seconds: 녹음 길이로, 1–600 범위입니다. 사용량 예약의 크기를 정하며, 생략하면 Sume가 1분을 예약합니다.
  • segmentation: 단어 타이밍과 함께 문장 구간도 받으려면 { "mode": "sentence" }를 넣습니다.
curl -X POST https://api.sume.com/v1/stt-1.0/transcribe \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: interview-ko-007" \
  -d '{
    "audio_url": "https://example.com/audio/interview-ko.m4a",
    "language_code": "ko",
    "duration_seconds": 480,
    "segmentation": { "mode": "sentence" },
    "mode": "async"
  }'

한국어 전사문에는 무엇이 들어 있나요?

Job이 completed가 되면 GET /v1/jobs/{id}/result가 다음 필드를 반환합니다. words[]의 토큰에는 spacing 같은 type이 붙을 수 있으므로, 개수를 세거나 시간을 맞출 때는 word 토큰만 쓰세요. 화면에 보여 줄 때는 토큰을 직접 이어 붙이지 말고 text를 쓰세요.

Sume API 레퍼런스의 STT 1.0 결과 필드, 2026-09-27 확인.
필드내용
text전사문 텍스트.
language_codeko처럼 감지되었거나 요청한 코드(있는 경우).
language_probability언어 감지 신뢰도(있는 경우).
words[]각 토큰의 word, start, end. 시간은 오디오 시작부터의 초 단위이며, start 순으로 정렬됨.
words[].type제공되는 경우 토큰의 종류(예: word, spacing).
segments[]문장 분할을 요청한 경우에만: index, text, start, end, duration_seconds.

한국어 전사문을 문장 단위로 나눠 주나요?

요청할 때만 나눕니다. segmentation: { "mode": "sentence" }를 넣으면 STT 1.0은 타이밍이 있는 단어를 문장 끝 문장부호 기준으로 문장으로 묶고, 문장부호가 없는 구간은 무음 지점에서 나눕니다. 그래서 문장을 끝맺는 부호 없이 길게 이어지는 말도 여러 구간으로 나뉩니다.

구간은 파일 위의 빈틈없는 시간 범위입니다. 각 구간의 end는 다음 구간의 start와 같으며, 잘라 낸 오디오 클립은 만들어지지 않습니다.

한국어 녹음은 얼마나 길 수 있고, 비용은 얼마인가요?

요청당 최대 10분입니다. duration_seconds의 범위는 1–600(“Maximum 10 minutes”)입니다. 더 긴 인터뷰나 강의는 여러 조각으로 나누고, 긴 오디오 파일 전사하기에서처럼 각 조각의 시각을 그 조각의 시작 오프셋만큼 옮기세요.

STT 1.0은 API 요금에 나온 오디오 분당 $0.01로 과금되며 기본적으로 5.5% 에이전트 수수료가 더해지므로, 10분을 꽉 채운 요청 하나는 수수료 전 $0.10입니다.

전사문을 한국어 자막으로 만들 수 있나요?

네. 문장 구간을 타이밍이 있는 자막 줄의 출발점으로 쓸 수 있습니다. Sume의 자막 API로 영상에 입히려면 각 줄의 text, start, end를 segments로 넘기고 한글 자막 스타일을 쓰세요. 라틴 스타일인 slam, punch, tiktok-green은 한국어 문구를 400(caption_hangul_text_latin_style)으로 거부합니다. 한글 스타일과 폰트는 한국어 자막 API에 정리되어 있습니다.

현재 코드에서 자막 Job은 60초보다 긴 영상을 거부하므로, 더 긴 영상은 긴 영상에 자막 넣기에서처럼 먼저 여러 조각으로 자르세요.

자막 파일이 필요하다면 SRT 파일을 만드는 방법을 참고하세요. 한국어 오디오에서 영어를 얻으려면 오디오를 영어로 번역하기를 참고하세요.

출처

관련 글

미디어 도구 카테고리의 다른 글

미디어 도구 글 전체 보기

작성자 Sume