AI 팟캐스트 생성기: 텍스트에서 대본, 음성, 파일 하나로
AI 팟캐스트 생성기는 화자를 표시한 대본, 진행자마다 음성 하나, 오디오 파일 하나로 합치기의 세 단계입니다. Sume API로 각 단계를 하는 방법을 설명합니다.

AI 팟캐스트 생성기는 세 단계로 텍스트를 에피소드로 바꿉니다. 화자를 표시한 대사로 대본을 쓰고, 각 대사를 그 진행자의 음성으로 합성한 뒤, 대사를 순서대로 이어 붙여 오디오 파일 하나로 만듭니다. Sume API에서는 Agent Completions로 기사나 메모에서 대사를 JSON으로 뽑을 수 있고, TTS 1.0이 각 대사를 읽으며, 타임라인 오디오가 Job 하나당 클립을 최대 20개까지 빈틈없이 이어 붙입니다.
이 단계들은 2026-09-27에 확인한 Sume의 Agent Completions와 타임라인 오디오 문서, 그리고 Sume API 레퍼런스의 TTS 스키마를 따릅니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서, 가격은 API 요금 페이지를 만드는 코드에서 확인했습니다.
기사나 메모를 팟캐스트 대본으로 어떻게 바꾸나요?
직접 쓰거나, 모델에 구조화된 데이터로 요청하세요. Sume에서는 instruction에 작업을, input에 원문을 넣고 대사를 받을 output_schema를 붙여 POST /v1/agent/completions를 보내세요. input은 지시문이 아니라 항상 데이터로 다뤄집니다. generation_spend_cap_usd에는 기본값이 없어서, 생략하면 요청이 400 invalid_request로 실패합니다. 키에는 agent_completions:write 스코프가 필요합니다.
이 호출은 실행 영수증과 함께 202를 반환합니다. 실행이 끝날 때까지 GET /v1/agent-runs/{id}를 폴링하세요. 상태가 completed이면 실행의 output이 지정한 스키마를 따르므로, output.lines의 항목 하나가 음성 요청 하나가 됩니다. 음성 비용을 내기 전에 대본을 읽어 보세요.
curl -X POST https://api.sume.com/v1/agent/completions \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: podcast-ep12-script" \
-d '{
"instruction": "Turn the article in input into a two-host podcast script, one line per turn.",
"input": { "article": "Paste the article text here." },
"output_schema": { "name": "podcast_script", "schema": {
"type": "object", "additionalProperties": false, "required": ["lines"],
"properties": { "lines": { "type": "array", "items": {
"type": "object", "additionalProperties": false, "required": ["speaker", "text"],
"properties": {
"speaker": { "type": "string", "enum": ["A", "B"] },
"text": { "type": "string" }
}
} } }
} },
"generation_spend_cap_usd": 1
}'진행자마다 음성은 어떻게 입히나요?
TTS 요청은 음성 하나로 말하므로, 대사마다 POST /v1/tts-1.0/generate를 따로 보냅니다. 대사를 transcript로 넣고, 진행자의 avatar_id나 avatar_handle(목소리가 준비된 아바타), 또는 voice.id를 더합니다. 모든 대사에 같은 language와 WAV output_format을 쓰세요. 대사별 요청과 음성 규칙은 여러 목소리로 TTS 만들기에서 다룹니다.
에피소드는 어떻게 조립하나요?
완성된 대사를 POST /v1/timeline-1.0/audio와 operation: "concat"으로 대본 순서대로 이어 붙인 다음 Job을 폴링하세요. 호출 예시는 여러 목소리로 TTS 만들기에 있습니다. 에피소드 전체를 만들 때는 다음 규칙이 중요합니다.
- concat 하나는 TTS 대사 같은 워크스페이스의
media.sume.com오디오 part 1–20개를 이음새에 무음 없이 이어 붙입니다. 대사가 20개를 넘으면 단계를 나눠 이어 붙이세요. concat은 내구성 있는media.sume.com파일을 반환하며, 이 파일은 다음 concat의 part가 될 수 있습니다. - 출력 파일 하나에는 최대 1,800초가 들어가므로, 더 긴 방송은 여러 파일로 나뉩니다.
- 결과의
segments[]에는 모든 part의start가 있어, 이를 쇼 노트용 타임스탬프로 바꿀 수 있습니다. - 기본 출력은 WAV입니다. MP3는 더 작지만 모든 경계에 프라이밍 패딩이 다시 붙으므로,
mp3는 최종 파일에만 요청하세요.
| 단계 | 호출 | 한도 |
|---|---|---|
| 대본 | POST /v1/agent/completions | generation_spend_cap_usd 필수 |
| 음성 | POST /v1/tts-1.0/generate | 음성 하나. 요청당 최대 20,000자, 오디오 최대 1,200초 |
| 에피소드 | POST /v1/timeline-1.0/audio | Job당 part 1–20개. 출력 최대 1,800초 |
인트로 음악이나 배경 음악을 넣을 수 있나요?
concat은 워크스페이스의 media.sume.com 오디오만 받으므로, 텍스트로 AI 징글 만들기에서 만든 스팅처럼 Sume에서 만든 인트로는 별도 part로 첫 대사 앞에 넣을 수 있습니다. 인트로는 음성 클립과 채널 레이아웃이 같아야 합니다. 현재 코드에서 concat은 레이아웃을 변환하지 않으므로, 모노 음성 대사와 스테레오 인트로는 audio_parts_channel_mismatch로 실패합니다.
음성 아래에 까는 음악은 다른 작업입니다. concat은 절대 믹싱하지 않으므로, Sume에서 말소리 아래에 배경 음악을 깔려면 Timeline 1.0 렌더가 필요합니다. 합친 음성 파일을 오디오 스파인으로 쓰고, Sume에 호스팅된 스틸이나 클립을 하나 이상 화면에 두고, 반복·페이드아웃·음성 아래 더킹을 할 수 있는 선택 필드 soundtrack을 더합니다. 렌더 결과는 MP4이며, 오디오 분리가 그 오디오 트랙을 WAV나 MP3로 반환합니다(Job당 최대 900초). 렌더 방법은 API로 영상에 배경 음악 넣기에 나와 있습니다.
AI 팟캐스트 에피소드의 비용은 얼마인가요?
대사마다 공백과 문장 부호를 포함한 대본 글자 수에 따라 1,000자당 $0.0475로 과금됩니다. concat은 Job마다 타임라인 오디오 페이지에 나온 요율로 과금되며, 배경 음악을 깔면 렌더 Job과 분리 Job이 더해지고 각각 해당 문서 페이지에 나온 요율로 과금됩니다. 대본을 만드는 실행도 사용량이 계량되며, Agent Completions 문서는 그 지출 상한의 규모를 정할 때 API 요금을 참고하라고 안내합니다. 각 요율에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI 제품 광고 영상 생성 API: Format 또는 직접 만들기
Sume API로 제품 광고를 만들려면 sume-product-commercial이나 sume-cinematic-studio-commercial을 실행하거나, /v1/videos에서 클립을 생성하세요.
- AI 제품 데모 영상 생성 API: 실제 동작 하나 보여 주기
Sume로 제품 데모 영상을 만들려면 팩샷과 동작 하나를 담아 sume-product-usage-demo Format을 실행하거나, 스틸을 영상으로 만든 뒤 Timeline에서 이어 붙이세요.
- AI 제품 사진 API: 스플래시·드립·푸어링 샷
Sume 카탈로그 Format 여섯 개가 뷰티 제품의 스플래시, 드립, 푸어링, 짜기, 텍스처 스틸을 만듭니다. 그 밖의 제품은 /v1/images로 팩샷을 편집하세요.
- AI로 만화 컷을 움직일 수 있나요? 네, 컷마다 클립 하나
네, 만화 컷 하나하나를 짧은 AI 클립의 첫 프레임으로 쓰고, 타임라인에서 클립을 읽는 순서대로 이어 소리가 있는 모션 코믹을 만들 수 있습니다.
작성자 Sume