영상 편집 API: 편집 작업별로 쓸 Sume 엔드포인트

Sume 영상 편집 API의 작업별 엔드포인트 지도입니다. 자르기, 크롭, 자막, 잇기, 음성 교체에 어떤 호출을 쓰고 어떤 가이드를 보면 되는지 정리했습니다.

읽는 시간 6분Sume
전체 글

Sume의 영상 편집 API는 편집기 하나가 아니라 용도가 하나씩 정해진 엔드포인트의 모음입니다. POST /v1/video-trim은 구간을 자르고, POST /v1/video-filter는 크롭하거나 필터를 적용하며, POST /v1/audio-detach는 오디오를 뽑아내고, POST /v1/video-captions는 자막을 입히며, POST /v1/timeline-1.0/render는 오디오 스파인 하나 위에 클립을 조립합니다. 아래 표는 편집 작업마다 엔드포인트와 그 작업을 설명하는 글을 짝지어 둔 것입니다.

표의 각 행은 2026-09-27에 확인한 도구별 문서 페이지, Models 개요 (영문), Sume API 레퍼런스를 바탕으로 합니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다. 모든 도구의 상한은 영상 편집 API 한도에 표 하나로 정리되어 있습니다.

클립 하나를 편집하는 엔드포인트는 무엇인가요?

아래 엔드포인트는 모두 영상 하나를 읽고 새 출력을 반환합니다.

Models 개요 (영문), 도구별 문서 페이지, Sume API 레퍼런스 기준, 2026-09-27 확인.
편집엔드포인트알아 둘 점가이드
구간 하나 자르기POST /v1/video-trimprecision: "exact"는 재인코딩하고, keyframe은 스트림을 복사하지만 한 GOP만큼 일찍 시작할 수 있음.영상 트림, 필터, 오디오 분리
짧은 클립으로 나누기POST /v1/video-trim, 클립마다 한 번소스는 최대 1,800초, 클립은 각각 0.2–900초.긴 영상을 짧은 클립으로 나누기
세로로 크롭POST /v1/video-filter, crop op소스 프레임에 대한 비율로 지정, 소스는 최대 300초.가로 영상을 세로 9:16으로 변환하기
어둡게, 블러, 톤 조정POST /v1/video-filterdim은 내장 op, 블러와 톤 필터는 filtergraph에 넣음.ffmpeg 필터 허용 목록
크기나 프레임 레이트 변경output을 넣은 POST /v1/video-trimfps는 24, 25, 30, 60 중 하나, exact 정밀도에서만 가능.영상의 프레임 레이트나 해상도 바꾸기
자막 입히기POST /v1/video-captions단어와 cue 시각은 0–60초.영상에 자막 입히기
오디오 뽑아내기POST /v1/audio-detach기본은 샘플 단위로 정확한 wav, audio.url에 바로 쓸 수 있음.영상 트림, 필터, 오디오 분리
스틸 추출POST /v1/video-frames소스는 최대 300초, 영상 검사 스틸은 1,800초까지.영상에서 프레임 추출하기
길이, 크기, fps, 음성 읽기POST /v1/video-inspect소스는 최대 1,800초, 전사문은 오디오 분당 과금.영상 검사 API
업스케일POST /v1/video-upscale-1.0/upscaleduration_seconds(1–30)를 보내지 않으면 입력 5초분을 예약.AI 영상 업스케일러 API
프롬프트로 내용 바꾸기POST /v1/video-router/generate, gemini-omni-flash-1.1aspect_ratio는 거부되고, resolution 기본값은 720p.프롬프트로 영상 편집하기

클립과 오디오를 조립하는 엔드포인트는 무엇인가요?

조립을 맡는 표면은 Timeline 1.0입니다. 오디오 스파인 하나와 순서가 있는 video[] 슬롯을 MP4 하나로 렌더링합니다. 여러 단계로 이루어진 편집은 대부분 렌더로 끝납니다.

Timeline 1.0, 타임라인 합성, 영상 트림, 영상 캡션, Sume API 레퍼런스 기준, 2026-09-27 확인.
편집엔드포인트알아 둘 점가이드
클립 잇기POST /v1/timeline-1.0/render시작된 출력 분마다 과금, 출력은 최대 1,800초.롱폼 영상 조립하기
중간 구간 삭제POST /v1/timeline-1.0/render트림만으로는 불가: Job 하나에 구간 하나만 남김.영상 일부 잘라내기
전환 효과 넣기video[].transition첫 슬롯에는 불가, 더 짧은 이웃 슬롯 길이의 50% 이하.영상 전환 효과 API
소리 교체 또는 제거새 audio.url 위에 렌더, 또는 audio: "drop"을 지정한 트림audio.mode: "silence"는 스파인 파일 없이 렌더링.영상의 오디오를 교체하거나 제거하기
배경 음악 넣기렌더의 soundtrack모든 Timeline URL처럼 배경음도 Sume에 호스팅된 파일이어야 함.영상에 배경 음악 넣기
이미지와 영상을 한 화면에POST /v1/timeline-1.0/composestack 또는 overlay, 최대 300초. 결과 MP4는 video[] 슬롯 하나에 넣음.타임라인 합성과 타임라인 오디오
60초가 넘는 영상에 자막 넣기트림, 자막, 그다음 렌더자막 줄이 두 조각에 걸치지 않도록 문장 경계에서 자름.긴 영상에 자막 넣기
토킹 헤드에 B-roll 끼워 넣기오디오 분리, 그다음 렌더트림 불필요: 슬롯이 source_in으로 토킹 헤드를 읽음.말하는 아바타 영상에 B-roll 넣기
다른 언어로 음성 다시 입히기텍스트 음성 변환, 그다음 렌더현재 코드에서는 음성과 언어가 맞지 않으면 확인할 때까지 409를 받음.영상 보이스오버 번역하기

엔드포인트마다 어떤 영상 URL을 읽을 수 있나요?

트림, 필터, 오디오 분리, 프레임, 검사, 그리고 세 가지 Timeline 엔드포인트는 워크스페이스의 media.sume.com 파일만 읽습니다. 자막, 영상 업스케일, Video Router 편집은 공개 HTTPS URL을 받으며, Sume Job이 만든 아티팩트도 공개되어 있습니다. 엔드포인트별 규칙은 Sume API 미디어 URL 규칙에서 모두 다룹니다.

여러 편집을 어떻게 이어서 실행하나요?

각 Job의 출력 URL을 다음 호출에 넣으세요. 트림, 필터, 오디오 분리, 합성, 렌더의 결과는 GET /v1/jobs/:id/result에서 받습니다. 새 MP4는 video_url, 분리한 오디오는 audio_url입니다. 문서에 나온 넘겨주기 예시는 그 MP4를 video[]에(트림 결과는 source_in 0으로), wav를 audio.url에 넣습니다.

비용을 내기 전에 무료로 할 수 있는 검사가 두 가지 있습니다. POST /v1/video-filter/check와 POST /v1/timeline-1.0/plan입니다. 영상 편집 MCP 서버에서처럼 AI 에이전트가 호스팅 MCP로 같은 체인을 실행할 수도 있습니다.

Sume 편집 엔드포인트로 할 수 없는 일은 무엇인가요?

편집을 계획하기 전에 다음 한계를 알아 두세요.

  • ffmpeg로 텍스트 넣기: drawtext와 subtitles는 필터 허용 목록에 없고, movie와 lut3d도 없습니다. 화면 문구는 대신 자막 cues로 입히세요.
  • 영상 두 개를 한 화면에 동시에: 합성은 스틸 하나와 영상 하나를 한 화면에 넣고, 영상 필터는 클립 하나만 읽습니다.
  • 렌더 안에서 클립 자체의 소리: 현재 컴파일러에서 렌더는 스파인과 선택적인 soundtrack 배경음만 재생합니다. 클립의 소리를 살리려면 오디오를 분리해 둘 중 하나로 넘기세요.
  • 새 음성에 맞춘 립싱크: Sume의 모델 문서에 따르면 영상 모델은 나중에 입힌 보이스오버에 맞춰 립싱크하지 않습니다.

출처

관련 글

미디어 도구 카테고리의 다른 글

미디어 도구 글 전체 보기

작성자 Sume