영상에 텍스트 넣는 방법: 원하는 시간에 타이틀과 라벨 띄우기

영상에 텍스트를 넣으려면 시각을 정한 cue를 입히세요. 클립을 text, start, end와 함께 Sume의 /v1/video-captions로 보내고, 줄이 놓일 높이를 정하면 됩니다.

읽는 시간 5분Sume
전체 글

영상에 텍스트를 넣으려면 글자를 화면에 띄우고 싶은 구간의 프레임에 그 글자를 그려 넣으세요. 시작 부분의 타이틀, 제품 샷 위의 라벨, 핵심 장면의 콜아웃 같은 경우입니다. Sume에서는 클립을 cues와 함께 POST /v1/video-captions로 보내며, cue마다 text와 초 단위의 start, end가 들어갑니다. cue를 보내면 음성 인식을 건너뛰므로 Sume는 보낸 문구를 보낸 시각에 정확히 그대로 입히고, 줄이 놓일 높이는 design.placement.anchor_ratio로 정합니다.

Sume 관련 내용은 2026-09-27에 확인한 영상 캡션 문서와 Sume API 레퍼런스의 자막 스키마에서 가져왔으며, 문서가 아니라 현재 코드에서 확인한 내용은 그렇다고 밝혔습니다. 음성 자체에 자막을 다는 방법은 영상에 자막을 입히는 방법에서 다룹니다.

영상의 특정 시간에 텍스트를 넣으려면 어떻게 하나요?

텍스트마다 cue를 하나씩 주세요. cue는 클립 시작부터 잰 초 단위로 start부터 end까지 표시되며, video_url은 클립의 공개 HTTPS URL입니다.

style을 생략하면 라틴 문구에는 slam이 적용됩니다. 현재 코드에서 이 스타일은 텍스트를 대문자로 그리고, 프레임 전체에 불투명도 18%의 옅은 검은색 틴트를 깝니다. cues는 words, segments, script_text와 함께 쓸 수 없으므로, Job 하나는 직접 쓴 텍스트와 음성 자막 중 한쪽만 입힙니다.

curl -X POST https://api.sume.com/v1/video-captions \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: text-overlay-001" \
  -d '{
    "video_url": "https://example.com/product.mp4",
    "design": { "placement": { "anchor_ratio": 0.2 } },
    "cues": [
      { "text": "The travel edition", "start": 0, "end": 2.5 },
      { "text": "Folds flat, fits a carry-on", "start": 6, "end": 9 }
    ]
  }'

텍스트가 나타날 위치는 어떻게 정하나요?

design.placement.anchor_ratio는 세로 프레임에서 줄 중심의 위치를 프레임 높이에 대한 비율로 나타내며, 범위는 0.05–0.95입니다. landscape_anchor_ratio는 가로 프레임에서 같은 역할을 합니다. 현재 코드에서는 이 비율을 위에서부터 아래로 재므로 0.1은 맨 위 근처, 0.9는 맨 아래 근처에 놓이며, landscape_anchor_ratio를 보내지 않으면 가로 프레임도 anchor_ratio를 씁니다.

  • 위치는 세로 방향으로만 정할 수 있습니다. placement에는 이 두 키만 있고, 가로 위치는 없습니다.
  • Job 하나에는 design이 하나뿐이므로 모든 cue가 같은 높이에 놓입니다. 다른 높이에 텍스트를 넣으려면, 첫 Job이 자막을 입힌 영상에 자막 Job을 하나 더 실행하세요.
  • design은 punch와 tiktok-green을 뺀 모든 스타일에서 동작합니다. 크기, 색, 등장·퇴장 타이밍은 다른 design 토큰이며, 영상에 입히는 자막 커스터마이즈에서 다룹니다.

어떤 제한이 있나요?

자막 Job은 짧은 클립에 맞춰져 있습니다. 확인할 수치는 다음과 같습니다.

영상 캡션과 Sume API 레퍼런스 기준, 2026-09-27 확인. end 규칙과 원본 영상 행은 현재 코드의 동작입니다.
규칙한도
Job당 cue 수1–200개
cue의 text1–400자
cue의 start와 end0–60초, end는 start보다 커야 함
anchor_ratio, landscape_anchor_ratio프레임 높이의 0.05–0.95
원본 영상공개 HTTPS URL. 60초 이하이며, cue가 음성 인식을 건너뛰더라도 오디오 스트림이 있어야 함

영상 필터를 쓰거나, 텍스트를 영상 바깥 위쪽에 둘 수 있나요?

필터로는 안 됩니다. drawtext와 subtitles가 영상 필터 허용 목록에 없으므로 필터는 글자를 그릴 수 없습니다.

밈 레이아웃처럼 화면 위쪽에 텍스트 바를 두려면 텍스트가 스틸 이미지여야 합니다. operation: "stack"을 지정한 타임라인 합성은 스틸과 영상을 한 프레임에 나눠 배치하고(기본값은 스틸이 위), MP4 하나를 반환합니다. 두 파일 모두 이전 Sume 출력물처럼 이미 워크스페이스의 media.sume.com에 있어야 합니다. 레이아웃 키는 타임라인 합성에서 다룹니다.

결과는 어떻게 받고, 비용은 얼마인가요?

GET /v1/jobs/:id/status를 폴링한 다음, GET /v1/video-captions/:id에서 새 video_url을 읽으세요. 접수된 자막 Job마다 60초 이하 영상에 대해 영상 캡션 페이지에 나온 고정 금액이 예약되고 확정됩니다. 최신 가격은 GET /v1/catalog에서 확인하세요.

출처

관련 글

미디어 도구 카테고리의 다른 글

미디어 도구 글 전체 보기

작성자 Sume