영상에 텍스트 넣는 방법: 원하는 시간에 타이틀과 라벨 띄우기
영상에 텍스트를 넣으려면 시각을 정한 cue를 입히세요. 클립을 text, start, end와 함께 Sume의 /v1/video-captions로 보내고, 줄이 놓일 높이를 정하면 됩니다.

영상에 텍스트를 넣으려면 글자를 화면에 띄우고 싶은 구간의 프레임에 그 글자를 그려 넣으세요. 시작 부분의 타이틀, 제품 샷 위의 라벨, 핵심 장면의 콜아웃 같은 경우입니다. Sume에서는 클립을 cues와 함께 POST /v1/video-captions로 보내며, cue마다 text와 초 단위의 start, end가 들어갑니다. cue를 보내면 음성 인식을 건너뛰므로 Sume는 보낸 문구를 보낸 시각에 정확히 그대로 입히고, 줄이 놓일 높이는 design.placement.anchor_ratio로 정합니다.
Sume 관련 내용은 2026-09-27에 확인한 영상 캡션 문서와 Sume API 레퍼런스의 자막 스키마에서 가져왔으며, 문서가 아니라 현재 코드에서 확인한 내용은 그렇다고 밝혔습니다. 음성 자체에 자막을 다는 방법은 영상에 자막을 입히는 방법에서 다룹니다.
영상의 특정 시간에 텍스트를 넣으려면 어떻게 하나요?
텍스트마다 cue를 하나씩 주세요. cue는 클립 시작부터 잰 초 단위로 start부터 end까지 표시되며, video_url은 클립의 공개 HTTPS URL입니다.
style을 생략하면 라틴 문구에는 slam이 적용됩니다. 현재 코드에서 이 스타일은 텍스트를 대문자로 그리고, 프레임 전체에 불투명도 18%의 옅은 검은색 틴트를 깝니다. cues는 words, segments, script_text와 함께 쓸 수 없으므로, Job 하나는 직접 쓴 텍스트와 음성 자막 중 한쪽만 입힙니다.
curl -X POST https://api.sume.com/v1/video-captions \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: text-overlay-001" \
-d '{
"video_url": "https://example.com/product.mp4",
"design": { "placement": { "anchor_ratio": 0.2 } },
"cues": [
{ "text": "The travel edition", "start": 0, "end": 2.5 },
{ "text": "Folds flat, fits a carry-on", "start": 6, "end": 9 }
]
}'텍스트가 나타날 위치는 어떻게 정하나요?
design.placement.anchor_ratio는 세로 프레임에서 줄 중심의 위치를 프레임 높이에 대한 비율로 나타내며, 범위는 0.05–0.95입니다. landscape_anchor_ratio는 가로 프레임에서 같은 역할을 합니다. 현재 코드에서는 이 비율을 위에서부터 아래로 재므로 0.1은 맨 위 근처, 0.9는 맨 아래 근처에 놓이며, landscape_anchor_ratio를 보내지 않으면 가로 프레임도 anchor_ratio를 씁니다.
- 위치는 세로 방향으로만 정할 수 있습니다.
placement에는 이 두 키만 있고, 가로 위치는 없습니다. - Job 하나에는
design이 하나뿐이므로 모든 cue가 같은 높이에 놓입니다. 다른 높이에 텍스트를 넣으려면, 첫 Job이 자막을 입힌 영상에 자막 Job을 하나 더 실행하세요. design은punch와tiktok-green을 뺀 모든 스타일에서 동작합니다. 크기, 색, 등장·퇴장 타이밍은 다른design토큰이며, 영상에 입히는 자막 커스터마이즈에서 다룹니다.
어떤 제한이 있나요?
자막 Job은 짧은 클립에 맞춰져 있습니다. 확인할 수치는 다음과 같습니다.
| 규칙 | 한도 |
|---|---|
| Job당 cue 수 | 1–200개 |
cue의 text | 1–400자 |
cue의 start와 end | 0–60초, end는 start보다 커야 함 |
anchor_ratio, landscape_anchor_ratio | 프레임 높이의 0.05–0.95 |
| 원본 영상 | 공개 HTTPS URL. 60초 이하이며, cue가 음성 인식을 건너뛰더라도 오디오 스트림이 있어야 함 |
영상 필터를 쓰거나, 텍스트를 영상 바깥 위쪽에 둘 수 있나요?
필터로는 안 됩니다. drawtext와 subtitles가 영상 필터 허용 목록에 없으므로 필터는 글자를 그릴 수 없습니다.
밈 레이아웃처럼 화면 위쪽에 텍스트 바를 두려면 텍스트가 스틸 이미지여야 합니다. operation: "stack"을 지정한 타임라인 합성은 스틸과 영상을 한 프레임에 나눠 배치하고(기본값은 스틸이 위), MP4 하나를 반환합니다. 두 파일 모두 이전 Sume 출력물처럼 이미 워크스페이스의 media.sume.com에 있어야 합니다. 레이아웃 키는 타임라인 합성에서 다룹니다.
결과는 어떻게 받고, 비용은 얼마인가요?
GET /v1/jobs/:id/status를 폴링한 다음, GET /v1/video-captions/:id에서 새 video_url을 읽으세요. 접수된 자막 Job마다 60초 이하 영상에 대해 영상 캡션 페이지에 나온 고정 금액이 예약되고 확정됩니다. 최신 가격은 GET /v1/catalog에서 확인하세요.
출처
관련 글
미디어 도구 카테고리의 다른 글
- 영상에 보이스오버를 넣고 원래 소리도 살리는 방법
영상에 보이스오버를 넣으려면 영상 자체의 소리 위에 내레이션을 믹싱하세요. 대본을 TTS로 음성으로 만든 뒤, 두 트랙을 담아 클립을 MP4 하나로 렌더링합니다.
- AI로 LinkedIn 배너 만들기: 1584×396 커버 이미지
LinkedIn은 4:1 비율의 1584 x 396픽셀 커버 이미지를 권장합니다. Sume에서 Nano Banana 2로 4:1 이미지를 생성한 뒤 정확한 크기로 조정하세요.
- AI로 YouTube 배너 만들기: 2560×1440 채널 배너
YouTube는 16:9, 6 MB 이하의 2560 x 1440픽셀 채널 배너를 권장합니다. Sume에서는 ChatGPT Image 2.5가 이 크기를 커스텀 image_size로 그대로 받습니다.
- AI 배너 생성기: 8:1까지 가로로 긴 배너 만들기
배너 비율을 먼저 정한 뒤 그 비율을 나열하는 모델을 고르세요. Sume에서 ChatGPT Image 2.5는 3:1까지 정확한 크기를 받고, Nano Banana 2는 8:1까지 지원합니다.
작성자 Sume