Claude로 AI UGC 영상 만들기: 아바타, 음성, 립싱크

Claude 모델의 출력은 텍스트입니다. Write를 켜고 Sume 호스팅 MCP 서버를 연결하면 Claude가 UGC 스타일 아바타 클립의 스크립트, 음성, 립싱크를 만들 수 있습니다.

읽는 시간 5분Sume
전체 글

Claude로 AI UGC 영상을 만들려면 Claude에게 영상 도구를 주세요. Claude 모델은 텍스트와 이미지를 입력받아 텍스트를 출력하므로, 클립 자체는 Claude가 호출하는 도구에서 나옵니다. Sume 호스팅 MCP 서버를 연결하고 로그인할 때 Write를 허용하면, Claude가 아바타를 고르거나 만들고, 스크립트를 음성으로 만들고, 아바타를 그 음성에 립싱크한 뒤 media.sume.com 링크를 돌려줄 수 있습니다.

Claude 관련 사실은 Anthropic의 모델 개요와 커스텀 커넥터 도움말에서, Sume 쪽 내용은 MCP 개요, MCP 도구와 게이트, Job과 결과 (영문)에서 가져왔으며, 2026-09-27에 확인했습니다. Sume의 현재 코드에 있는 도구 설명에서 가져온 단계는 그렇다고 밝혀 두었습니다. 다른 종류의 영상은 Claude로 영상을 만들 수 있나요?를 참고하세요.

Claude를 Sume에 어떻게 연결하나요?

https://mcp.sume.com/mcp를 Claude에 커스텀 커넥터로 추가하세요. 커스텀 커넥터는 Claude가 원격 MCP 서버에 연결하는 방식입니다. 그리고 Sume 동의 화면에서 Write를 켜세요. avatars_create 같은 유료 도구에는 Write가 필요합니다. Sume에는 Claude 전용 커넥터가 없습니다. 화면과 스코프는 Claude 커스텀 커넥터로 Sume 추가하기에서 단계별로 설명합니다.

Sume 문서에 따르면 호스팅 MCP는 여전히 동작하지만 주 경로는 아닙니다. 환경상 필요할 때 쓰고, 기본 연동 경로로 삼지는 말라는 것입니다(Sume 기초). Claude에서 작업하는 사람이 바로 그런 경우입니다. 사용자를 위해 영상을 만드는 앱이라면 Format API나 Developer API를 호출합니다.

UGC 영상을 만들 때 Claude는 무엇을 하나요?

Sume 문서에 따르면 짧은 UGC 광고와 진행자 광고를 포함해 카메라 앞에서 말하는 모든 샷은 승인된 스틸에 텍스트 음성 변환을 더한 VEED Fabric 1.0입니다. 현재 코드의 아바타 도구 설명도 Claude를 같은 단계로 안내합니다.

도구는 MCP 도구와 게이트와 Sume API 레퍼런스, 단계 순서는 Sume의 현재 아바타 도구 설명 기준, 2026-09-27 확인.
단계Sume 도구하는 일
진행자 고르기avatars_search, avatars_list, 또는 유료 avatars_create기존 아바타를 찾거나, 프롬프트·프로필·공개 HTTPS 사진으로 새로 만듦.
샷 구도 잡기generate_image아바타 이미지로 이 샷에 쓸 스틸을 만듦.
스크립트 음성 만들기tts_create스크립트를 읽음. 아바타를 지정하면 그 아바타의 목소리를 씀.
립싱크avatar-image-to-video_createVEED Fabric 1.0. 스틸과 Sume에 호스팅된 오디오가 말하는 클립이 됨.
기다렸다가 전달하기jobs_wait 다음 jobs_resultJob을 기다리고 완성된 파일의 URL을 읽음.

Claude에게 영상을 어떻게 요청하나요?

편집자에게 설명하듯 광고를 설명하고, 지켜야 할 안전장치를 명시하세요. 스크립트는 Claude가 직접 씁니다. 훅, 데모, 콜투액션 구조는 AI 아바타 영상용 UGC 광고 스크립트에서 다룹니다. 예를 들면 다음과 같습니다.

Make a 20-second UGC-style video for our steel water bottle with the Sume tools.
Find a friendly presenter with avatars_search, then make a still of them for this
shot with generate_image. Write a casual script: a one-line hook, one line on the
product, a call to action. Voice it with tts_create, then lip-sync the still with
avatar-image-to-video_create. Before each paid tool, run it with dry_run=true and
show me the estimate. Set max_spend_usd on every paid call. Wait with jobs_wait,
then give me the link.

Claude가 비용을 과하게 쓰지 않게 하려면 어떻게 하나요?

유료 도구는 Sume의 접수 검사를 거쳐 API 요금의 요율대로 Sume 지갑에서 차감됩니다. 텍스트 음성 변환은 1,000자당 $0.0475, VEED Fabric 1.0은 오디오 초당(720p) $0.1875이며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 현재 코드에서는 avatars_create와 avatar-videos_create의 설명도 에이전트에게 "Confirm with the user before every paid create."라고 지시합니다. 호스팅 도구는 여기에 게이트 세 가지를 더합니다.

  • idempotency_key는 쓰기 도구와 유료 도구에 필수입니다. 반복된 호출의 중복을 제거하는 고정 키입니다.
  • dry_run=true는 제출하지 않고 접수 및 비용 프리뷰를 반환합니다.
  • max_spend_usd는 호출의 지출에 상한을 두며, 값을 넘긴 경우에만 적용됩니다.

어떤 제한이 있나요?

  • 호스팅 MCP는 노트북의 파일을 읽을 수 없습니다. 제품 사진이나 새 아바타에 쓸 얼굴처럼 사진이 필요하면 Claude에게 공개 HTTPS 링크를 주세요.
  • Fabric은 최대 300초의 오디오를 받습니다. 오디오는 tts_create 출력처럼 Sume의 미디어 호스트에 있어야 하고, 크기는 최대 10 MB입니다.
  • jobs_wait 호출 한 번은 최대 55초까지 대기합니다. 문서는 같은 Job을 다시 기다리고, 유료 create는 절대 다시 제출하지 말라고 안내합니다. 이유는 긴 영상 Job의 MCP 타임아웃에서 설명합니다.
  • Avatar 1.0 말하는 영상을 직접 만드는 도구인 avatar-videos_create는 현재 코드에서 명시적으로 요청할 때 쓰는 레거시 경로로 표시되어 있으며, 스크립트는 영어여야 합니다.

출처

관련 글

에이전트 카테고리의 다른 글

에이전트 글 전체 보기

작성자 Sume