AI 아바타 손동작: 아바타를 움직이거나 춤추게 하는 방법

Avatar 1.0 영상에는 제스처 설정이 없습니다. 손동작이나 춤 동작을 고르려면 모션 컨트롤로 최대 30초 길이의 클립을 써서 아바타를 움직이세요.

읽는 시간 5분Sume
전체 글

AI 아바타에 원하는 손동작이나 춤 동작을 넣으려면 그 동작을 담은 영상으로 아바타를 움직이세요. 모션 컨트롤 모델은 레퍼런스 클립의 움직임을 아바타의 스틸 이미지에 옮깁니다. Sume에서 Avatar 1.0 말하는 영상은 제스처나 포즈 설정을 받지 않으므로, 아바타의 handle과 최대 30초 길이의 드라이빙 클립을 Kling 3.0 Motion Control로 보내면 출력이 그 클립의 움직임과 길이를 따릅니다.

이 글의 내용은 2026-09-27에 확인한 Sume의 아바타 영상 생성, 영상 생성 (영문), 페이스 스왑 문서와 Sume API 레퍼런스의 모션 컨트롤 스키마에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 엔드포인트 전체는 모션 컨트롤 API 가이드에서 다룹니다.

Avatar 1.0 영상에는 손동작이 들어가나요?

생성 과정에서 더해지는 손동작만 들어갑니다. 현재 코드에서는 모든 클립의 프롬프트가 표정 변화, 눈 깜빡임, 입 움직임, 살짝 움직이는 고개, 편안한 어깨, 작은 손동작 같은 자연스러운 말하기 동작을 요구합니다. 이 동작은 고를 수 없습니다. POST /v1/avatar-1.0/talking-video에는 제스처, 포즈, 모션 필드가 없으며, 목록에 없는 필드는 400으로 실패합니다("… is not supported in this launch API contract.").

아바타가 특정 제스처를 하게 하려면 어떻게 하나요?

  • 그 제스처를 담은 최대 30초 길이의 드라이빙 클립을 녹화하거나 고르고, 가져올 수 있는 공개 HTTPS URL에 두세요.
  • 아바타의 avatar_handle, motion_video_url에 넣은 클립, duration_seconds에 넣은 클립 길이(1–30)를 담아 POST /v1/kling/3.0/motion-control을 보내세요.
  • prompt에 제스처를 설명하지 마세요. 움직임과 프레이밍은 드라이빙 영상을 따르고, 프롬프트는 외형 세부만 조정합니다.
  • 아바타 스틸의 프레이밍을 유지하려면 character_orientation을 image로 설정하세요. 기본값인 video는 클립의 프레이밍을 유지합니다.
  • 드라이빙 영상 길이를 초 단위로 올림해 과금하며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 현재 요율은 GET /v1/catalog에 나와 있습니다.
curl -X POST https://api.sume.com/v1/kling/3.0/motion-control \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: avatar-gestures-001" \
  -d '{
    "avatar_handle": "product_host",
    "motion_video_url": "https://example.com/gestures.mp4",
    "duration_seconds": 8,
    "keep_original_sound": false,
    "character_orientation": "image"
  }'

AI 아바타가 춤추게 하려면 어떻게 하나요?

댄스 클립을 드라이빙 영상으로 쓰세요. 출력 길이는 드라이빙 영상을 따르므로, Job 하나로 최대 30초의 춤을 만들 수 있습니다. keep_original_sound: false로 설정하지 않으면 클립 자체의 오디오 트랙이 출력에 남으며, 이 값을 설정하면 무음 클립이 반환됩니다.

레퍼런스 클립이 없다면 동작을 글로 설명하세요. POST /v1/videos에서 Sume에 호스팅된 공개 이미지인 아바타의 preview_image_url을 frame_images의 first_frame으로 넘기고, 춤은 prompt에 적으세요. 그러면 움직임은 텍스트에서 나옵니다. 각 모델은 받는 프레임 유형을 supported_frame_images에 나열하며, 요청 예시는 이미지로 영상 만들기 가이드에 있습니다.

아바타가 말하면서 동시에 제스처를 할 수 있나요?

문서화된 호출 한 번으로는 원하는 제스처를 넣어 말하게 할 수 없습니다. Avatar 1.0은 생성 과정에서 더해지는 작은 제스처만 곁들여 말합니다. 모션 컨트롤 요청은 움직임, 프레이밍, 클립 소리 유지 여부를 다루지만 대본이나 음성 오디오 입력은 없습니다. VEED Fabric 1.0은 스틸을 오디오에 립싱크하지만 모션 입력은 받지 않습니다.

직접 촬영한 영상에 아바타의 얼굴을 입히는 페이스 스왑은 베타입니다. 준비된 아바타의 얼굴을 짧은 공개 소스 영상에 입히며, 문서는 현재 사용할 만한 오디오가 있는 약 4–15초 길이의 소스를 계획하고 있습니다. Avatar Face Swap API(베타)를 참고하세요.

아바타는 어떤 방법으로 움직여야 하나요?

움직임을 어디서 가져올지에 따라 경로를 고르세요. 모션 컨트롤의 모든 필드와 예시 가격은 모션 컨트롤 API 가이드에 나와 있습니다.

아바타 영상 생성, 영상 생성 (영문), 페이스 스왑, Models 개요 (영문), Sume API 레퍼런스의 모션 컨트롤 스키마, Sume의 현재 코드 기준, 2026-09-27 확인.
경로움직임의 출처음성길이
Avatar 1.0 말하는 영상생성: 작은 손동작이 섞인 자연스러운 말하기 동작영어 대본을 말함4–60초
Kling 3.0 Motion Control드라이빙 클립대본·음성 입력 없음. 기본적으로 클립의 소리 유지클립을 따름, 최대 30초
이미지로 영상 만들기, POST /v1/videos아바타 스틸에서 시작하는 프롬프트영상 모델은 TTS에 립싱크하지 않음모델별 supported_durations
페이스 스왑(베타)직접 촬영한 영상소스에 사용할 만한 오디오 필요약 4–15초 소스

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume