AI 이미지 캐릭터 일관성 유지하기: 레퍼런스 한 장 재사용
AI 이미지에서 캐릭터를 일관되게 유지하려면 요청마다 같은 레퍼런스 이미지를 보내고, 같은 설명을 반복하고, 장면만 바꾸세요.

AI 이미지 생성기에서 캐릭터를 일관되게 유지하려면 요청마다 같은 캐릭터 레퍼런스 이미지를 보내고, 같은 캐릭터 설명을 한 글자도 바꾸지 않고 반복하고, 장면만 바꾸세요. Sume에서는 레퍼런스를 POST /v1/images의 input_references에 넣습니다. 이미지 API는 시드를 제공하지 않고 캐릭터 ID도 없으며, 똑같은 얼굴을 보장하는 설정도 없으므로 결과를 하나하나 검토하세요.
요청 필드는 Sume의 Image API 문서 (영문)와 GET /v1/images/models가 제공하는 모델 카탈로그에서 가져왔으며, 2026-09-27에 확인했습니다. 여러 영상 샷에서 같은 캐릭터를 유지하는 방법은 여러 AI 영상 샷에서 캐릭터 일관성 유지하기를 참고하세요.
모든 이미지에서 같은 캐릭터를 유지하려면 어떻게 하나요?
모든 요청을 같은 세 부분으로 구성하세요. 확정한 레퍼런스 이미지 한 장, 고정된 설명 하나, 그리고 새 장면입니다. 아래 요청은 장면 하나에 이 세 가지를 조합합니다.
- 레퍼런스부터 만드세요.
n으로 후보를 생성하고, 얼굴과 옷차림이 잘 보이는 것을 하나 골라 저장하세요. 결과 URL은 Sume가 호스팅하는 서명된 URL이기 때문입니다. - 레퍼런스는 직접 관리하는 공개 HTTPS URL에 올리세요. localhost, 사설 네트워크, HTTPS가 아닌 URL은 거부됩니다.
- 나이, 머리 모양, 옷, 색을 담은 설명을 한 번 써 두고, 모든 프롬프트에 그대로 붙여 넣으세요. 장면은 그 뒤에 적으세요.
- 각 이미지의 모양은 모델 목록에 있는
aspect_ratio를 명시해서 정하세요."auto"를 쓰면 대신 레퍼런스의 모양에 맞춰집니다. - 쓰기 전에 모든 결과를 레퍼런스와 비교하세요.
curl -X POST "https://api.sume.com/v1/images" \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro",
"prompt": "The woman from the reference image: early 30s, short red bob, round glasses, mustard raincoat. Scene: she buys bread at a morning street market in soft daylight.",
"input_references": [
{ "type": "image_url", "image_url": { "url": "https://example.com/character.png" } }
],
"aspect_ratio": "16:9",
"n": 2
}'같은 캐릭터의 레퍼런스 이미지를 여러 장 쓸 수 있나요?
네. 정면, 옆모습, 전신 사진을 한 요청에 모델의 상한까지 넣을 수 있습니다. 상한은 ChatGPT Image 2.5의 id 두 개에서 레퍼런스 16장, ChatGPT Image 2와 Nano Banana 모델 두 개에서 10장입니다. 현재 모델이 허용하는 것보다 많은 레퍼런스를 담은 요청은 400 오류로 거부됩니다.
현재 스키마에서 레퍼런스에는 역할이 없고 타입과 URL만 있으므로, 프롬프트에서 이미지들을 연결해 주어야 합니다. 모든 레퍼런스가 같은 사람이라는 것과, 이미지마다 옷차림이 다르다면 어느 이미지의 옷차림을 따를지 적으세요.
얼굴을 고정하는 시드나 캐릭터 ID가 있나요?
없습니다. seed는 요청 스키마에 있지만 이를 제공하는 이미지 모델이 없어, seed를 보낸 요청은 400 unsupported_parameter를 반환합니다. 캐릭터, 신원, 얼굴 고정 필드도 없으며, 현재 코드에서는 스키마에 정의되지 않은 필드가 400 invalid_request로 거부됩니다. 이미지에서 다음 이미지로 캐릭터를 이어 주는 수단은 다음과 같습니다.
| 수단 | Sume 이미지 API 지원 | 한도 |
|---|---|---|
레퍼런스 이미지(input_references) | 예, 편집 가능 모델에서 | ChatGPT Image 2.5는 16장, ChatGPT Image 2와 Nano Banana는 10장 |
prompt에 같은 설명 | 예 | 모든 요청에서 prompt 필수 |
호출당 여러 장(n) | 예 | 스키마상 최대 10장, ChatGPT Image와 Nano Banana는 4장 |
seed | 스키마에 있으나 제공 안 됨 | 400 unsupported_parameter |
| 캐릭터 ID나 얼굴 ID | 해당 필드 없음 | 현재 코드에서 알 수 없는 필드는 400 invalid_request 반환 |
영상에서 같은 캐릭터를 유지하려면 어떻게 하나요?
영상은 입력이 다릅니다. 생성한 샷은 여러 AI 영상 샷에서 캐릭터 일관성 유지하기에서, 핸들로 다시 불러 쓰는 말하는 아바타는 재사용 가능한 AI 아바타 만들기에서 다룹니다.
어떤 제한이 있나요?
- 이미지는 매번 새로 생성됩니다. 머리 모양, 옷의 디테일, 비율이 달라질 수 있으므로 하나하나 레퍼런스와 비교해 확인하세요.
- 텍스트로 이미지 만들기만 지원하는 모델은 레퍼런스를 거부합니다. 이 모델들의
input_references범위는{"min": 0, "max": 0}입니다. - 결과 URL은 서명된 URL이므로, 레퍼런스와 보관할 이미지는 자체 저장소에 두세요.
- 실제 인물의 모습은 본인의 허락을 받은 경우에만 사용하세요.
출처
관련 글
모델 카테고리의 다른 글
- AI로 이미지 베리에이션 만드는 방법: 비슷한 이미지 여러 장
이미지를 레퍼런스로 보내고, 바꿔도 되는 것과 유지할 것을 적은 뒤, n을 설정해 호출 한 번에 결과를 여러 장 받으세요. Sume의 Image API에서 하는 방법입니다.
- 이미지로 음악 만드는 AI: 사진으로 트랙 생성하기
이미지로 음악을 만드는 AI는 사진을 트랙의 입력으로 씁니다. Sume에서는 텍스트 프롬프트와 함께 image_url을 Music Router로 보내며, 가격은 그대로입니다.
- Image-to-Video와 Reference-to-Video의 차이는?
이미지로 영상 만들기는 이미지를 첫 프레임으로 쓰고, 레퍼런스로 영상 만들기는 이미지·클립·오디오를 가이드로 씁니다. 언제 무엇을 쓰고, 함께 보내면 무엇이 우선하는지 정리했습니다.
- 한국어 TTS API: 한글 대본에 language ko 지정하기
한국어 TTS는 한글로 쓴 대본에 언어를 ko로 지정해 보내면 됩니다. Sume TTS API가 한국어를 읽는 방식, 음성 검사, 과금 방식을 설명합니다.
작성자 Sume