인물과 캐릭터 일관성: AI 이미지에서 같은 얼굴 유지하는 법
캐릭터 일관성은 AI로 여러 장의 이미지나 영상을 만들 때 같은 인물이나 캐릭터가 같은 얼굴과 옷차림으로 보이게 유지하는 일입니다. 기준 이미지를 참조로 넣거나 전용 학습 기능을 쓰지만 작은 세부까지 똑같이 맞추기는 아직 어렵습니다.
같은 말:캐릭터 일관성AI 같은 얼굴 유지캐릭터 레퍼런스인물 일관성Character Consistency
목차
🤔 두 번째 장면에서 주인공 얼굴이 달라질 때
AI로 짧은 광고 이미지 연작이나 쇼츠 장면을 만들다 보면 반드시 부딪히는 문제가 있습니다. 첫 장면의 주인공은 마음에 드는데, 같은 설명으로 두 번째 장면을 만들면 눈매가 달라지고 세 번째 장면에서는 머리 모양까지 바뀝니다. 한 장짜리 그림이라면 상관없지만 같은 인물이 이어서 나와야 하는 작업에서는 이것 하나로 결과물을 쓸 수 없게 됩니다.
AI 이미지 생성 뜻에서 본 것처럼 모델은 매번 다른 잡음에서 출발해 그림을 만듭니다. 같은 설명을 넣어도 같은 얼굴이 나오지 않는 이유가 여기에 있습니다. 이 편에서는 같은 얼굴을 여러 장에 유지하는 방법과, 그 방법들이 어디까지 되는지를 공식 문서 기준으로 정리합니다.
🔑 캐릭터 일관성의 정의
캐릭터 일관성은 AI로 여러 장의 이미지나 영상을 만들 때 같은 인물이나 캐릭터가 같은 얼굴과 옷차림으로 보이게 유지하는 일입니다.
드라마 한 편을 찍을 때 주인공 역 배우는 모든 장면에 같은 사람이 나옵니다. 조명과 각도가 바뀌어도 시청자는 같은 사람으로 알아봅니다. AI에게는 이 배우가 없어서, 장면마다 설명만 듣고 새 배우를 뽑는 셈입니다. 캐릭터 일관성을 챙긴다는 것은 모델에게 매번 같은 배우의 사진을 건네는 일에 가깝습니다.
🧭 같은 얼굴을 유지하는 세 가지 방법
| 방법 | 하는 일 | 장점 | 한계 |
|---|---|---|---|
| 기준 이미지를 참조로 넣기 | 마음에 드는 인물 이미지를 다음 요청에 함께 넣습니다 | 도구 대부분이 지원하고 바로 쓸 수 있습니다 | 요청마다 조금씩 달라집니다 |
| 편집으로 이어 가기 | 같은 이미지를 두고 배경이나 동작만 바꿉니다 | 얼굴이 가장 잘 유지됩니다 | 구도를 크게 바꾸기 어렵습니다 |
| 전용 학습 기능 쓰기 | 한 사람의 사진 여러 장으로 그 인물을 따로 익히게 합니다 | 장면과 각도가 달라도 알아보기 쉽습니다 | 사진을 모아야 하고 도구에 묶입니다 |
실무에서는 세 가지를 섞어 씁니다. 먼저 기준이 될 얼굴 한 장을 확정하고, 그 이미지를 참조로 넣어 장면을 만들고, 같은 장면 안의 작은 변화는 편집으로 처리합니다. 인물이 계속 나오는 연재물이라면 전용 학습 기능을 검토합니다.
🖼️ 기준 이미지를 참조로 넣는 방법
가장 먼저 해 볼 방법입니다. 순서는 이렇습니다.
- 기준 얼굴을 정합니다: 정면에 가깝고 얼굴이 크게 나온 이미지를 한 장 골라 확정합니다. 옆모습이나 그림자가 짙은 이미지는 기준으로 쓰기 어렵습니다
- 다음 장면을 요청할 때 기준 이미지를 함께 넣습니다: "이 인물이 카페 창가에 앉아 책을 읽는 장면"처럼 인물은 참조로, 장면은 글로 지정합니다
- 인물 설명 문장을 고정합니다: 머리 모양, 옷 색, 안경 여부처럼 바뀌면 안 되는 특징을 한 줄로 정해 매번 똑같이 붙입니다
- 새로 만든 결과도 다음 참조로 씁니다: 구글 제미나이 문서는 일관성을 유지하려면 앞서 만든 이미지를 다음 프롬프트에 포함하라고 권합니다
도구마다 받는 참조 개수와 유지하는 인원이 다릅니다. 2026년 9월 28일 각 공식 문서 기준입니다.
| 도구 | 참조 방식 | 공식 문서에 적힌 범위 |
|---|---|---|
| 나노바나나 2 (API) | 참조 이미지 입력 | 인물 4명까지 닮은 모습, 사물 10개까지 |
| 나노바나나 프로 (API) | 참조 이미지 입력 | 인물 이미지 5장, 전체 14장까지 |
| 나노바나나 2 Lite | 참조 이미지 입력 | 인물 참조는 지원하지 않음 |
| 미드저니 V8.2 | 편집 모델에 참조 이미지 | 참조 이미지 4장까지 |
| Qwen-Image-2.1 | 참조 이미지 입력 | 참조 이미지 10장까지 |
| ChatGPT Images 2.5 | 참조 사진 입력 | 참조 사진의 인물과 제품 유지를 개선 항목으로 발표 |
같은 나노바나나 2라도 구글 블로그는 인물 5명과 사물 14개로 소개했고 API 문서는 인물 4명과 사물 10개로 적어 두었습니다. 구글 기업용 안내에는 제품과 환경에 따라 달라진다는 문구가 붙은 것으로 알려져 있어서, 숫자를 인용할 때는 어느 제품의 기준인지 함께 밝히는 편이 정확합니다.
미드저니는 방법이 바뀐 점도 알아 둬야 합니다. V7까지는 --oref 파라미터를 쓰는 옴니 레퍼런스로 인물을 유지했지만, V8.2의 편집 모델이 옴니 레퍼런스와 캐릭터 레퍼런스를 대신한다고 공식 문서가 밝혔습니다. 여러 인물을 함께 유지하려면 인물들을 한 장의 참조 이미지로 묶어 넣으라는 요령도 같은 문서에 있습니다.
🧬 전용 학습 기능: 한 사람을 따로 익히게 하기
참조 이미지 한 장으로는 요청마다 조금씩 달라지는 것을 막기 어렵습니다. 그래서 일부 도구는 한 사람의 사진 여러 장으로 그 인물을 따로 익히게 하는 기능을 둡니다.
영상과 이미지 도구를 모아 파는 힉스필드의 Soul ID가 대표적입니다. 힉스필드 도움말 기준으로 한 사람의 사진 20장 이상, 최대 80장으로 한 번 학습시키면 이후 이미지와 영상에서 같은 사람으로 유지됩니다. 같은 도움말은 참조 이미지 한 장은 생성 한 번을 붙잡아 줄 뿐 여러 번의 생성에 걸쳐서는 달라진다고 설명하며 이 기능이 필요한 이유를 밝힙니다. Soul ID 하나는 한 사람만 담고 따로 파일로 내보낼 수 없어서, 다른 도구로 옮겨 쓰지는 못합니다.
컴퓨터에 설치해 쓰는 공개 모델에서는 LoRA라는 추가 파일로 비슷한 일을 합니다. LoRA는 기존 모델에 특정 인물이나 화풍을 덧입히도록 미세하게 학습시킨 작은 파일입니다. 이 방식은 사진을 모으고 학습시키는 과정이 필요해 입문 단계에서는 부담이 큰 편입니다.
🔍 어디까지 유지되고 어디서 달라지는지
어느 방법을 쓰든 공식 문서들이 공통으로 적어 둔 한계가 있습니다.
- 완벽하지 않습니다: 구글 제미나이 모델 카드는 입력 이미지와 생성 이미지 사이의 캐릭터 일관성이 늘 완벽하지는 않다고 적었습니다
- 작은 세부는 어긋납니다: 미드저니 문서는 주근깨나 옷에 새긴 로고 같은 세부가 참조와 완전히 같지 않을 수 있다고 안내합니다
- 같은 사람으로 보이는 수준입니다: 힉스필드는 픽셀까지 같은 얼굴이 아니라 분명히 같은 사람으로 보이는 수준을 기대하라고 하고, 화풍이 크게 바뀌거나 낯선 각도에서는 작은 차이가 생길 수 있다고 적었습니다
- 반복되는 인물은 여전히 어렵습니다: OpenAI 문서도 여러 번 생성할 때 반복되는 캐릭터나 브랜드 요소의 일관성을 한계로 꼽습니다
그래서 연작을 만들 때는 장면마다 기준 이미지와 나란히 놓고 눈, 머리 모양, 옷의 무늬와 로고를 확인하는 단계를 둡니다. 어긋난 장면만 다시 만들거나 편집으로 고칩니다. 확인 목록은 AI 이미지 검수 목록에서 따로 정리합니다.
⚠️ 실존 인물을 다룰 때 확인할 것
- 초상 사용 허락을 먼저 받습니다: 실존 인물의 얼굴을 참조로 넣어 만든 결과물은 그 사람의 초상을 쓰는 일입니다. 힉스필드가 스트리머 N3on의 모습으로 AI 방송을 만들 때도 본인 초상을 정식으로 빌린 것으로 알려졌습니다. 자세한 사례는 힉스필드 N3on 무한 AI 라이브 정리에 있습니다
- 가상 인물이 제품을 추천하면 표시합니다: 공정거래위원회는 2026년 6월 1일부터 AI로 만든 가상인물이 추천하는 광고에 가상인물임을 표시하도록 했습니다. 기준은 저작권과 광고 표시 편에서 다룹니다
- 도구의 정책을 확인합니다: 구글은 검색 연결 기능에서 실존 인물의 실제 이미지를 쓰는 것을 지원하지 않는다고 밝히는 등, 도구마다 실존 인물 이미지에 제한을 둡니다
❓ 자주 묻는 질문
같은 시드 번호를 쓰면 같은 얼굴이 나오나요?
비슷한 출발점에서 시작하지만 같은 얼굴이 보장되지는 않습니다. 시드는 출발점 잡음만 정하고, 프롬프트나 장면이 바뀌면 결과도 달라집니다. 얼굴을 유지하는 데는 시드보다 기준 이미지를 참조로 넣는 방법이 훨씬 효과가 큽니다.
두 명 이상을 한 장면에 유지할 수 있나요?
도구에 따라 됩니다. 나노바나나 2는 API 문서 기준 인물 4명까지 닮은 모습을 유지한다고 적었고, 미드저니는 인물들을 한 장의 참조 이미지로 묶어 넣으라고 권합니다. 힉스필드 Soul ID는 한 사람만 담기 때문에 두 명 이상은 다른 기능을 써야 합니다. 인원이 늘수록 한 사람씩 어긋날 가능성도 커집니다.
영상에서도 같은 방법이 통하나요?
기본 원리는 같습니다. 인물이 나오는 첫 장면을 이미지로 먼저 확정하고, 그 이미지를 영상 모델에 넣어 움직이게 하면 글로만 요청할 때보다 얼굴이 덜 바뀝니다. 짧은 영상을 만드는 순서는 AI 짧은 영상 만드는 순서에서 이어 봅니다.
📋 3줄 요약
-
캐릭터 일관성은 AI로 여러 장의 이미지나 영상을 만들 때 같은 인물이나 캐릭터가 같은 얼굴과 옷차림으로 보이게 유지하는 일이고 새로 만들 때마다 출발점이 달라 저절로 유지되지 않습니다.
-
2026년 9월 28일 구글 API 문서 기준 나노바나나 2는 인물 4명까지 닮은 모습을 유지하고, 미드저니 V8.2는 참조 이미지 4장을 받으며 힉스필드 Soul ID는 한 사람의 사진 20장 이상으로 학습합니다.
-
어느 방법이든 분명히 같은 사람으로 보이는 수준이지 주근깨나 로고 같은 세부까지 똑같지는 않으므로 장면마다 확인하고, 실존 인물은 초상 사용 허락을 먼저 받습니다.
📚 참고 자료
- 구글 Gemini API 문서, Image generation: https://ai.google.dev/gemini-api/docs/image-generation
- 구글 딥마인드, Gemini 3.1 Flash Image 모델 카드: https://deepmind.google/models/model-cards/gemini-3-1-flash-image/
- 구글 블로그, Nano Banana 2 (2026-02-26): https://blog.google/innovation-and-ai/technology/ai/nano-banana-2/
- Midjourney Docs, Edit Model: https://docs.midjourney.com/hc/en-us/articles/48495453462797-Edit-Model
- Midjourney Docs, Omni Reference: https://docs.midjourney.com/hc/en-us/articles/36285124473997-Omni-Reference
- 힉스필드 도움말, Soul ID: https://higgsfield.ai/creator-hub/help-center/ai-models/how-do-i-create-and-use-a-soul-id-character
- OpenAI, Image generation guide: https://developers.openai.com/api/docs/guides/image-generation

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
브랜드 마스코트를 열 장면에 걸쳐 같은 모습으로 쓰려고 합니다. 공식 문서들이 알려 주는 한계에 비춰 가장 알맞은 기대는 무엇일까요?

