---
제목: "AI 영상 캐릭터 일관성 확보 방법론 — 실행 매뉴얼"
창작제목: "얼굴을 못 박는 6단계 — 캐릭터 시트 기반 AI 영상 제작법"
출처: https://www.youtube.com/watch?v=ZsrhdgG0I1E
작성일: 2026-08-14
문서유형: 실행 매뉴얼 (요약 아님)
태그: [AI영상, 캐릭터일관성, 캐릭터시트, Higgsfield, Seedance, GPTImage2, Elements, 워크플로우, 강의자산]
---

## 문서의 목적

이 문서는 위 영상에서 설명한 **AI 영상 캐릭터 일관성 확보 방법**을 그대로 따라 할 수 있도록 단계·설정값·프롬프트 구조·검증 순서·실패 대처까지 분해해 정리한 **실행 매뉴얼**이다. 감상이나 요약이 아니라, 이 문서만 보고 작업을 재현하고 강의 커리큘럼으로 옮길 수 있게 만드는 것이 목표다.

> 표기 원칙
> - `[영상]` = 영상에서 직접 수행·언급한 내용
> - `[재구성]` = 영상의 설명을 실행 가능하게 필자가 구조화한 부분 (영상 설명란의 원본 프롬프트는 확인 불가)
> - `[검증]` = 외부 1차 자료로 교차 확인한 사실

---

## 0. 이 방법이 해결하는 문제

### 문제의 정체

| 구분 | 내용 |
|---|---|
| 증상 | 같은 인물인데 장면마다 턱선·점 위치·얼굴 형태가 달라짐 |
| 잘못된 통념 | "프롬프트를 더 자세히 쓰면 해결된다" |
| 실제 원인 | 텍스트 프롬프트는 **장면(scene)** 을 지정할 뿐 **신원(identity)** 을 지정하지 못함 |
| 정확한 명칭 | Cross-generation Drift (생성 간 신원 표류) |
| 해결 축 | 묘사의 **양**이 아니라 입력의 **종류**를 바꾼다 → 텍스트 → 이미지 레퍼런스 |

### 실패 메커니즘

모델은 매 생성마다 프롬프트를 **처음부터 새로 해석**한다. "오른쪽 눈 아래 점"이라는 문장은 위치·크기·농도에 대한 무한한 해답 공간을 갖는다. 그래서 같은 문장이라도 매번 다른 좌표에 점이 찍힌다. 이미지 레퍼런스는 이 해답 공간을 **하나로 고정**한다.

---

## 1. 전체 파이프라인

```
[Phase 1] 실패 재현 (선택)      → 프롬프트만으로 안 된다는 것을 눈으로 확인
      ↓
[Phase 2] 캐릭터 시트 제작 ★    → 3분할 이미지 1장 = 프로젝트의 원본 자산
      ↓
[Phase 3] Element 저장 + 태깅   → @이름 으로 호출 가능한 상태로 만듦
      ↓
[Phase 4] 장면 생성             → 인물 묘사 없이 장면만 서술
      ↓
[Phase 5] 파생 자산 확장        → 의상 N종 × 스타일 N종, 각각 다시 저장
      ↓
[Phase 6] 실존 인물 적용 / 다중 캐릭터
```

**핵심 원칙 한 줄:** 원본은 하나, 나머지는 전부 그 하나에서 파생시킨다.

---

## 2. Phase 1 — 실패 재현 (검증용, 건너뛰어도 됨)

강의에서 학습자에게 문제를 체감시킬 때 쓰는 단계다.

**설정값** `[영상]`
- 모델: Seedance 2.0
- 길이: 8초 / 비율: 16:9 / 해상도: 1080p

**절차**
1. 인물을 극도로 상세히 묘사한 프롬프트 작성 (예: 오른쪽 눈 아래 점, 코 위 주근깨 무리)
2. 인물 묘사는 **한 글자도 바꾸지 않고**, 장면만 3번 교체
   - 장면 A: 붐비는 거리 시장
   - 장면 B: 골든아워의 옥상
   - 장면 C: 댄스 스튜디오
3. 결과 비교

**관찰 포인트** `[영상]`
- A: 주근깨는 있으나 점이 **입술 아래**에 생김 (지시 불이행)
- B: 턱선이 부드러워지고 점 위치가 A와 불일치
- C: 얼굴이 둥글어지고 점이 커짐

**결론:** 단독 클립으로는 셋 다 훌륭하다. 연속성이 필요한 프로젝트에서는 셋 다 실패다.

---

## 3. Phase 2 — 캐릭터 시트 제작 ★ (가장 중요)

### 3-1. 도구와 설정값 `[영상]`

| 항목 | 값 | 이유 |
|---|---|---|
| 모델 | GPT Image 2 | 얼굴 미세 디테일 유지력이 높음 |
| Quality | High | 레퍼런스는 원본 품질이 곧 결과 품질 |
| 해상도 | 4K 설정 | 선명한 레퍼런스일수록 영상 모델이 읽을 정보가 많음 |
| 비율 | 16:9 | 3패널을 가로로 배치하기 위함 |

> `[검증]` GPT Image 2의 OpenAI 공식 최대 출력은 2K다. 플랫폼 UI의 "4K"는 업스케일 또는 베타 표기일 수 있으므로, **모델 네이티브 4K로 오해하지 말 것**. 실무상 의미는 "가능한 최고 옵션을 선택하라"는 것이다.

### 3-2. 프롬프트 4블록 구조 `[재구성]`

영상은 "신원을 위에서 한 번 정의하고, 장면이 아니라 **3패널로 나뉜 한 장의 이미지**를 묘사한다"고 설명한다. 이를 4블록으로 구조화하면 다음과 같다.

**Block 1 — 신원 정의 (Identity)**
인물의 고정 불변 요소만. 이름, 나이대, 직업, 인종/피부톤, 얼굴형, 눈·코·입, 머리 색과 스타일, 수염, 체형, 키 인상, 고유 표식(흉터·점 등).

**Block 2 — 의상 정의 (Outfit)**
겉옷 → 상의 → 하의 → 신발 → 액세서리 순으로 소재·색·질감까지. 이 블록이 나중에 통째로 교체되는 변수 슬롯이 된다.

**Block 3 — 레이아웃 지시 (Layout)**
"one image split into three panels"를 명시하고 각 패널의 역할을 지정.

**Block 4 — 통제 조건 (Control)**
배경, 그림자, 조명, 카메라, 금지사항.

### 3-3. 3패널의 역할 분담 `[영상]`

| 위치 | 구성 | 머리 | 목적 |
|---|---|---|---|
| 왼쪽 | 전신 **정면** | **제거** | 의상·체형·비율만 부각. 얼굴이 시선을 뺏지 않게 함 |
| 가운데 | 전신 **후면** | 포함 | 뒤에서 본 형태·헤어 뒷모습·의상 뒷면 정보 |
| 오른쪽 | 얼굴 **클로즈업**, 정면 응시 | 포함 | **얼굴 신원을 확정하는 핵심 패널** |

**왼쪽 패널의 머리를 지우는 이유:** 얼굴이 있으면 모델과 사람 모두 얼굴에 집중해 의상·비율 정보가 묻힌다. 정보를 분리해서 각 패널이 한 가지 일만 하게 만든다.

### 3-4. 배경 규정 — 중성 회색(Neutral Gray) `[영상]`

- 규정: **평평한 회색, 그림자 없음, 세 패널 모두 동일**
- 흰 배경 → 빛을 더 반사 → 인물이 미세하게 **밝게** 찍힘
- 검은 배경 → 빛을 흡수 → 인물이 미세하게 **어둡게** 찍힘
- 이 노출 편차는 시트에 그대로 각인되고, **이후 생성되는 모든 영상에 유전된다**
- 회색은 양쪽을 상쇄해 모델이 배경이 아니라 인물 자체에 집중하게 만듦

> `[검증]` Higgsfield 공식 계열 가이드도 레퍼런스 조건으로 "선명 / 정면 / 균일한 조명 / 회색 배경"을 제시한다. 회색 배경은 이 영상만의 팁이 아니라 업계 표준에 가깝다.

### 3-5. 템플릿 프롬프트 `[재구성]`

```text
A single 16:9 image divided into three equal vertical panels, 
character sheet layout, flat neutral gray background (#808080), 
no shadows, even soft studio lighting, consistent exposure across all panels.

CHARACTER: Elias Rowe, late-20s expedition cartographer.
[얼굴] oval face, defined jawline, light stubble, deep-set hazel eyes, 
straight nose, medium-thick eyebrows, short dark-brown hair swept back.
[체형] lean athletic build, 183cm impression, broad shoulders.

OUTFIT (identical in all panels):
weathered olive canvas field jacket with brass buttons, 
charcoal wool henley underneath, dark brown leather belt, 
slate cargo trousers, scuffed tan leather boots, 
worn leather satchel across the chest.

PANEL LEFT: full-body FRONT view, head removed / cropped above the neck. 
Outfit, proportions and build fully visible. Neutral standing pose, arms at sides.

PANEL CENTER: full-body BACK view, head included. 
Same outfit seen from behind. Same neutral standing pose.

PANEL RIGHT: tight CLOSE-UP of the face, looking straight into the camera, 
neutral expression, sharp focus on facial features.

Photorealistic, high detail, no text, no props other than described.
```

### 3-6. 시트 합격 기준 (다음 단계로 넘어가기 전 확인)

- 세 패널의 **의상이 완전히 동일**한가
- 세 패널의 **밝기와 색온도가 동일**한가
- 오른쪽 클로즈업이 **정면을 정확히 응시**하는가
- 배경에 그림자·그라데이션·텍스처가 없는가
- 지정한 고유 표식이 **의도한 위치**에 있는가

하나라도 어긋나면 **여기서 다시 만든다.** 이 단계의 결함은 이후 모든 영상에 복리로 누적된다.

---

## 4. Phase 3 — Element 저장과 태깅

### 절차 `[영상]`

1. 완성된 시트를 **Element로 저장**
2. 카테고리: `character`
3. 이름 지정 (예: `Elias Rowe`)
4. 이후 어떤 프롬프트에서든 `@Elias Rowe` 로 호출

### 이름 짓기 규칙 `[재구성]`

- 짧고 고유하게 (일반 명사 금지 — 프롬프트 문장과 충돌)
- 프로젝트 접두어를 붙이면 자산이 늘어도 관리 가능: `EXP_Elias`, `EXP_Elias_Winter`
- 파생 자산은 `기본이름_변형` 규칙으로 통일

### 개념 구분 `[검증]`

| 방식 | 유효 범위 | 용도 |
|---|---|---|
| 프롬프트 내 레퍼런스 이미지 | **한 번의 생성 안에서만** | 단발 클립 |
| **Element 저장 + @태깅** | **여러 생성에 걸쳐** | 시리즈·프로젝트 ← 이 방법의 핵심 |
| Soul ID (학습 기반) | 영구 신원 | 실존 인물·상업용 |

이 셋을 혼동하면 "레퍼런스를 넣었는데 왜 다음 클립에서 바뀌죠?"라는 질문이 나온다.

---

## 5. Phase 4 — 장면 생성 (인물 묘사 전면 금지)

### 5-1. 설정값 `[영상]`

| 항목 | 값 |
|---|---|
| 모델 | Seedance 2.0 |
| 길이 | 15초 (대사 포함 풀 씬 기준) |
| 해상도 | 1080p |
| 비율 | 16:9 (일반) / 21:9 (시네마틱) |

### 5-2. 장면 프롬프트 5블록 구조 `[재구성]`

```
1. @태그        → @Elias Rowe
2. 장소 + 시간   → 언제 어디인가
3. 행동          → 무엇을 하는가
4. 카메라        → 어떤 앵글·움직임인가
5. 조명 + 분위기  → 어떤 톤인가
(6. 대사)        → 있을 경우
```

**템플릿**

```text
@Elias Rowe on a rocky mountain ridge at dawn, 
checking a folded paper map against the horizon, wind moving his jacket. 
Slow dolly-in from a wide shot to a medium shot. 
Cold blue pre-sunrise light with warm rim light on the ridge, 
tense and solitary atmosphere.
```

### 5-3. 절대 금지 목록

태그를 건 이상, 아래 요소를 프롬프트에 쓰면 **모델이 시트와 문장 사이에서 충돌**을 일으킨다.

- 얼굴·머리·체형·나이·인종에 대한 형용사
- 의상 묘사 (의상 변경이 목적일 때는 Phase 5로 갈 것)
- "handsome", "rugged" 같은 주관적 인상어

**남기는 것은 장면·행동·카메라·조명뿐이다.**

### 5-4. 영상이 실제로 검증한 5개 장면 `[영상]`

| # | 장면 | 검증한 난이도 요소 |
|---|---|---|
| 1 | 새벽 산 능선 | 기본 유지 |
| 2 | 밤 폭풍 속 텐트 + 대사 | **립싱크** |
| 3 | 눈에 갇힌 오두막 → 문 열고 눈보라로 | **급격한 조명 전환 + 큰 움직임** |
| 4 | 밤 선술집, 노인과 마주 앉음 | **2인 동시 등장** |
| 5 | 해질녘 지도 가게, 상인과 대화 | **2인 + 다른 룩** |

---

## 6. Phase 5 — 파생 자산 확장

### 6-1. 의상 교체 `[영상]`

**절차**
1. GPT Image 2, 동일 설정으로 이미지 모드 진입
2. **기본 시트를 레퍼런스로 업로드**
3. "얼굴과 체형은 정확히 그대로 유지, 의상만 교체" 명시
4. 새 의상 상세 서술
5. 결과물을 **다시 Element로 저장**

**프롬프트 골격** `[재구성]`
```text
Using the uploaded character sheet as reference. 
Keep the face, facial features, hair and body proportions EXACTLY identical. 
Change ONLY the outfit to: [새 의상 상세]. 
Same three-panel layout, same flat neutral gray background, same lighting.
```

**영상이 만든 5종** `[영상]`
- 방한: 두꺼운 왁스 재킷 + 셰르파 칼라 + 비니
- 스마트 캐주얼: 흰 티 + 네이비 블레이저
- 사막 필드: 얇은 린넨 셔츠 + 챙 넓은 모자
- 해안 우천: 후드 내린 어두운 레인재킷
- 정장: 차콜 수트 + 화이트 셔츠

### 6-2. 아트스타일 변환 `[영상]`

같은 기본 시트를 레퍼런스로 두고, **핵심 특징은 유지**한 채 렌더링 스타일만 교체한다.

- 애니메 (클린 라인)
- 3D 애니메이션 (Pixar 계열)
- 픽셀아트 (저해상도에서도 식별 가능)
- 코믹북 잉크 (두꺼운 검은 선)
- 클레이메이션 (스톱모션 인형)

### 6-3. 자산 매트릭스 개념

```
기본 시트 1개
   ├─ 의상 5종   → Element 5개
   └─ 스타일 5종 → Element 5개
= 하나의 원본에서 11개의 호출 가능한 자산
```

작업량이 늘수록 이득이 커지는 구조다. 시리즈물·광고 캠페인·강의 콘텐츠처럼 **분량이 많은 프로젝트일수록 이 방법의 수익률이 높다.**

---

## 7. Phase 6 — 실존 인물 적용과 다중 캐릭터

### 7-1. 실존 인물 시트 만들기 `[영상]`

1. GPT Image 2에서 **묘사 대신 본인 사진 1장 업로드** (얼굴이 명확히 보이는 것)
2. 동일한 3패널 레이아웃으로 시트 생성
3. Element로 저장

> `[검증] 주의` Higgsfield 공식 권장 경로는 **20장 이상의 사진으로 Soul ID를 학습**시키는 방식이다. 사진 1장 시트는 빠르지만 안정성이 낮다. **얼굴이 상품인 프로젝트(브랜드 앰버서더, 강사 본인 출연 등)라면 학습 기반 방식을 쓸 것.**

### 7-2. 다중 캐릭터 동시 호출 `[영상]`

- 하나의 프롬프트에 **두 개의 Element를 동시에 태깅** (`@본인 @Elias Rowe`)
- 영상에서는 동굴에서 만나 대화하는 장면으로 검증
- 설정: 15초 / 1080p / **21:9**

> `[검증] 한계` Higgsfield 자사 문서조차 "두 캐릭터가 클로즈업을 공유하거나 물리적으로 상호작용할 때 접점에서 정체성 혼합(identity blurring)이 발생하며, 이는 Soul ID·Runway·Midjourney를 포함한 **모든 플랫폼의 미해결 문제**"라고 명시한다. 영상의 성공 사례는 성공한 컷만 보여준 것일 가능성이 높다. **2인 장면은 재생성 예산을 따로 잡아라.**

---

## 8. 검증 순서 — 난이도 5단계

시트를 만든 뒤, 아래 순서로 **점점 어렵게** 테스트해야 실전에서 안 무너진다.

| 단계 | 테스트 | 통과 기준 |
|---|---|---|
| 1 | 정적 장면, 인물 정면 | 얼굴·의상이 시트와 일치 |
| 2 | 큰 움직임 (걷기·달리기) | 여러 각도에서 동일 인물 유지 |
| 3 | **대사 장면** | 입 모양이 맞고, 말하는 중에도 얼굴 붕괴 없음 |
| 4 | **조명 급변 + 전환** (실내→실외) | 전환 프레임에서도 신원 유지 |
| 5 | **2인 상호작용** | 두 인물이 서로 섞이지 않음 |

**1~2단계만 확인하고 프로젝트에 투입하면 3단계에서 무너진다.** 대사와 2인 장면이 실제 실패 지점이다.

---

## 9. 트러블슈팅

| 증상 | 원인 | 조치 |
|---|---|---|
| 태그를 걸었는데 얼굴이 다름 | 시트 자체가 세 패널 간 불일치 | Phase 2로 돌아가 시트 재생성 |
| 인물이 시트보다 밝거나 어두움 | 배경이 흰색/검은색 | 중성 회색으로 재생성 |
| 의상이 장면마다 미세하게 바뀜 | 프롬프트에 의상 형용사가 남아 있음 | 장면 프롬프트에서 의상 서술 전부 삭제 |
| 말하는 중 얼굴이 무너짐 | 클로즈업 패널의 선명도 부족 | 시트를 더 높은 품질·해상도로 재생성 |
| 2인 장면에서 얼굴이 섞임 | 모델 레벨 한계 | 재생성 반복 / 두 인물이 겹치지 않는 구도로 재설계 / 컷 분할 |
| 후반부로 갈수록 흐트러짐 | 클립 길이가 김 | **30초 이내로 쪼개고** 컷을 나눠 이어붙이기 |
| 격한 액션에서 붕괴 | 모델 레벨 한계 | 재생성 횟수를 예산에 미리 반영 |

---

## 10. 이 방법의 한계 (반드시 고지할 것)

- **2인 상호작용의 정체성 혼합은 미해결이다.** 플랫폼을 바꿔도 해결되지 않는다. `[검증]`
- **30초를 넘기면 일관성이 저하된다.** 표정 반복과 미세 표류가 나타난다. `[검증]`
- **격한 액션 장면은 다회 재생성이 전제다.** 워크플로우 문제가 아니라 모델 레벨 제약이다. `[검증]`
- **사진 1장으로 만든 실존 인물 시트는 상업용으로 부적합하다.** `[검증]`
- **영상은 제휴 링크 기반이다.** 결론이 특정 플랫폼 가입으로 수렴하는 구조임을 감안해서 볼 것.

---

## 11. 플랫폼이 바뀌어도 살아남는 3가지 원리

도구는 6개월이면 바뀐다. 아래 셋은 바뀌지 않는다. **강의로 만든다면 도구 사용법이 아니라 이 원리를 축으로 삼아야 유지보수 부담이 없다.**

1. **턴어라운드 원칙** — 정면·후면·클로즈업으로 정보를 분리해 한 장에 담는다. 애니메이션 업계의 캐릭터 턴어라운드 시트와 동일한 발상이다.
2. **노출 통제 원칙** — 레퍼런스의 배경 밝기가 결과물의 밝기를 결정한다. 중성 회색으로 변수를 제거한다.
3. **단일 원본 파생 원칙** — 변형본은 항상 원본 하나에서 파생시킨다. 변형본에서 또 변형하면 오차가 누적된다.

이 셋은 ComfyUI, Runway, Midjourney, 그 외 어떤 도구에서도 그대로 적용된다.

---

## 부록 A. 설정값 요약표

| 단계 | 도구 | 핵심 설정 |
|---|---|---|
| 실패 재현 | Seedance 2.0 | 8초 / 16:9 / 1080p |
| 캐릭터 시트 | GPT Image 2 | Quality High / 최고 해상도 / 16:9 |
| 의상·스타일 변형 | GPT Image 2 | 시트와 **동일 설정** + 시트를 레퍼런스로 업로드 |
| 장면 생성 | Seedance 2.0 | 15초 / 1080p / 16:9 |
| 시네마틱 장면 | Seedance 2.0 | 15초 / 1080p / **21:9** |

## 부록 B. 실행 순서 최소 체크리스트

- 캐릭터 1명을 정하고 신원·의상을 문서로 확정한다
- 중성 회색 배경의 3패널 시트를 만든다
- 시트 합격 기준 5개를 통과할 때까지 재생성한다
- Element로 저장하고 이름 규칙을 정한다
- 서로 다른 장면 3개에 태그만 걸어 던진다
- 대사 장면과 2인 장면으로 난이도를 올려 검증한다
- 의상·스타일 파생본을 만들고 각각 저장한다
- 30초 이상은 컷을 나눈다

---

## 부록 C. 강의 커리큘럼 매핑 제안

"10분 강의 10개" 구조로 옮기면 다음과 같다. 각 유닛이 **끝나는 시점에 눈으로 보이는 결과물**이 남는 배치다.

| 유닛 | 주제 | 학습자가 얻는 결과물 |
|---|---|---|
| 1 | 왜 얼굴이 매번 바뀌는가 (실패 재현) | 서로 다른 얼굴 3개 — 문제 체감 |
| 2 | 캐릭터 시트의 구조 | 시트 설계 문서 |
| 3 | 3패널 프롬프트 작성 | 완성된 시트 1장 ★ 첫 번째 wow |
| 4 | 회색 배경과 노출 통제 | 비교 실험 결과 3장 |
| 5 | Element 저장과 태깅 | 호출 가능한 자산 1개 |
| 6 | 장면 프롬프트 — 빼기의 기술 | 동일 인물 장면 3개 ★ 두 번째 wow |
| 7 | 대사 장면과 립싱크 검증 | 말하는 캐릭터 클립 |
| 8 | 의상 파생 | 의상 5종 자산 |
| 9 | 아트스타일 변환 | 스타일 5종 자산 ★ 세 번째 wow |
| 10 | 한계와 대처 / 2인 장면 | 트러블슈팅 시트 |
