포토리얼리즘은 Flux, 감성은 Midjourney, 글자는 Imagen — 이미지 생성 3강이 서로 다른 길을 택한 이유

Flux 2·Midjourney v7·Google Imagen 4의 Flow Matching 대 DDPM 아키텍처 차이, IP-Adapter·Omni Reference·Subject Reference 캐릭터 일관성 방법론, FID·CLIP Score·인간 선호도 평가 방법론을 정리한다.

2026-08-14 · 최초 발행 2026-05-14

확산 모델 기반 이미지 생성 아키텍처

2026년 AI 이미지 생성 시장은 Flux 2(포토리얼리즘), Midjourney v7(감성·예술 묘사), Google Imagen 4(텍스트 렌더링 정확도) 3강 구도로 확립되었다. 각 모델은 서로 다른 아키텍처 설계 철학을 바탕으로 차별화를 시도하고 있으며, 캐릭터 레퍼런스 일관성과 프롬프트 충실도(prompt fidelity)가 핵심 경쟁 요소로 부상했다. 단순히 아름다운 이미지를 생성하는 것을 넘어, 시리즈 광고·패션 룩북·소셜 캠페인에서 반복 사용 가능한 일관된 캐릭터와 스타일을 유지하는 능력이 사용자의 실질적인 선택 기준이 되고 있다.

Flow Matching과 DDPM의 차이

현대 이미지 생성 모델은 크게 두 가지 계열의 아키텍처를 채택한다.

**DDPM(Denoising Diffusion Probabilistic Models)**은 고정된 노이즈 스케줄에 따라 수백 스텝의 역확산(reverse diffusion) 과정을 거쳐 이미지를 생성한다. 안정적인 품질을 보장하지만 생성 속도가 느리다.

Flow Matching은 확률 흐름(probability flow)을 선형화하여 더 직관적인 경로로 이미지를 생성한다. 학습 안정성이 높고 더 적은 스텝으로 고품질 이미지를 생성할 수 있어 최신 모델들이 선호하는 방식이다.

Flux 2는 Rectified Flow Matching 아키텍처를 기반으로 하며, 이를 대규모 VLM(Vision-Language Model)과 결합한 하이브리드 구조로 포토리얼리즘 품질을 극대화했다.

텍스트 프롬프트텍스트 인코더(T5/CLIP)레퍼런스 이미지이미지 인코더(ViT)공유 잠재 공간확산/Flow Matching트랜스포머CFG 스케일 조정디코딩 방식단계적 DDPM 디코딩Flow Matching 직선 경로디코딩최종 이미지 출력네거티브 프롬프트시드 고정

텍스트 인코더 통합

프롬프트를 이미지로 변환하는 과정에서 텍스트 인코더의 품질이 결과물의 충실도를 결정한다. 주요 아키텍처별 텍스트 인코더 설계는 다음과 같다.

  • Flux 2: Mistral-3 24B VLM + 전용 텍스트 인코더 이중 구조. 세계 지식과 공간적 맥락을 동시에 활용
  • Midjourney v7: 자체 개발 프라이어리(priory) 모델. 감성적·예술적 표현에 특화
  • Imagen 4: T5 XXL 기반 강력한 텍스트 이해력. 특히 문자·기호·레이아웃 렌더링에서 우위

CFG 스케일과 품질-속도 트레이드오프

Classifier-Free Guidance(CFG) 스케일은 생성 이미지가 프롬프트를 얼마나 엄밀하게 따를지 조정하는 핵심 파라미터다. 스케일이 높을수록 프롬프트 충실도는 높아지지만 이미지가 인위적으로 보이고 생성 시간이 증가한다. 반대로 스케일이 낮으면 더 창의적이고 자연스럽지만 프롬프트에서 벗어날 수 있다. 실용적인 권장 범위는 모델마다 다르며 일반적으로 5~12 사이에서 조정한다.

AI 이미지 생성 프롬프트 엔지니어링 기법

캐릭터 레퍼런스 일관성 방법론

시리즈 작업에서 동일한 캐릭터를 반복 생성할 때 일관성을 유지하는 것은 상업적 활용의 핵심 요구사항이다.

Midjourney v7: Omni Reference

v7에서는 기존 --cref 파라미터가 폐지되고 Omni Reference 시스템으로 대체되었다. Omni Reference는 인물, 객체, 스타일 레퍼런스를 동시에 여러 개 스택(stack)하여 일관성을 유지한다. 강도(strength) 설정은 100500 범위이며, 일반적으로 300400이 최적이다. 실험 결과 80%의 이미지가 추가 프롬프팅 없이도 캐릭터 동일성을 유지했다.

Flux 2: IP-Adapter 통합

Flux 2는 IP-Adapter를 통한 이미지 프롬프팅을 지원한다. 레퍼런스 이미지의 시각적 특성을 잠재 공간에서 직접 주입하는 방식으로, 특히 인물 외모·의상·조명 스타일 유지에 효과적이다.

Imagen 4: Subject Reference

Google의 접근법은 주체(subject) 추출과 재합성에 중점을 둔다. 레퍼런스 이미지에서 핵심 시각적 속성을 추출하고, 이를 새로운 장면 컨텍스트와 결합하여 재합성한다.

스타일 전이 기법

스타일 전이는 특정 예술 양식이나 사진 스타일을 새로운 주제에 적용하는 기법이다.

[스타일 키워드] + [주제] + [컨텍스트] + [기술 파라미터]

예시:
"cinematic film still, golden hour, shallow depth of field, 
a woman walking through Tokyo street, 35mm lens, grain texture"

효과적인 스타일 프롬프트의 구성 요소:

  • 매체/형식 지정: oil painting, photograph, digital art
  • 시대/유파 참조: 1970s Kodachrome, Bauhaus design
  • 기술 파라미터: focal length, aperture, lighting condition
  • 질감/마감: grain, bokeh, matte finish

네거티브 프롬프트 활용

네거티브 프롬프트는 생성 과정에서 제거하고자 하는 시각적 요소를 명시한다. 일반적으로 적용되는 네거티브 요소:

  • 품질 관련: blurry, pixelated, low quality, artifacts
  • 해부학 오류: extra fingers, deformed hands, asymmetric face
  • 스타일 오염: watermark, text, signature, border

시드 제어와 반복성

시드(seed) 값을 고정하면 동일한 프롬프트에서 일관된 기반 구조의 이미지를 반복 생성할 수 있다. 시드 고정 + 프롬프트 미세 조정의 조합으로 점진적 이미지 개선이 가능하다.

이미지 생성 모델 평가 방법론

정량적 평가 지표

FID (Fréchet Inception Distance)

생성 이미지와 실제 이미지의 분포 거리를 측정하는 지표다. 낮을수록 실제 이미지에 가깝다. Inception 네트워크의 잠재 공간에서 두 분포의 프레쉐 거리를 계산한다. 한계점은 사람이 느끼는 품질 차이를 반드시 반영하지는 않는다는 점이다.

CLIP Score

텍스트 프롬프트와 생성 이미지의 시각-언어 정렬 정도를 CLIP 모델로 측정한다. 프롬프트 충실도를 자동으로 평가하는 데 활용되며, 높을수록 프롬프트를 잘 반영한 이미지다.

인간 선호도 평가

자동화 지표의 한계를 보완하기 위해 인간 평가자를 활용하는 방법이 병행된다.

  • ELO 기반 순위: 두 이미지를 대조하여 선호 이미지를 선택하는 방식으로 상대적 품질 순위 산출
  • GenAI-Bench: 다양한 프롬프트 카테고리에 걸쳐 인간 평가자가 점수를 매기는 벤치마크
  • 속성별 평가: 전반적 품질, 프롬프트 충실도, 미적 감각, 텍스트 정확도를 별도로 평가

캐릭터 일관성 벤치마크

캐릭터 일관성은 동일 캐릭터를 다른 환경·포즈·조명에서 생성했을 때 외모 동일성을 유지하는 능력을 평가한다.

  • 얼굴 유사도 점수 (FaceNet, ArcFace 기반)
  • 의상·헤어 스타일 보존율
  • 씬 간 캐릭터 드리프트 측정

Flux 2·Midjourney v7·Imagen 4 비교 분석

Flux 2 (Black Forest Labs)

2025년 11월 출시된 Flux 2는 Stable Diffusion의 원 개발팀이 만든 차세대 모델이다. Mistral-3 24B VLM과 Rectified Flow Transformer를 결합한 하이브리드 아키텍처로 포토리얼리즘을 극한까지 끌어올렸다.

  • 최대 해상도: 4메가픽셀
  • 물리 시뮬레이션: 직물 질감, 건축 디테일, 조명 물리 반영
  • API 제공: BFL API, Replicate, NVIDIA RTX 로컬 최적화
  • 모델 변형: Flux 2 Lite, Pro, Max, Ultra 등 4종

Midjourney v7

Personalization v2, Draft Mode, Omni Reference를 탑재한 v7은 광고·패션 분야에서 실질적인 생산성 도구로 자리매김했다.

  • Omni Reference: 인물+객체+스타일 복수 레퍼런스 동시 적용
  • Draft Mode: 빠른 아이디어 탐색을 위한 저해상도 고속 생성
  • 개인화: 사용자 개인 취향을 학습하여 맞춤 스타일 생성
  • 강점: 감성적·예술적 표현, 서사적 분위기 연출

Google Imagen 4

텍스트 렌더링 정확도에서 경쟁 모델을 압도한다. 패키징 디자인, 포스터, 만화, 레이블 등 텍스트가 포함된 이미지 생성에서 독보적 성능을 보인다.

  • 텍스트 렌더링: 철자 오류 없는 고정확도 문자 생성
  • 레이아웃 제어: 타이포그래피 배치 지정 기능
  • GenAI-Bench: 프롬프트 충실도·얼굴 렌더링·텍스트 레이아웃에서 DALL·E·Midjourney 상회
  • Imagen 4 Ultra/Fast: 품질 중심과 속도 중심 변형 모델 별도 제공

3강 비교 요약

기준 Flux 2 Midjourney v7 Imagen 4
포토리얼리즘 최고 우수 우수
예술적 표현 보통 최고 보통
텍스트 렌더링 보통 보통 최고
캐릭터 일관성 IP-Adapter Omni Reference Subject Reference
로컬 실행 지원(NVIDIA RTX) 불가 Vertex AI
오픈소스 일부 공개 비공개 비공개
API BFL, Replicate 자체 API Vertex AI / Gemini API

Sources

Flux2Midjourneyv7Imagen4이미지생성캐릭터일관성