cref가 사라진 자리에 Omni Reference가 들어왔다 — Midjourney v7 캐릭터 일관성의 진짜 구조

Midjourney v7의 Omni Reference(--oref) 아키텍처와 캐릭터 드리프트 방지 전략, Flux 1.1 Pro·DALL-E 3와의 프롬프트 충실도 비교, Kling·Veo 기반 이미지-영상 통합 파이프라인을 정리한다.

2026-08-14 · 최초 발행 2026-05-12

Midjourney v7 Omni Reference 아키텍처

기존 cref 방식의 한계

Midjourney v6까지 사용된 --cref (Character Reference) 파라미터는 레퍼런스 이미지의 얼굴·피부·헤어 등 외형 특징을 추출해 새 이미지에 반영하는 방식이었다. 그러나 v7에서는 --cref가 공식적으로 비호환 파라미터로 분류됐다. 사용 시 오류가 발생하거나 파라미터가 무시된다.

근본적 한계는 세 가지였다. 첫째, 인물(사람) 특징에 특화되어 소품·차량·동물 등 비인물 요소의 일관성 유지가 어려웠다. 둘째, 복잡한 의상·아이템 세부 묘사를 프롬프트만으로 재현하려면 극도로 상세한 텍스트가 필요했다. 셋째, 동일 캐릭터를 다른 카메라 앵글이나 조명 조건에서 생성할 때 "캐릭터 드리프트(character drift)"—즉 점진적인 외형 변형—가 발생했다.

Omni Reference(--oref) 동작 원리

v7의 Omni Reference(--oref)는 레퍼런스 이미지에서 시각 요소를 추출해 생성 과정에 직접 임베딩하는 범용 레퍼런스 시스템이다. 인물뿐 아니라 소품, 차량, 비인간 생명체 등 모든 시각 객체에 적용된다.

핵심 파라미터는 --ow(omni-weight)로, 1~1000 범위에서 레퍼런스 이미지 특징이 결과물에 반영되는 강도를 제어한다. 기본값은 100이며 용도에 따라 권장 범위가 다르다.

--ow 범위 효과 권장 시나리오
50~150 스타일·분위기만 차용 캐릭터 재해석, 아트 스타일 변형
200~350 외형 유사성 + 창의적 변용 다양한 씬에서 동일 캐릭터
400~600 의상·소품 세부까지 고정 제품 시각화, 일관된 캐릭터 시리즈
700~1000 레퍼런스 이미지에 최대 근접 정밀 복제, CI 자산 생성

--cw 100 파라미터를 함께 사용하면 캐릭터 가중치를 최대화하여 얼굴·의상 유지력을 높인다. 단, Omni Reference는 GPU 연산을 표준 v7 렌더링의 약 2배 소모하며, 현재 인페인팅(vary region), 아웃페인팅(pan/zoom), Draft Mode, Fast Mode와는 호환되지 않는다.

임베딩 및 특징 보존 메커니즘

Omni Reference의 핵심은 레퍼런스 이미지에서 추출한 시각 특징 벡터를 디퓨전 모델의 크로스-어텐션 레이어에 주입하는 방식이다. 이를 통해 텍스트 프롬프트와 시각 레퍼런스가 동시에 생성 과정에 영향을 미친다.

ow=100~300ow=400~600ow=700+드리프트 감지통과레퍼런스 이미지 입력특징 추출 인코더--ow 강도 설정소프트 임베딩스타일·외형 보존강성 임베딩세부 특징 고정최대 임베딩픽셀 수준 근접크로스-어텐션 레이어텍스트 프롬프트CLIP 텍스트 인코더디퓨전 샘플링생성 이미지일관성 검증--ow 상향 조정최종 출력

실제 운용 테스트에 따르면, Omni Reference(강도 400) 적용 시 약 80%의 씬에서 추가 프롬프트 수정 없이 캐릭터 동일성이 유지됐다. 나머지 20%는 씬 3 이후부터 미묘한 드리프트가 시작됐으며, --ow 값 상향이나 프롬프트 보정으로 교정 가능했다. 완전한 픽셀-아이덴티컬 복제는 아니지만 "알아볼 수 있는 동일 인물" 수준의 일관성은 실용적으로 달성된다.

Niji 7과 크로스-모델 일관성

2026년 1월 출시된 Niji 7은 v7과 캐릭터 레퍼런스를 공유할 수 있다. v7에서 확립한 사실적 스타일의 캐릭터를 Niji 7의 애니메이션 버전으로 변환하는 크로스-모델 파이프라인이 가능해졌으며, 교차 모델 일관성은 예상보다 높은 수준으로 평가된다.

프롬프트 충실도 비교: Flux 1.1 Pro vs Midjourney v7 vs DALL-E 3

벤치마크 개요

2026년 기준 주요 이미지 생성 모델의 프롬프트 충실도는 세 가지 차원에서 평가된다. (1) 복합 프롬프트 실행 정확도, (2) 텍스트 렌더링 품질, (3) 세부 속성 반영률.

Flux 1.1 Pro(Black Forest Labs)는 Artificial Analysis 벤치마크에서 Midjourney 6.1, Ideogram v2를 포함한 주요 플랫폼 대비 시각 충실도와 프롬프트 정확도 모두에서 최상위를 기록했다.

복합 프롬프트 실행 정확도

다중 객체, 특정 속성, 스타일 지시가 포함된 복잡한 프롬프트를 얼마나 정확히 수행하는지 측정한 결과다.

모델 요청 요소 포함률 특징
Flux 1.1 Pro 94% 프롬프트를 문자 그대로 실행
DALL-E 3 87% 안전 필터 반영, 비교적 높은 정확도
Stable Diffusion XL 82% 오픈소스 최강자
Midjourney v7 ~75%* 미적 해석 우선, 프롬프트 재해석 경향

*Midjourney v7의 수치는 모델 특성상 공식 벤치마크 참여 없이 추정치.

Midjourney는 프롬프트를 "문자 그대로" 실행하기보다 미적으로 재해석하는 경향이 강하다. 이는 아트 디렉터·일러스트레이터 사용 사례에서는 강점이지만, 정밀한 제품 시각화나 기술 다이어그램에서는 약점이다.

텍스트 렌더링 품질

타이포그래피 중심 프롬프트에서 생성된 텍스트의 판독 가능성을 측정했다.

모델 완벽 판독 가능 비율
Flux 1.1 Pro 78%
DALL-E 3 45%
Midjourney v6 기준 32%

텍스트 정확도에서 Flux 1.1 Pro의 우위는 압도적이다. 로고·배너·인포그래픽 제작 워크플로우에서 Flux 1.1 Pro를 선택해야 하는 핵심 이유다.

모델별 최적 활용 시나리오

미적 품질아트워크프롬프트 정밀도텍스트 포함API 통합안전성YesNoYesNo생성 목적 정의우선순위?Midjourney v7+ Omni ReferenceFlux 1.1 ProDALL-E 3캐릭터 일관성필요?--oref + --ow 설정+ --cw 100표준 v7 프롬프트오픈소스파인튜닝 필요?Flux 1.1 Dev로컬 배포Flux 1.1 Pro API(fal.ai / Replicate)OpenAI API이미지 생성 엔드포인트

이미지-영상 통합 파이프라인 설계

Kling 3.0 기반 캐릭터 영상 워크플로우

Midjourney v7로 확립한 캐릭터를 영상으로 확장할 때 Kling 3.0이 권장 솔루션으로 부상했다. Kling 3.0은 레퍼런스 이미지를 업로드하면 캐릭터의 얼굴·자세·의상·목소리를 각 샷 전반에 걸쳐 고정하는 기능을 제공한다. 카메라 변화, 씬 전환, 다른 캐릭터와의 상호작용에서도 아이덴티티를 유지한다.

특히 Kling 3.0 Omni 모드는 대화가 포함된 씬, 멀티샷 스토리보드, 엄격한 캐릭터 일관성이 요구되는 작업에 최적화됐다.

Veo 3.1과 Kling 3.0 역할 분담

Veo 3(Google DeepMind)와 Kling 3.0은 상호 보완적 강점을 가진다.

특성 Kling 3.0 Veo 3.1
복잡한 인체 동작 매우 우수 양호
프롬프트 충실도 양호 매우 우수
네이티브 오디오 미지원 지원
최대 해상도 4K 4K
캐릭터 레퍼런스 Omni 모드 지원 제한적

레퍼런스 스틸에서 복잡한 인체 동작 구현은 Kling 3.0이 우수하고, 프롬프트 기반 씬 생성과 네이티브 오디오는 Veo 3.1이 앞선다.

엔드-투-엔드 캐릭터 파이프라인

실제 콘텐츠 제작 환경에서 권장되는 Midjourney → 영상 전환 파이프라인이다.

인체 동작 중심 내레이션오디오 통합캐릭터 설계(텍스트 설명)Midjourney v7초기 캐릭터 시트 생성Omni Reference 등록--oref [이미지URL] --ow 400멀티 앵글캐릭터 시트 완성(정면/측면/후면/감정)영상 전환 경로Kling 3.0Elements 업로드레퍼런스 강도 설정Veo 3.1이미지+텍스트 프롬프트Kling 영상 클립 생성(5~10초 단위)Veo 영상 클립 생성(오디오 포함)클립 편집(DaVinci / Premiere)최종 영상 출력

API 연동 전략

Flux 1.1 Pro는 fal.ai와 Replicate를 통해 REST API로 접근 가능하다. 프롬프트 충실도가 높아야 하는 자동화 파이프라인에서 Midjourney 대신 Flux 1.1 Pro API를 선택하는 것이 합리적이다.

# fal.ai를 통한 Flux 1.1 Pro API 호출 예시
import fal_client

result = fal_client.run(
    "fal-ai/flux-pro/v1.1",
    arguments={
        "prompt": "A consistent character: young woman, red jacket, short black hair, standing in a park",
        "image_size": "portrait_4_3",
        "num_images": 4,
        "guidance_scale": 3.5,
        "num_inference_steps": 28,
    }
)

Kling API는 캐릭터 레퍼런스 이미지를 멀티파트 폼으로 업로드 후 씬 설명 텍스트와 결합하는 방식으로 동작한다. 레퍼런스 강도(reference_strength) 파라미터는 0.0~1.0 범위로 Midjourney의 --ow와 유사한 역할을 한다.

프롬프트 변환 전략: 이미지 → 영상

이미지 생성 프롬프트를 영상 프롬프트로 변환할 때 핵심은 정적 속성 기술에서 동적 동작·카메라 기술로의 전환이다.

이미지 프롬프트 패턴: [캐릭터 외형] [배경/환경] [조명] [스타일]

영상 프롬프트 패턴: [캐릭터 동작 동사] [카메라 움직임] [씬 분위기] [지속 시간]

예시 변환:

  • 이미지: "A woman in a red jacket standing in a sunlit park, cinematic lighting"
  • Kling 영상: "The woman walks slowly toward camera through a sunlit park, dolly-in shot, warm afternoon light, 6 seconds"

캐릭터 드리프트 방지 실전 전략

멀티씬 프로젝트에서 캐릭터 드리프트는 필연적 도전이다. 다음 체계적 접근법이 권장된다.

레퍼런스 이미지 품질 최적화: Omni Reference에 사용할 레퍼런스 이미지는 고해상도 정면 샷, 균일한 조명, 배경이 단순한 이미지가 효과적이다. 복잡한 배경이나 강한 그림자는 특징 추출을 방해한다.

캐릭터 시트 사전 제작: 단일 레퍼런스 이미지에 의존하지 않고 정면·측면·45도·감정 표현 등 다각도 캐릭터 시트를 먼저 제작한다. 씬 유형에 따라 가장 가까운 앵글의 레퍼런스를 선택한다.

--ow 점진 조정: 프로젝트 초반에는 --ow 200으로 시작해 드리프트 발생 시 100 단위씩 상향한다. 과도한 --ow 값은 배경·조명의 창의적 변용을 억제한다.

씬 단위 검증 루프: 긴 씬 시퀀스를 생성하기 전에 3~5장의 테스트 이미지를 먼저 생성해 일관성을 검증한다. 문제 발생 시 전체 시리즈 재생성보다 파라미터 조정 후 재시도가 효율적이다.

Sources

Midjourneyv7OmniReferenceFlux1.1Pro캐릭터일관성프롬프트충실도