FLUX.2와 Midjourney V8.1 이미지 생성 인프라 비교

FLUX.2 Pro·dev·klein의 배포 구조와 소비자 GPU 최적화, Midjourney V8.1의 드래프트·HD 워크플로우를 비교하고 자체 호스팅과 API 선택 기준을 짚는다.

2026-08-14 · 최초 발행 2026-08-02

모델 구조가 배포 방식까지 결정한다

2026년 이미지 생성 인프라는 같은 품질 경쟁 안에서도 서로 다른 방향으로 갈라지고 있다. Black Forest Labs의 FLUX.2는 32B 파라미터 오픈웨이트와 소비자 GPU용 경량 모델을 함께 제공한다. Midjourney V8.1은 네이티브 2K HD 렌더링과 24장 드래프트 모드를 결합해 크리에이터의 탐색 과정을 단축하는 쪽에 무게를 둔다.

FLUX.2는 2025년 11월 25일 처음 공개됐다. 기본 구조는 32B 파라미터 레이턴트 플로우 매칭 트랜스포머(latent flow matching transformer)이며, 텍스트-이미지 생성과 이미지 편집을 하나의 체크포인트에서 처리한다. FLUX.1에서 사용하던 구성을 그대로 확장한 모델은 아니다. VAE를 새로 훈련해 학습 가능성, 품질, 압축률 사이의 균형을 조정했다.

프롬프트와 실세계 지식은 Mistral 계열 24B 파라미터 비전-언어 모델(VLM)이 해석한다. 렉티파이드 플로우 트랜스포머(rectified flow transformer)는 공간 관계와 소재 표현, 광원 같은 시각적 세부 사항을 맡는다. 두 부분을 결합함으로써 여러 대상과 조건이 섞인 프롬프트를 기존 디퓨전 모델보다 정교하게 처리한다.

생성과 편집은 최대 4메가픽셀까지 지원한다. 시각 레퍼런스는 최대 10개를 사용할 수 있어 캐릭터, 제품, 스타일을 연속된 결과물에서 유지할 수 있다. 텍스트와 레이아웃 렌더링도 주요 기능에 포함된다. 브랜드 에셋이나 동일 캐릭터를 반복해서 제작하는 환경이라면 멀티 레퍼런스 지원이 모델 선택의 직접적인 기준이 된다.

API와 오픈웨이트 사이의 배포 선택지

FLUX.2 포트폴리오는 Pro·dev·klein 3계층을 중심축으로 삼고, Flex와 Max까지 선택지를 확장했다. 각 모델은 단순한 품질 등급이 아니라 라이선스, 실행 환경, 비용 구조가 다르다.

FLUX.2 모델 패밀리Pro(상업용 API)Flex(개발자 파라미터 제어)dev(32B 오픈웨이트)Max(최고 품질 API)klein(소비자 GPU 경량)$0.03/이미지(1024×1024)BFL API 직접 연동엔터프라이즈 통합스텝·가이던스 스케일 제어텍스트 렌더링 강점 $2.46/이미지고급 워크플로우용HuggingFace 공개비상업 라이선스18~24GB VRAM 가능4bit·FP8 양자화최고 품질 우선최종 결과물 생성4B 파라미터 13GB VRAM9B 파라미터 29GB VRAMApache 2.0 완전 오픈소스서브초 생성 가능

Pro는 상업 프로덕션을 겨냥한 API 계층이다. 1024×1024 이미지 가격은 약 $0.03이며, BFL 공식 API와 FAL, Replicate, Runware 같은 파트너 서비스를 통해 엔터프라이즈 워크플로우에 연결할 수 있다.

Flex는 스텝과 가이던스 스케일을 제어해야 하는 개발자용 계층이다. 텍스트 렌더링에 강점이 있으며 고급 워크플로우에서 약 $2.46/이미지의 비용이 든다. Max는 속도나 비용보다 최종 결과물의 품질을 우선할 때 선택하는 API 모델이다.

dev는 HuggingFace에 공개된 32B 파라미터 풀 모델이다. FLUX.2-dev Non Commercial License가 적용되므로 비상업 용도라는 제약을 먼저 확인해야 한다. 완전 정밀도(full precision) 추론에는 80GB 이상의 VRAM이 필요하다. 4bit 또는 FP8 양자화와 오프로딩을 사용하면 18~24GB GPU에서도 실행할 수 있으며, 시스템 RAM이 충분하면 8GB GPU에서도 동작한다.

2026년 1월 15일 공개된 klein은 라이선스와 하드웨어 진입 장벽을 함께 낮춘 패밀리다. 4B와 9B 모델이 있으며 FLUX.2 베이스 모델에 사이즈 증류(size distillation)를 적용해 만들었다. 라이선스는 Apache 2.0이다.

Klein이 소비자 GPU를 겨냥한 방식

FLUX.2 [klein]의 목표는 소비자 하드웨어에서 서브초(sub-second) 추론을 구현하는 데 있다. 실시간 인터랙티브 애플리케이션과 결과를 빠르게 바꿔보는 크리에이티브 작업을 염두에 둔 설계다.

klein 4B는 약 13GB VRAM에서 동작하며 RTX 3090, RTX 4070 이상의 소비자 GPU에서 실행할 수 있다. klein 9B에는 약 29GB VRAM이 필요해 RTX 4090 이상이 권장된다. API 가격은 $0.009/메가픽셀이다.

보고된 생성 시간은 하드웨어에 따라 다르다. klein 4B는 0.31.2초, klein 9B는 0.52초 수준이다. 4단계 샘플링 스텝으로 고품질 이미지를 만들도록 증류됐고, NVIDIA RTX GPU용 FP8 및 NVFP4 양자화 변형도 제공된다. FP8을 적용하면 약 1.6배의 속도 향상과 40%의 VRAM 절감 효과를 얻을 수 있다. NVFP4에서는 약 2.7배의 속도 향상과 55%의 VRAM 절감 효과가 제시된다.

이 모델의 의미는 파라미터 수를 줄였다는 데서 끝나지 않는다. 텍스트-이미지 생성과 이미지 편집을 하나의 컴팩트한 아키텍처에 담으면서 멀티 레퍼런스 편집 기능도 유지했다. Black Forest Labs는 이 설계로 4B 규모에서도 처음부터 훈련한 동급 모델보다 높은 성능을 낸다고 밝히고 있다.

Midjourney는 탐색과 최종 렌더링을 나눴다

Midjourney V8.1은 2026년 4월 30일 공개됐으며 2026년 6월 10일부터 기본 모델로 사용됐다. 이 버전의 변화는 속도, 비용, 품질을 각각 개선하면서 이미지 탐색과 최종 렌더링을 별도의 단계로 다룬다는 데 있다.

HD Mode는 저해상도 이미지를 만든 뒤 업스케일하던 기존의 2단계 파이프라인을 사용하지 않는다. 처음부터 모든 픽셀을 최종 해상도로 렌더링하며, 네이티브 2048×2048(2K) 생성을 지원한다. 업스케일 과정을 거치지 않아 에지가 더 선명하고 텍스처가 깨끗하며 세부 표현의 밀도도 높다.

GPU 사용 시간은 SD 모드가 0.8분, HD 모드가 1.3분이다. 이전 V8과 비교하면 3배 빠르고 3배 저렴하다.

드래프트 모드는 아이디어를 빠르게 펼쳐보는 단계에 맞춰져 있다. 프롬프트 하나에서 저해상도·저품질 이미지 24장을 만들고, 그중 원하는 결과의 Vary 버튼을 누르면 선택한 이미지만 풀 품질과 풀 해상도로 다시 렌더링한다. 드래프트 모드 잡(job)은 표준 V8.1 SD 잡의 절반 정도에 해당하는 Fast 시간을 소비한다. 24장을 생성하면서도 비용이 절반이어서 대량 아이데이션에 적합하다. 메뉴바에서는 번개 모양 버튼으로 활성화한다.

복잡한 다중 요소 설명과 작은 디테일을 처리하는 능력도 개선됐다. 표준 잡의 렌더링 속도는 이전 버전보다 4~5배 빠르다.

자체 호스팅과 API 비용을 함께 보는 법

FLUX.2 dev 자체 호스팅은 이미지 생성량이 많아 API 비용이 커지는 조직에서 장기 TCO를 비교할 때 검토할 수 있다. 계산의 중심에는 GPU 초기 투자와 운영비, API 과금 사이의 손익분기점이 놓인다.

RTX 4090의 24GB VRAM으로 FP8 양자화된 FLUX.2 dev를 운영할 수 있지만, 비상업 라이선스라는 제약이 따른다. 상업 목적으로 자체 호스팅해야 한다면 Apache 2.0 라이선스를 적용한 FLUX.2 [klein]이 현실적인 대안이다. klein 4B는 RTX 4070의 12GB VRAM에서도 구동할 수 있다. A100이나 H100급 서버 없이 스타트업 규모의 온프레미스 이미지 생성 인프라를 구성할 수 있다는 의미다.

Midjourney V8.1은 다른 방식으로 비용을 줄인다. 기획 단계에서는 드래프트 모드로 방향을 고르고 최종 에셋만 HD 모드로 전환하는 2단계 접근을 사용할 수 있다. 같은 Fast 시간 예산이라면 드래프트 24장과 풀 품질 12장을 조합하는 편이 처음부터 HD 모드로 34장을 만드는 것보다 더 넓은 방향을 탐색할 수 있다.

FLUX.2 Pro API를 엔터프라이즈 환경에 연결할 때는 멀티 레퍼런스를 이용한 브랜드 일관성, 편집 API 기반의 기존 에셋 갱신 자동화, FAL·Replicate·Cloudflare Workers AI 등 파트너 플랫폼의 SLA와 지연 시간을 비교해야 한다. Cloudflare Workers AI와의 공식 파트너십으로 FLUX.2 dev를 엣지 환경에서 서빙할 수 있다는 점도 지연 시간이 민감한 서비스에서 검토할 선택지다.

사용 조건에 따라 달라지는 모델 선택

2026년 상반기 기준으로 모델별 성격을 나란히 놓으면 배포 방식과 워크플로우의 차이가 드러난다.

구분 FLUX.2 Pro FLUX.2 klein Midjourney V8.1 DALL-E 4
오픈웨이트 X (API) O (Apache 2.0) X (API) X (API)
최대 해상도 4MP 제한적 2K 네이티브 미공개
추론 속도 4~8초 서브초 4~5배 개선 중간
비용 기준 $0.03/이미지 $0.009/MP Fast 시간제 API 과금
멀티 레퍼런스 최대 10개 지원 Oref 지원 제한적
자체 호스팅 불가 가능 불가 불가
강점 상업 품질 속도·비용 미적 품질 텍스트 통합

FLUX.2 dev와 klein은 커스텀 파인튜닝, ComfyUI 워크플로우 연결, 로컬 개인정보 보호 환경을 구성할 수 있다. 오픈웨이트 생태계가 제공하는 이 선택권은 Midjourney와 DALL-E 같은 폐쇄형 API와 구분되는 지점이다. Midjourney V8.1은 미적 완성도와 크리에이터 친화적인 UX에서 강점을 유지한다.

상업용 자체 호스팅이 필요하면 Apache 2.0 라이선스의 FLUX.2 klein이 실용적인 선택지다. 최우선 기준이 미적 품질이라면 Midjourney V8.1의 네이티브 2K HD가 유리하다. 반복 속도와 아이데이션 비용을 줄이려면 V8.1 드래프트 모드나 FLUX.2 klein API를 검토할 수 있다. 브랜드 일관성을 유지해야 하는 멀티 레퍼런스 워크플로우에서는 최대 10개 레퍼런스를 지원하는 FLUX.2 Pro와 dev가 뚜렷한 차이를 만든다.

기술 구조만 놓고 보면 이번 세대는 멀티모달 추론, 확산 모델 아키텍처, 디스틸레이션, 레이턴트 스페이스 표현 학습이 프로덕션 시스템의 배포 조건과 어떻게 연결되는지 보여준다. FLUX.2의 오픈웨이트 3계층 전략은 자체 호스팅과 API 사이의 선택 폭을 넓힌다. Midjourney V8.1의 드래프트-HD 2단계 파이프라인은 탐색과 최종 제작에 서로 다른 비용을 배분한다. 운영자는 오픈소스 자체 호스팅 비용, 상업 API의 품질과 신뢰성, 크리에이터 워크플로우 효율이라는 3축을 기준으로 스택을 골라야 한다.

Sources

이미지 생성 AIFLUX.2Midjourney오픈웨이트GPU 인프라