GPT Image 1.5가 이미지 생성 리더보드 1위에 오른 이유: 자기회귀 아키텍처와 아레나 평가 방법론
GPT Image 1.5의 자기회귀 트랜스포머 아키텍처와 Elo 기반 아레나 평가 방법론을 분석하고 Gemini·Grok·Flux·Midjourney와 강점을 비교한다.
2026-08-14 · 최초 발행 2026-05-03
2026년 5월 리더보드 구도
llm-stats.com 이미지 생성 리더보드에서 GPT Image 1.5가 아레나 점수 299점으로 1위를 차지하고 있다. Gemini 3.1 Flash Image(181점), Grok Imagine(98점)이 뒤를 잇는다. Artificial Analysis Image Arena에서는 GPT Image 1.5가 Elo 1,272점, GPT Image 2(high)가 1,336점을 기록하며 OpenAI 모델들이 상위권을 독점하고 있다.
이 구도는 단순한 모델 성능의 우열이 아니라 이미지 생성 AI의 아키텍처적 전환점과 평가 방법론의 성숙을 함께 보여준다. GPT Image 1.5는 LM Arena 세부 리더보드에서도 강세를 보인다. Text-to-Image Elo 1,277점, Design Arena Elo 1,344점, 그리고 Image Edit Leaderboard에서는 Elo 1,409점으로 이미지 편집 능력에서 압도적 우위를 나타낸다.
아레나 평가는 어떻게 점수를 매기는가
아레나 평가 방법론의 핵심은 인간 평가자가 두 모델의 출력을 나란히 놓고 어느 쪽이 더 낫다고 판단하는 블라인드 페어와이즈 비교다. 평가자는 어느 모델이 어느 이미지를 생성했는지 모르는 상태에서 선택을 내리며, 이 방식은 절대적 품질 척도 없이도 상대적 우열을 통계적으로 안정되게 측정할 수 있다는 장점이 있다. 평가 프롬프트는 포토리얼리즘, 예술적 스타일, 텍스트 렌더링, 복잡한 장면 구성, 인물 묘사, 제품 이미지 등 실제 사용자가 요청하는 다양한 유형에서 수집된다.
체스에서 빌려온 Elo 시스템은 비교 결과에 따라 점수를 동적으로 갱신한다. 강한 모델을 이기면 점수를 많이 얻고 약한 모델에 지면 많이 잃는다.
수만 건의 페어와이즈 비교가 축적되면 각 모델의 점수가 통계적으로 안정적인 값으로 수렴한다. 다만 이 방법론에는 평가자 편향(evaluator bias)이라는 한계가 있다 — 특정 스타일이나 미학적 취향을 가진 평가자 집단이 편중되면 점수가 왜곡될 수 있다. Artificial Analysis는 이를 보완하기 위해 다양한 국가·연령대·직군의 평가자를 모집하고 동일 프롬프트에 최소 수십 명의 응답을 수집하며, 프롬프트 카테고리별 가중치를 달리해 특정 유형에만 강한 모델이 전체 순위를 왜곡하지 않도록 설계했다.
확산 모델을 버리고 자기회귀로 간 이유
DALL-E 시리즈를 포함한 기존 이미지 생성 모델들이 확산(diffusion) 방식을 택한 것과 달리, GPT Image 1.5는 GPT-4o에서 파생된 자기회귀(autoregressive) 트랜스포머 아키텍처를 사용한다. 이미지를 픽셀 토큰 또는 패치 토큰의 시퀀스로 취급하고, 언어 모델이 다음 단어를 예측하듯 다음 이미지 토큰을 순차적으로 예측하는 방식이다. 텍스트 컨텍스트와 이미지 생성이 동일한 어텐션 레이어에서 처리되므로, 언어 모델이 보유한 방대한 세계 지식이 이미지 생성에 직접 활용된다.
이 구조의 이점은 두 갈래로 나타난다. 텍스트 토큰과 이미지 토큰이 같은 어텐션 레이어에서 상호작용하므로 "왼쪽에 빨간 사과, 오른쪽에 파란 배, 가운데에 'FRESH' 라벨"처럼 공간적 위치와 텍스트 렌더링을 동시에 요구하는 복합 프롬프트를 순수 확산 모델보다 잘 처리한다. 그리고 텍스트 렌더링 자체가 결정적으로 개선됐다 — GPT Image 1이 "가끔 읽을 수 있는" 수준이었다면 GPT Image 1.5는 "안정적으로 신뢰할 수 있는" 수준이다. 포스터, 명함, 제품 라벨, 간판처럼 텍스트가 포함된 실용적 그래픽 콘텐츠에서 실제 사용 가능한 품질을 제공하는 첫 세대로 평가받는다.
모델별 강점은 어디서 갈리는가
이미지 생성 AI의 품질은 미적 감각(aesthetics), 포토리얼리즘, 프롬프트 충실도(prompt fidelity) 세 차원으로 분해할 수 있다. 2026년 5월 기준 주요 모델의 강점은 이렇게 나뉜다.
- GPT Image 1.5 계열: 프롬프트 충실도와 텍스트 렌더링에서 압도적 우위. 복잡한 지시사항을 정확히 따르는 instruction-following 능력이 최상위
- Gemini 3.1 Flash Image: 생성 속도가 빠르고 멀티모달 통합(텍스트+이미지 혼합 입력)에 강점. Flash 버전은 비용 효율성이 높다
- Grok Imagine: X(트위터) 플랫폼 데이터 기반의 독특한 스타일 감각과 밈 문화 반영에 특화
- Flux 2 Pro(Black Forest Labs): 오픈소스 계열로 포토리얼리즘에서 가장 높은 평가를 받으며 정확한 프롬프트 리터럴 해석에 강점
- Midjourney V8 Alpha: 주관적 미적 감각에서 독보적. 예술적이고 분위기 있는 이미지 생성에 특화
이미지 편집 영역에서도 GPT Image 1.5의 강세가 뚜렷하다. Image Edit Leaderboard 1위(Elo 1,409점)는 인페인팅(특정 요소만 수정), 아웃페인팅(배경 교체), 이미지-to-이미지 스타일 변환에서 자기회귀 아키텍처의 컨텍스트 이해 능력이 그대로 반영된 결과다. "이 이미지에서 배경만 도시 야경으로 바꾸되 인물의 조명 방향은 유지해줘"처럼 조건부 편집을 정확히 이해하고 수행하는 능력이 확산 모델 기반 경쟁자들보다 우수하다.
평가 체계는 어디로 향하는가
현재의 아레나 기반 Elo 평가는 인간의 주관적 선호를 집계하는 방식이다. 앞으로는 인간 선호도와 자동화된 품질 지표를 결합한 하이브리드 평가 체계가 발전할 것으로 예상된다. CLIP Score(텍스트-이미지 정렬도), FID(분포 거리), LPIPS(지각적 유사도) 같은 정량 지표와 인간 선호도를 함께 활용하는 멀티-메트릭 리더보드가 표준화될 가능성이 높다. 의료 이미지, 법적 문서 그래픽, 교육 자료 등 특정 도메인에 특화된 리더보드도 이미 등장하고 있어, 범용 순위만으로는 모델 선택의 완전한 기준이 되기 어려운 환경이 되고 있다.
미적 감각에서는 Midjourney, 포토리얼리즘에서는 Flux, 프롬프트 정확도에서는 GPT Image 계열이 각각 강점을 갖는 다극 구도는 당분간 지속될 것으로 보인다.
Sources
- Best AI Image Generator (May 2026) — Top AI Image Generation Models Ranked by Humans | llm-stats.com
- Text to Image Leaderboard - Top AI Image Models | Artificial Analysis
- Image Arena Leaderboard - Hugging Face Space by ArtificialAnalysis
- LM Arena Text-to-Image Rankings 2026: Complete Analysis | WaveSpeedAI Blog
- GPT Image 1.5 Guide: API, Pricing & Capabilities | ScholarViz
- Introducing 4o Image Generation | OpenAI
- Artificial Intelligence: Is GPT-Image-1 a Diffusion Model? No — It's Autoregressive | C# Corner
- AI Image Generation 2026: GPT Image 1.5 and Competitors | Till Freitag
- Text-to-Image Leaderboard - Best AI Image Generators | Arena.ai