Claude Opus 4.6, LMSYS 아레나 전 부문을 동시에 석권한 첫 모델

Claude Opus 4.6이 LMSYS Chatbot Arena 텍스트·코딩·검색 세 리더보드를 동시 석권한 배경과 SWE-bench 오염 문제, GPT-5.4·Gemini 3.1 Pro와의 3강 비교를 정리한다.

2026-08-14 · 최초 발행 2026-04-17

Anthropic의 Claude Opus 4.6이 2026년 2월 출시 이후 두 달 넘게 LMSYS Chatbot Arena에서 텍스트, 코드, 검색 세 리더보드 모두 1위를 유지하고 있다. OpenAI의 GPT-5.4와 Google의 Gemini 3.1 Pro가 근소한 Elo 차이로 추격하고 있지만, 단일 모델이 세 부문을 동시에 석권한 것은 아레나 역사상 처음이다.

사람이 매긴 순위, Elo로 집계하다

LMSYS Chatbot Arena는 사용자들이 두 개의 익명 모델 출력을 비교 평가하는 크라우드소싱 기반 벤치마크다. Elo 레이팅 시스템을 적용해 모델 간 상대적 실력을 산출하며, 인간 선호도를 직접 반영한다는 점에서 자동 벤치마크보다 실용적 지표로 인정받는다.

리더보드 Elo 점수 순위
Overall (Text) 1504 1위
Coding 1549 1위
Search 1위

2026년 4월 6일 기준 Opus 4.6 Thinking 변형이 전체 리더보드 Elo 1504로 최고점을 기록했고, 코딩 리더보드에서는 1561 Coding Elo로 역대 최고치를 갱신했다. GPT-5.4의 3월 업데이트, Gemini 3.1 Pro의 도전에도 1위를 유지하고 있다.

기존에는 텍스트에서 강한 모델이 코딩에서 약하거나 그 반대인 경우가 일반적이었다. Opus 4.6이 세 부문을 동시에 석권했다는 것은 범용 추론, 코드 생성, 정보 검색 능력이 모두 최상위 수준으로 수렴했음을 의미한다.

65.4%와 80.8%, 에이전틱 벤치마크 기록

Opus 4.6의 핵심 차별점은 에이전틱(agentic) 작업 수행 능력이다. 단순 코드 생성이 아닌, 도구 사용·파일 탐색·디버깅·테스트를 자율적으로 수행하는 에이전트 시나리오에서 압도적인 성과를 보인다. 실제 터미널 환경에서 에이전트가 자율적으로 소프트웨어 엔지니어링 작업을 수행하는 능력을 평가하는 Terminal-Bench 2.0에서 65.4%(역대 최고 기록)를 냈고, 실제 GitHub 이슈를 해결하는 능력을 측정하는 SWE-bench Verified에서는 80.8%로 GPT-5.4(80.0%)와 Gemini 3.1 Pro(80.6%)를 근소하게 앞섰다. 도구 호출·컴퓨터 사용·브라우저 탐색 등 복합 에이전트 시나리오를 평가하는 Agentic Tool Use 종합에서는 평균 92.6점으로 106개 모델 중 3위를 기록했다.

SWE-bench Verified는 실제 오픈소스 프로젝트의 GitHub 이슈와 풀 리퀘스트를 기반으로 모델의 버그 수정 능력을 평가한다. GitHub 리포지토리에서 실제 이슈·대응 PR을 추출하고, 모델에게 이슈 설명과 코드베이스를 제공한 뒤, 모델이 생성한 패치를 기존 테스트 스위트로 검증해 통과율을 산출하는 절차다.

YesNoGitHub 이슈 수집코드베이스 + 이슈 설명 제공모델이 패치 생성기존 테스트 스위트 실행테스트 통과?성공 카운트 증가실패 처리최종 통과율 산출SWE-bench Verified 점수

다만 OpenAI가 공식적으로 모든 프론티어 모델에서 SWE-bench Verified의 학습 데이터 오염(contamination)을 확인했다고 발표한 점은 유의해야 한다. 이에 따라 SWE-bench Pro가 대안 벤치마크로 부상 중이다.

76% vs 18.5%, 컨텍스트 활용의 격차

2026년 2월 5일 출시된 Opus 4.6은 에이전틱 워크플로우에 최적화된 설계가 특징이다. 컨텍스트 윈도우는 1M 토큰(베타, 200K 초과 시 프리미엄 요금)이고 최대 출력 토큰은 128K다. 복잡한 추론 작업 시 중간 사고 과정을 명시적으로 전개하는 확장된 사고(Extended Thinking), 대화가 임계치에 도달하면 이전 컨텍스트를 자동 요약·교체해 장시간 에이전틱 작업을 지속하게 하는 컨텍스트 압축(Context Compaction), 작업 복잡도에 따라 사고 깊이를 동적으로 조절하는 적응적 추론 제어(Adaptive Reasoning Controls)를 갖췄다.

대규모 프롬프트 속에 매몰된 특정 사실을 찾아 추론하는 능력을 측정하는 MRCR v2(Massive Retrieval and Contextual Reasoning) 벤치마크에서 Opus 4.6은 76%를 기록했다. Sonnet 4.5의 18.5%와 비교하면 4배 이상의 격차다. 1M 컨텍스트 윈도우가 단순한 용량 확장이 아닌 실질적인 정보 활용 능력 향상으로 이어진 것이다.

GDPval은 GPT-5.4, ARC-AGI-2는 Gemini, 코딩은 Opus

2026년 4월 현재, 세 프론티어 모델은 대부분의 벤치마크에서 2~3%p 이내의 차이를 보인다. 각 모델의 강점 영역은 뚜렷하게 분화돼 있다.

평가 영역 1위 모델 핵심 수치
LMSYS Arena (전체) Claude Opus 4.6 Elo 1504
SWE-bench Verified Claude Opus 4.6 80.8%
GPQA Diamond (추론) Claude Opus 4.6 GPT-5.4 대비 +1.4%p
지식 업무(GDPval) GPT-5.4 83% (44개 직종 매칭)
ARC-AGI-2 Gemini 3.1 Pro 77.1%
멀티모달(Video-MME) Gemini 3.1 Pro 78.2%
작문 품질(블라인드 평가) Claude Opus 4.6 47% 선호율

가격 대비 성능에서는 Gemini 3.1 Pro가 Opus 4.6 대비 약 1/5 가격으로 극적인 비용 효율성을 보이고, GPT-5.4는 Opus 4.6과 유사한 가격대에서 지식 업무·도구 통합에 강점을 가지며, Opus 4.6은 프리미엄 가격대에서 코딩·추론·장문 컨텍스트 최상위 성능을 제공한다.

멀티모달지식 업무에이전틱 코딩Claude Opus 4.6SWE-bench 80.8%Terminal-Bench 65.4%GPT-5.4GDPval 83%44개 직종Gemini 3.1 ProVideo-MME 78.2%ARC-AGI-2 77.1%

벤치마크 점수 다음의 경쟁 축

Opus 4.6의 아레나 1위는 단순한 벤치마크 경쟁을 넘어 에이전틱 소프트웨어 엔지니어링의 패러다임 전환을 상징한다. 복잡한 작업을 하위 단계로 분해하고 순서를 결정하는 자율적 계획 수립 능력이 강화됐고, 컨텍스트 압축 기술로 수십 분 이상의 연속 에이전틱 세션이 가능한 장시간 작업 지속이 이뤄지며, 코드 리뷰·디버깅 과정에서 자신의 실수를 감지·수정하는 자기 교정 능력이 향상됐고, 1M 컨텍스트 윈도우로 수만 줄 규모 프로젝트 전체를 한 번에 파악하는 대규모 코드베이스 탐색이 가능해졌다.

다만 SWE-bench 등 벤치마크 점수가 실제 개발 생산성과 직결되지는 않으며, 에이전틱 코딩 도구(Claude Code, Cursor, Windsurf 등)의 오케스트레이션 품질이 모델 성능만큼 중요하다는 지적이 있다. 데이터 오염 문제로 벤치마크 자체의 신뢰도 재검토가 필요하고, 비용 효율성 측면에서는 Gemini 3.1 Pro가 대안이 될 수 있다.

Claude Opus 4.6이 LMSYS Chatbot Arena 세 리더보드 동시 1위를 달성한 것은 범용 AI 모델이 코딩·추론·검색 전 영역에서 최정상 수준에 도달할 수 있음을 입증한 사건이다. 다만 GPT-5.4와 Gemini 3.1 Pro가 각자의 강점 영역에서 2~3%p 이내로 추격하고 있어 프론티어 모델 간 격차는 사실상 수렴 중이며, 앞으로의 경쟁은 원시 벤치마크 점수보다 에이전틱 도구 통합, 비용 효율성, 개발자 경험 같은 생태계 요소에서 결정될 가능성이 높다.

Sources

ClaudeOpus4.6LMSYSArenaSWE-bench벤치마크비교에이전틱코딩