Claude Mythos Preview가 GPQA Diamond 94.6%를 찍었을 때, 그 0.3포인트가 의미하는 것
초대 전용 사이버보안 특화 모델 Claude Mythos Preview의 GPQA Diamond·SWE-bench 최고점 경신과 일반 공개 모델 Claude Opus 4.7의 SWE-bench 87.6% 달성, 벤치마크 포화·오염 문제를 함께 정리한다.
2026-08-14 · 최초 발행 2026-05-18
2026년 4월 7일, Anthropic은 Claude Mythos Preview를 공개하며 GPQA Diamond 94.6%, SWE-bench Verified 93.9%, CyberGym 83.1%로 기록에 남아 있는 벤치마크 최고점을 동시에 경신했다. 같은 날 발표된 Project Glasswing을 통해 12개 창립 기관과 약 40개의 검증된 핵심 인프라 운영자에게 초대 전용으로 제공되는 이 모델은 일반 공개 계획 없이 사이버보안과 핵심 인프라 보호에 특화됐다. 한편 일반 공개 모델인 Claude Opus 4.7은 2026년 4월 16일 출시되어 SWE-bench Verified 87.6%로 다중 파일 코드 추론 분야 1위를 유지하며 상용 AI 코딩 에이전트의 새로운 기준을 제시했다.
초대장 없이는 못 쓰는 모델
Anthropic이 Claude Mythos Preview를 발표하면서 함께 공개한 Project Glasswing은 프론티어 AI를 활용해 핵심 소프트웨어 인프라를 보안하는 범산업 이니셔티브다. Claude Mythos Preview는 이 프로젝트의 핵심 도구로, 운영 체제와 주요 브라우저 전반에 걸쳐 수천 개의 제로데이 취약점을 자율적으로 발견하는 능력을 갖췄다고 알려져 있다.
접근 방식은 일반 API와 다르다. 파트너 프로그램을 통한 초대 전용 접근이며, 가격은 입력 토큰 백만 개당 25달러, 출력 토큰 백만 개당 125달러로 Claude Opus 4.7 대비 5배 높게 책정됐다. 이는 모델의 역량이 특수 목적에 집중돼 있으며 범용 사용을 의도하지 않음을 시사한다.
94.6%짜리 추론을 뒷받침하는 아키텍처 전략
GPQA Diamond 94.6%라는 성능은 단순한 파라미터 증가만으로는 설명되지 않는다. 이 수준의 추론 성능을 달성하기 위해 프론티어 LLM들이 채택하고 있는 핵심 아키텍처 전략들을 살펴본다.
단계별 추론 과정을 명시적으로 생성하도록 훈련하는 연쇄 추론(Chain-of-Thought, CoT) 강화는 복잡한 다단계 문제에서 정확도를 비약적으로 끌어올린다. GPQA Diamond처럼 대학원 수준의 과학 문제를 다루는 벤치마크에서 CoT는 필수적이며, 최신 모델들은 내부적으로 추론 체인을 더 길게 생성하고 자기 검증(self-verification) 단계를 거치도록 설계되고 있다. 테스트 타임 컴퓨팅(test-time compute) 증가는 2025~2026년 추론 성능 향상의 주된 동력이다. 모델이 추론 시간 동안 더 많은 컴퓨트를 써서 여러 답변 경로를 탐색하고 최선의 경로를 선택하도록 허용하면 성능이 크게 높아지며, RLHF·RLAIF와 수학·과학 도메인에 특화된 강화학습 신호가 결합됐다. 단일 추론 호출이 아닌 여러 단계의 추론이 연결되는 멀티스텝 추론 체인(Multi-step Reasoning Chain)은 각 단계에서 중간 결과를 검증하고 오류를 수정할 수 있어 복잡한 과학 추론에서 누적 오류를 줄인다.
훈련 데이터의 질적 향상도 중요하다. 특히 대학원 수준 STEM 문제, 과학 논문, 수학 증명 등 고난도 추론 데이터의 비중을 높이고 합성 데이터(synthetic data)로 희소한 고품질 예시를 보강하는 지식 표현 밀도 향상 전략이 활용된다.
다중 파일 패치까지 요구하는 SWE-bench
SWE-bench는 2023년 프린스턴 대학에서 개발된 실제 소프트웨어 엔지니어링 능력 평가 벤치마크로, 현재 AI 코딩 에이전트 평가의 표준으로 자리 잡았다. SWE-bench Verified는 GitHub 이슈와 이에 대응하는 실제 코드 수정 패치로 구성되며, 평가 대상 모델은 이슈 설명을 읽고 실제 저장소 코드를 탐색해 올바른 패치를 생성해야 한다. 단순한 코드 완성이 아니라 버그 재현, 근본 원인 분석, 다중 파일 수정, 테스트 통과의 전체 사이클을 요구한다.
실제 소프트웨어 엔지니어링 문제의 핵심 복잡성은 수십~수백 개의 파일에 걸친 맥락 이해에 있다. 클래스 상속 구조, 모듈 간 의존성, 전역 상태 관리 패턴을 파악해야 올바른 패치를 생성할 수 있으며, 최신 모델들이 확장된 컨텍스트 창(1M 토큰)을 갖추게 된 것이 이 분야 성능 향상에 직접 기여했다. 생성된 패치는 실제 테스트 스위트를 통과해야 하는데, 이는 단순히 코드가 실행되는 것을 넘어 의도한 동작을 정확히 구현해야 함을 의미한다. 실패하는 테스트를 통과시키면서 기존 테스트를 깨지 않는 균형 잡힌 패치 생성 능력이 평가된다.
| 벤치마크 | 평가 항목 | 태스크 수 | 주요 특징 |
|---|---|---|---|
| SWE-bench Verified | GitHub 이슈 → 패치 생성 | 500 | 인간 검증된 해결 가능한 이슈 |
| SWE-bench Pro | 프로덕션 복잡도 이슈 | 미공개 | 실제 기업 코드베이스 기반 |
| Rakuten-SWE-Bench | 프로덕션 태스크 | 미공개 | 대규모 실제 코드베이스 |
| MCP-Atlas | 도구 사용 + 코딩 | 미공개 | 멀티 컨텍스트 프로토콜 활용 |
일반 공개 모델이 만든 실질적 진보
Claude Opus 4.7은 2026년 4월 16일 출시되어 이전 버전(Claude Opus 4.6, 80.8%)에서 약 7포인트 향상된 87.6%를 SWE-bench Verified에서 달성했다. 이는 당시 공개 모델 중 최고 성능이다.
Anthropic의 내부 테스트에서 Opus 4.7은 Rakuten-SWE-Bench 기준 Opus 4.6 대비 3배 많은 프로덕션 태스크를 해결했다. 이 향상은 단순한 코드 생성 능력 향상이 아니라 복잡한 다단계 작업에서 중간에 포기하지 않고 지속적으로 문제를 추구하는 "에이전트 지속성"의 개선에서 비롯됐다. 1M 토큰 컨텍스트 창과 멀티 파일 패치에 특화된 훈련이 결합되면서, 기존에는 여러 파일을 수정해야 하는 복잡한 리팩토링 태스크에서 성능이 저조했지만 Opus 4.7은 대형 코드베이스의 아키텍처 수준 추론에서 두드러진 향상을 보인다. 비교 성능을 보면 SWE-bench Pro에서 64.3%로 GPT-5.4 대비 우위를 보였고, MCP-Atlas 도구 활용에서는 77.3%로 GPT-5.4의 68.1% 대비 우위를 보였으며, GPQA Diamond에서는 94.2%로 Claude Mythos Preview의 94.6%에 근접했다.
프런티어 모델들의 격차는 얼마나 벌어져 있나
2026년 5월 기준 주요 프론티어 모델의 핵심 벤치마크 성능을 비교하면 다음과 같다.
| 모델 | GPQA Diamond | SWE-bench Verified | 출력 토큰 가격($/M) | 출시일 |
|---|---|---|---|---|
| Claude Mythos Preview | 94.6% | 93.9% | $125 | 2026.04.07 |
| Gemini 3.1 Pro | 94.3% | 미공개 | 미공개 | 2026년 |
| Claude Opus 4.7 | 94.2% | 87.6% | $25 | 2026.04.16 |
| GPT-5.5 | ~93.x% | ~85% | $30+ | 2026년 |
| DeepSeek V4-Pro | 미공개 | 80.6% | $3.48 | 2026.04.24 |
Claude Mythos Preview의 GPQA Diamond 94.6%는 2위인 Gemini 3.1 Pro 94.3%와 불과 0.3포인트 차이다. SWE-bench에서는 Mythos Preview의 93.9%가 Opus 4.7의 87.6%보다 6.3포인트 높지만, Mythos Preview는 초대 전용 특수 모델임을 감안해야 한다.
비용 대비 성능 관점에서는 Claude Opus 4.7이 주목할 만하다. Mythos Preview 대비 1/5 가격으로 GPQA Diamond에서 0.4포인트 낮은 성능을 제공하며, SWE-bench에서도 87.6%라는 여전히 업계 최상위 수준을 유지한다. 범용 코딩 에이전트 구축 목적에서는 Opus 4.7이 실용적 최선 선택으로 평가받는다.
점수 차이가 실력 차이를 뜻하지는 않는다
고성능 벤치마크 결과를 해석할 때 반드시 고려해야 할 요소들이 있다. GPQA Diamond는 198문항으로 구성된다. 94.6%와 94.2%의 차이는 불과 0~1문항 수준으로, 통계적으로 유의미한 차이라 보기 어렵다. llm-stats.com의 분석도 상위 4개 모델이 0.5포인트 내에 집중돼 있어 "사실상 통계적으로 구분 불가능"하다고 평가한다.
벤치마크 오염(Benchmark Contamination)은 모델이 훈련 데이터에 벤치마크 문항이나 유사 문제가 포함됐을 가능성을 말한다. GPQA Diamond는 오염 방지를 위해 공개되지 않은 홀드아웃 세트를 쓰지만, 대형 웹 크롤 데이터에 관련 콘텐츠가 포함됐을 가능성을 완전히 배제하기 어렵다. 94~95% 수준에서 GPQA Diamond는 벤치마크 포화(Benchmark Saturation)에 가까워지고 있다. 이 시점부터는 벤치마크 점수 개선이 실제 추론 능력 향상을 대표하지 못할 수 있으며, 더 어려운 차세대 벤치마크의 필요성이 대두된다. Rakuten-SWE-Bench처럼 실제 프로덕션 코드베이스를 기반으로 한 평가에서의 성능이 학술 벤치마크보다 실용적 가치를 더 잘 반영할 수 있다는 점도 실제 업무 성능과의 괴리를 보여준다 — Opus 4.7이 Rakuten-SWE-Bench에서 Opus 4.6 대비 3배 향상을 보인 것은 실제 업무 효용의 의미 있는 지표다.
Claude Mythos Preview의 GPQA Diamond 94.6%는 프론티어 LLM 추론 능력이 인간 전문가 수준에 근접했음을 보여주는 이정표지만, 상위 모델들 간의 통계적 구분이 어렵다는 점에서 수치 자체보다 실제 업무 적용 성능에 주목해야 한다. Claude Opus 4.7의 SWE-bench 87.6%는 다중 파일 추론과 에이전트 지속성 개선을 통해 달성된 실질적 진보이며, 코딩 에이전트 상용화의 현실적 기준점이 된다. 2026년 프론티어 LLM 경쟁은 단순 벤치마크 점수에서 실제 업무 효용과 비용 효율성으로 평가 축이 이동하고 있다.
Sources
- https://llm-stats.com/blog/research/claude-mythos-preview-launch
- https://llm-stats.com/models/claude-mythos-preview
- https://llm-stats.com/benchmarks/gpqa
- https://claudefa.st/blog/models/claude-mythos
- https://dig.watch/updates/claude-mythos-preview-sets-new-benchmark-for-ai-capability-and-raises-governance-questions
- https://www.vellum.ai/blog/claude-opus-4-7-benchmarks-explained
- https://www.buildfastwithai.com/blogs/claude-opus-4-7-review-benchmarks-2026
- https://tokenmix.ai/blog/swe-bench-2026-claude-opus-4-7-wins
- https://llm-stats.com/benchmarks/swe-bench-verified
- https://thenextweb.com/news/anthropic-claude-opus-4-7-coding-agentic-benchmarks-release
- https://help.apiyi.com/en/gpt-5-5-vs-claude-opus-4-7-coding-comparison-en.html