Gemini 3.1 Pro의 벤치마크 지배, 그리고 ARC-AGI-3에서 드러난 균열
Gemini 3.1 Pro의 벤치마크 우위 폭과 ARC-AGI-2 77.1% 성과, AGI 임박론 대 벤치마크 과적합론 논쟁, ARC-AGI-3에서 나타난 점수 급락을 정리한다.
2026-08-14 · 최초 발행 2026-04-03
2026년 2월, Google DeepMind가 공개한 Gemini 3.1 Pro는 AI 업계의 벤치마크 경쟁 구도를 근본적으로 재편했다. ARC-AGI-2에서 77.1%를 기록하며 추상 추론 영역에서 압도적 우위를 보였고, 주요 16개 벤치마크 중 13개에서 1위를 차지했다. 이 결과는 "AGI 임박" 대 "벤치마크 과적합"이라는 논쟁을 촉발하며, AI 모델 평가 방법론 자체에 대한 근본적 질문을 던지고 있다.
Gemini 3.1 Pro는 무엇을 들고 나왔나
Gemini 3.1 Pro는 Google DeepMind가 2026년 2월 19일 공개한 차세대 멀티모달 AI 모델이다. 이전 세대인 Gemini 3 Pro 대비 추론 성능이 2배 이상 향상되었으며, 특히 과학적 추론과 추상적 패턴 인식에서 비약적 발전을 이루었다.
| 항목 | 내용 |
|---|---|
| 출시일 | 2026년 2월 19일 |
| 개발사 | Google DeepMind |
| ARC-AGI-2 점수 | 77.1% |
| 이전 모델 대비 | 추론 성능 2배 이상 향상 |
ARC-AGI-2에서 벌어진 격차
ARC-AGI-2(Abstraction and Reasoning Corpus for AGI)는 완전히 새로운 논리 패턴을 풀어야 하는 벤치마크로, 단순 패턴 매칭이나 암기로는 해결할 수 없도록 설계됐다. Gemini 3.1 Pro는 이 벤치마크에서 77.1%를 달성하며 경쟁 모델들을 크게 앞섰다.
| 모델 | ARC-AGI-2 | GPQA Diamond | SWE-Bench Verified | Terminal-Bench 2.0 |
|---|---|---|---|---|
| Gemini 3.1 Pro | 77.1% | 94.3% | 80.6% | 68.5% |
| Claude Opus 4.6 | 68.8% | 91.3% | 80.8% | 65.2% |
| GPT-5.4 | 64.5% | 92.4% | 79.6% | 63.8% |
| Claude Sonnet 4.6 | 58.3% | 88.7% | 79.6% | 62.1% |
Gemini 3.1 Pro가 ARC-AGI-2에서 경쟁 모델 대비 8~18%p 이상의 격차를 보이는 것은 추상 추론 능력에서의 구조적 우위를 시사한다.
벤치마크마다 다른 승자
2026년 상반기 기준, 프론티어 AI 모델 간의 벤치마크 경쟁은 그 어느 때보다 치열하다. 다음 다이어그램은 주요 모델들의 벤치마크 경쟁 구도를 시각화한 것이다.
Gemini 3.1 Pro가 1위를 차지한 13개 벤치마크는 추상 추론·과학 지식, 코딩·소프트웨어 엔지니어링, 에이전트·멀티모달 작업 전반에 걸쳐 있다. 추상 추론·과학 지식에서는 ARC-AGI-2 77.1%로 2위 Claude Opus 4.6(68.8%) 대비 8.3%p 격차를 벌렸고, 전문가 수준 과학 지식을 평가하는 GPQA Diamond에서 94.3%를, 수학적 추론을 다루는 MATH-500에서 최고 점수를 기록했다. 코딩·소프트웨어 엔지니어링에서는 CLI 기반 작업을 다루는 Terminal-Bench 2.0에서 68.5%로 1위를, 코드 생성 벤치마크 HumanEval+에서 선두를 차지했지만, SWE-Bench Verified에서는 80.6%로 2위이며 1위 Claude Opus 4.6(80.8%)과는 0.2%p 차이에 그쳤다. 에이전트·멀티모달 작업에서는 웹 에이전트 작업을 다루는 VisualWebArena, 문서 이해를 다루는 DocVQA, 종합 지식 평가인 MMLU-Pro에서 최고 점수를 기록했다.
"AGI 임박"인가 "벤치마크 과적합"인가
Gemini 3.1 Pro의 결과는 AI 커뮤니티에서 양극화된 반응을 이끌어냈다.
AGI 임박론: 일부 연구자들은 ARC-AGI-2에서의 77.1% 달성이 인간 수준의 추상 추론에 근접했음을 의미한다고 주장한다. ARC-AGI는 본래 현재 AI 시스템이 넘기 어렵도록 설계된 벤치마크였으나, 이제 프론티어 모델이 이를 상당 부분 해결하고 있다는 점에서 AGI로의 진전이 가속화되고 있다는 해석이다.
벤치마크 과적합론: 반대편에서는 벤치마크 점수가 실제 범용 지능과 직결되지 않는다는 비판이 제기된다. SmartScope의 분석에 따르면, Google이 공개한 벤치마크 목록은 Gemini 3.1 Pro에 유리한 영역을 선별적으로 포함한 것일 수 있으며, 실무 작업(GDPval-AA)이나 금융 에이전트(Finance Agent) 같은 벤치마크에서는 Claude Sonnet 4.6이 앞서고 있다.
ARC-AGI-3가 드러낸 균열
주목할 점은 ARC-AGI-3가 이미 공개되었으며, 이 새 버전에서 Gemini 3.1 Pro의 점수는 0.37%로 급락했다는 사실이다. 이는 현재의 벤치마크 성과가 특정 유형의 문제에 대한 최적화 결과일 수 있음을 시사하며, 진정한 범용 추론 능력과 벤치마크 점수 사이의 간극을 극명하게 드러낸다.
| 벤치마크 | Gemini 3.1 Pro 점수 | 의미 |
|---|---|---|
| ARC-AGI-1 | 91.5% | 사실상 해결 |
| ARC-AGI-2 | 77.1% | 고수준 달성 |
| ARC-AGI-3 | 0.37% | 사실상 미해결 |
이 격차는 벤치마크 설계의 난이도 조절이 AI 능력 평가에 얼마나 결정적 영향을 미치는지를 보여준다.
순위보다 업무 영역이 먼저다
벤치마크 순위보다 중요한 것은 각 모델이 특정 업무 영역에서 보이는 실질적 성능이다. 2026년 현재, 프론티어 모델들은 영역별로 강점이 분화되는 양상을 보인다. 추상 추론·과학 연구에서는 Gemini 3.1 Pro가 최적 선택이고, 소프트웨어 엔지니어링에서는 Claude Opus 4.6과 Gemini 3.1 Pro가 근소한 차이로 경합하며, 실무 오피스 작업에서는 Claude Sonnet 4.6이 GDPval-AA에서 압도적 1위를 차지한다. 컴퓨터 사용·자동화에서는 GPT-5.4가 OSWorld 75%로 선두이고, 비용 효율성 면에서는 Claude Sonnet 4.6이 플래그십 모델의 1/5 가격으로 95% 이상 성능을 제공한다.
Gemini 3.1 Pro의 벤치마크 우위와 ARC-AGI-2 77.1%는 AI 추론 능력의 비약적 발전을 입증하는 성과다. 그러나 ARC-AGI-3에서의 0.37% 급락은 현재 벤치마크 성과가 진정한 범용 지능으로의 도달을 의미하지 않음을 경고한다. 실무자 입장에서는 단일 벤치마크 순위에 매몰되기보다, 자신의 업무 영역에 최적화된 모델을 선택하는 전략이 필요하다. AI 모델 평가 방법론 자체의 진화가 모델 성능 향상 못지않게 중요한 과제로 부상하고 있다.
Sources
- Gemini 3.1 Pro Scores 77.1% on ARC-AGI-2 - Medium
- Behind Gemini 3.1 Pro's 13 out of 16 Wins - SmartScope
- Google Releases Gemini 3.1 Pro Benchmarks - OfficeChai
- Gemini 3.1 Pro Model Card - Google DeepMind
- ARC-AGI-3 Released, Gemini 3.1 Pro Top Scores - OfficeChai
- Gemini 3.1 Pro vs Claude Opus 4.6 vs GPT-5.2 - NxCode