프런티어 LLM 벤치마크로 읽는 모델 선택과 가격 경쟁
GPT-5.5, Claude Opus 4.7, Gemini 3.5, DeepSeek V4, Qwen 3.7의 벤치마크와 가격 전략을 비교한다.
2026-08-14 · 최초 발행 2026-06-10
리더보드 하나로는 모델을 고를 수 없다
2026년 상반기 LLM 시장은 한 모델이 모든 작업을 지배하는 구도가 아니다. OpenAI의 GPT-5.5, Anthropic의 Claude Opus 4.7, Google의 Gemini 3.5 Flash GA, DeepSeek의 V4 Pro, Alibaba의 Qwen 3.7은 서로 다른 작업에서 우위를 보였다. DeepSeek가 단행한 75% 영구 가격 인하는 성능 경쟁에 비용 압력까지 더했다.
평가 기준도 달라졌다. MMLU와 HumanEval처럼 점수가 포화된 지표보다 SWE-bench Verified, Terminal-Bench 2.0, GPQA Diamond가 프런티어 모델 사이의 차이를 더 잘 드러내고 있다. 모델을 선택할 때는 종합 순위보다 실제로 맡길 작업, 에이전트 하네스, API 비용을 함께 봐야 한다.
분기 단위로 좁아진 출시 간격
2026년 상반기에는 주요 모델이 45개월 간격으로 연이어 등장했다. 20232024년의 연단위 릴리스 주기가 분기 단위로 짧아지면서 모델 교체와 재평가 주기도 함께 빨라졌다.
Google은 2026년 2월 Gemini 3.5 Flash GA를 먼저 내놓았다. 비용 효율과 멀티모달 추론에 집중한 모델이며, GA(General Availability) 등급의 엔터프라이즈 SLA를 바탕으로 기업 채택률을 높였다.
Anthropic은 2026년 4월 16일 Claude Opus 4.7을 출시했다. 코딩 에이전트가 주된 목표였고, SWE-bench Verified 87.6%로 클로즈드소스 모델 중 가장 높은 성적을 기록했다. LMSYS Arena 씽킹 모드 리더보드에서도 1위를 차지했다.
OpenAI의 GPT-5.5는 2026년 4월 23일 공개됐다. 1M 토큰 컨텍스트 창을 지원하고 Terminal-Bench 2.0에서 82.7%를 기록해 에이전트의 터미널 작업에서 두각을 보였다. 리서치급 추론을 겨냥한 GPT-5.5 Pro는 4월 24일 공개됐으며, 입력과 출력 1M 토큰당 $30/$180의 고가 정책을 택했다.
같은 날 나온 DeepSeek V4 Pro는 1.6조 전체 파라미터와 490억 활성 파라미터를 사용하는 MoE 모델이다. 1M 토큰 컨텍스트를 지원하며 MIT 라이선스로 공개돼 상업적 이용이 가능하다. DeepSeek는 2026년 5월 22일부터 75% 할인을 영구 적용했다. 출력 가격을 기준으로 GPT-5.5보다 34배, Claude Opus 4.7보다 17배 저렴한 수준이다.
Alibaba는 2026년 5월 20일 Cloud Summit에서 Qwen 3.7 Max를 발표했다. 에이전트 퍼스트 플래그십으로 설계됐으며 SWE-Pro 60.6, Terminal-Bench 2.0 69.7, GPQA Diamond 92.4를 기록했다. 에이전틱 코딩 태스크에서는 DeepSeek V4 Pro와 Claude Opus 4.6을 앞섰다. 오픈 웨이트는 공개되지 않았고 DashScope API를 통해 입력과 출력 1M 토큰당 $2.50/$7.50에 이용할 수 있다.
포화된 지표에서 실환경 작업으로
MMLU(Massive Multitask Language Understanding)는 57개 도메인의 지식을 평가한다. 프런티어 모델이 2024년 말부터 90% 이상을 기록하면서 변별력이 떨어졌고, 테스트 문항이 학습 데이터에 포함됐을 가능성을 뜻하는 데이터 오염 문제도 제기됐다.
164개 파이썬 함수 생성 태스크로 구성된 HumanEval도 비슷하다. 프런티어 모델 점수가 93% 이상에 도달하면서 모델 간 차이를 설명하기 어려워졌고, 실제 코딩 역량을 측정하는 중심 지표는 SWE-bench Verified로 옮겨갔다.
GPQA Diamond(Graduate-Level Google-Proof Q&A)는 박사급 전문가가 만든 생물학·화학·물리학 문항을 사용한다. 데이터 오염에 강하고 추론 능력을 평가하는 지표다. 2023년 말 최고 성적은 39% 수준이었지만 2026년에는 91~94%대로 높아졌다.
SWE-bench Verified와 SWE-bench Pro는 실제 GitHub 이슈를 해결하도록 한다. 공개 데이터셋을 사용하는 SWE-bench Verified보다 SWE-bench Pro가 더 어려우며, 두 지표 모두 에이전틱 소프트웨어 엔지니어링 역량을 보여준다.
Terminal-Bench 2.0에서는 에이전트가 실제 터미널에서 도구를 사용해 복합 작업을 반복 수행한다. 같은 모델도 어떤 에이전트 하네스와 결합하느냐에 따라 점수가 30~50%p 달라질 수 있다. 리더보드의 모델 이름만큼 하네스 설계를 확인해야 하는 이유다.
WebArena, OSWorld, GAIA, FieldWorkArena는 웹 브라우징, 데스크톱과 모바일 조작, API 호출을 포함한 멀티스텝 작업을 평가한다. 다만 2026년 Berkeley RDI 연구에서는 이 가운데 8개 벤치마크가 실제 태스크를 해결하지 않고도 근완벽 점수를 얻을 수 있다는 취약점이 보고됐다.
기업의 모델 선택에서는 성능 점수뿐 아니라 작업 하나를 완료하는 데 들어가는 API 비용을 나타내는 Cost-per-task도 주요 판단 기준이 됐다.
작업마다 달라지는 벤치마크 선두
2026년 5월 기준 공개 보고와 리더보드 집계를 비교하면 모델별 강점이 명확히 갈린다.
| 벤치마크 | Claude Opus 4.7 | GPT-5.5 | Gemini 3.5 / 3.1 Pro | DeepSeek V4 Pro | Qwen 3.7 Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 87.6% | 82.1% | 80.6% | 78.9% | 81.3% |
| SWE-bench Pro | 64.3% | 58.6% | 54.2% | 56.1% | 60.6% |
| GPQA Diamond | 91.3% | 92.8% | 94.3% | 89.7% | 92.4% |
| Terminal-Bench 2.0 | 69.4% | 82.7% | 74.1% | 71.2% | 69.7% |
| HumanEval | 91.3% | 93.5% | 94.3% | 90.8% | 88.4% |
Claude Opus 4.7은 SWE-bench Verified 87.6%와 SWE-bench Pro 64.3%로 실제 GitHub 이슈 해결에서 앞선다. Anthropic의 Constitutional AI 기반 안전성 프레임워크와 결합해 금융·의료·법률처럼 규제를 받는 산업의 엔터프라이즈 채택을 이끌고 있다.
GPT-5.5는 Terminal-Bench 2.0에서 82.7%로 가장 높은 점수를 기록했다. 코딩에 한정되지 않은 터미널 작업과 범용 에이전트 워크플로우가 강점이다. ChatGPT 생태계 통합, SOC 2 컴플라이언스, 엔터프라이즈 SSO도 대기업 채택에 영향을 주는 요소다.
Gemini 3.5 Flash GA는 GPQA Diamond 94.3%로 과학 추론에서 앞섰다. 이미지·비디오·오디오를 통합하는 Google의 멀티모달 역량과 GA 등급 엔터프라이즈 SLA가 Cloud 고객 기반의 채택을 뒷받침한다.
DeepSeek V4 Pro는 프런티어에 근접한 성능을 유지하면서 클로즈드소스 모델보다 최대 34배 낮은 비용을 제시했다. 가격과 MIT 라이선스가 스케일을 중시하는 스타트업과 비용 민감형 엔터프라이즈에 선택지를 제공한다.
Qwen 3.7 Max는 1M 토큰 컨텍스트와 네이티브 확장 사고 모드(extended-thinking mode)를 지원한다. 에이전트 퍼스트 설계와 Alibaba Cloud DashScope 통합은 아시아·태평양 엔터프라이즈 시장에서의 차별점이다.
표의 수치는 에이전트 하네스와 프롬프트 설계에 따라 달라질 수 있다. 특히 실환경 작업을 평가하는 지표는 모델 자체와 실행 환경의 영향을 분리해 읽어야 한다.
가격 차이가 운영 구조를 바꾼다
DeepSeek의 영구 가격 인하는 API 비용 경쟁을 새로운 단계로 밀어 넣었다. 원본에서 제시한 월간 출력 토큰 처리 비용 추정은 다음과 같다.
월 1억 출력 토큰 처리 시 API 비용 추정 (2026년 5월 기준)
- DeepSeek V4 Pro: 약 $348 (출력 $0.87/1M)
- Qwen 3.7 Max: 약 $750 (출력 $7.50/1M)
- GPT-5.5: 약 $3,000 (출력 $30/1M)
- Claude Opus 4.7: 약 $2,500 (출력 $15/1M 추정)
GPT-5.5 Pro는 입력과 출력 1M 토큰당 $30/$180로 연구와 고부가가치 작업에 초점을 맞춘다. 반대로 DeepSeek V4 Pro와 입력 1M 토큰당 $0.14인 V4-Flash는 비용에 민감한 대규모 작업을 겨냥한다. 이 격차는 단순한 할인 경쟁을 넘어 클로즈드소스 사업자의 수익 구조와 락인 전략에 압력을 준다.
라이선스와 배포 방식도 선택 기준이다
OpenAI GPT-5.5는 에이전틱 작업과 엔터프라이즈 안전성을 중심에 두며 입력과 출력 1M 토큰당 $5/$30의 가격 구조를 갖는다. Claude Opus 4.7은 코딩 에이전트와 안전 AI에 집중하고 가격은 약 $15/$75다. Gemini 3.5 GA는 멀티모달 처리와 비용 효율을 전면에 둔다.
DeepSeek V4 Pro는 입력과 출력 1M 토큰당 $0.435/$0.87의 가격과 MIT 라이선스를 결합한다. 상업적 사용 제한이 없어 기업이 자체 인프라에 배포하거나 파인튜닝해 API 의존도를 낮출 수 있다.
Alibaba의 Apache 2.0 계열인 Qwen 3.6은 0.6B 엣지 모델부터 235B MoE 플래그십까지 제공한다. 무료 상업 배포가 가능해 자체 호스팅 환경에 맞춘 최적화를 지원한다. GLM-5.1은 오픈웨이트 모델로 SWE-bench Pro에서 일시적으로 1위를 기록했다.
이 차이는 모델 선택을 클로즈드소스와 오픈소스 중 하나를 고르는 문제로만 두지 않는다. 고부가가치 판단·창의·연구에는 클로즈드소스 프런티어 모델을 쓰고, 반복적이며 규모가 크고 비용에 민감한 배치 작업은 DeepSeek V4 Pro나 Qwen 3.6에 맡기는 하이브리드 운영이 확산되고 있다.
모델 포트폴리오를 설계할 때 볼 것
2026년 상반기 경쟁에서는 태스크별 리더십이 분산됐다. 코딩 에이전트에서는 Claude Opus 4.7, 터미널 에이전트에서는 GPT-5.5, 과학 추론에서는 Gemini 3.5, 비용 효율에서는 DeepSeek V4 Pro가 각각 강점을 보였다. 단일 종합 점수보다 실제 사용 사례에 맞춘 모델 조합이 필요한 구도다.
오픈소스와 오픈웨이트 모델의 품질도 프런티어 수준으로 수렴하고 있다. GLM-5.1이 SWE-bench Pro에서 클로즈드소스 모델을 일시적으로 앞선 사례, DeepSeek의 MIT 라이선스, Qwen 3.6의 Apache 2.0 배포 전략은 상업적 활용 범위를 넓혔다.
평가의 중심은 단답형 Q&A에서 멀티스텝 작업 완수로 이동했다. SWE-bench, Terminal-Bench, WebArena의 점수가 모델 선택에 미치는 영향이 커졌고, 에이전트 하네스는 모델 자체만큼 중요한 변수가 됐다. 기업이 관리해야 할 대상도 하나의 최고 모델이 아니라 코딩, 자동화, 추론, 대규모 배치 작업에 맞춘 모델 포트폴리오다.
Sources
- GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro vs DeepSeek V4 — I Tested All Four and There's No Clear Winner
- Best AI Models: April + May 2026 Leaderboard (GPT-5.5, Claude Opus 4.7, DeepSeek V4)
- Claude Opus 4.7 vs GPT-5.5 vs Gemini 3.1 Pro vs DeepSeek V4 [2026]
- LLM Leaderboard 2026 — Compare Top AI Models - Vellum AI
- LLM Benchmark Methodology 2026: Reading Leaderboards
- DeepSeek V4-Pro 75% Price Cut Goes Permanent: What It Means for Developers (May 2026)
- DeepSeek V4: The Open-Source Model Frontier Labs Feared | Hello, AI
- DeepSeek's Permanent V4-Pro Price Cut Puts OpenAI And Anthropic Under Pressure
- The Best LLMs for Agentic Coding in 2026 (Real-World, Not Just Benchmarks) - DEV Community
- LLM Agent & Tool-Use Benchmarks — Function Calling, MCP, Structured Output Rankings (2026)
- Qwen 3.7 Max: Alibaba's May 2026 Flagship Guide
- OpenAI API Pricing 2026: GPT-5.5, o4-mini, o3 Cost Guide