Claude Opus 4.7의 SWE-bench 성능과 에이전틱 코딩 설계
Claude Opus 4.7의 SWE-bench 성능, 컨텍스트 관리, 비전 통합, 자기 검증 설계를 에이전틱 소프트웨어 엔지니어링 관점에서 분석한다.
2026-08-15 · 최초 발행 2026-04-23
2026년 4월 16일 Anthropic이 공개한 Claude Opus 4.7은 긴 코딩 작업을 자율적으로 이어 가는 에이전틱 소프트웨어 엔지니어링을 전면에 둔 모델이다. SWE-bench Verified 87.6%, SWE-bench Pro 64.3%라는 결과와 함께, 컨텍스트 관리·비전 처리·자기 검증을 작업 흐름에 결합하는 방식을 제시했다.
긴 코딩 작업을 겨냥한 성능 변화
Anthropic은 Claude Opus 4.7을 에이전틱 소프트웨어 엔지니어링에 최적화한 모델로 설명한다. 전작 Opus 4.6에서 긴 코딩 워크플로가 중간에 멈추거나 반복 루프로 흐르던 문제가 있었다면, 이번 버전은 그 지점을 개선 대상으로 삼았다.
코딩 에이전트 관련 지표는 SWE-bench Verified 87.6%로 Opus 4.6보다 +6.8%p, SWE-bench Pro 64.3%로 +10.9%p, CursorBench 70%로 +12%p를 기록했다. Verified보다 Pro에서 개선 폭이 더 크다는 점은 어렵고 미해결인 엔지니어링 문제에서의 변화와 연결해 볼 수 있다.
비전과 멀티모달 처리도 달라졌다. 이미지 최대 해상도는 1,568px(1.15MP)에서 2,576px(3.75MP)으로 3배 이상 늘었고, XBOW Visual Acuity는 54.5%에서 98.5%로 올랐다. MCP-Atlas에서는 77.3%를 기록해 Gemini 3.1 Pro의 73.9%, GPT-5.4의 68.1%보다 높았다. 복잡한 멀티에이전트 체인에서의 도구 오류율은 약 14% 감소했다.
SWE-bench 점수를 읽을 때 함께 봐야 할 조건
SWE-bench는 GitHub의 실제 이슈를 바탕으로, 모델이 패치를 만들어 소프트웨어 엔지니어링 문제를 해결하는지를 평가한다. 생태계에서 주로 언급되는 변종은 다음과 같다.
- SWE-bench Verified는 OpenAI가 인간 검수로 정제한 500개 문제 서브셋이며, 가장 널리 인용되는 기준이다.
- SWE-bench Pro는 Scale AI가 개발한 더 어렵고 현실적인 문제셋이다. 데이터 오염(contamination), 단순 문제 편향, 테스트 케이스 부족 같은 Verified의 한계를 보완하기 위해 설계됐다.
- SWE-bench Multilingual은 다국어 코드베이스에서의 역량을 측정하며, Opus 4.7은 80.5%를 달성했다.
점수만으로 실제 역량을 단정하기 어려운 이유도 있다. 메타 연구에서는 이슈 본문에 해답이 포함된 경우가 32.67%, 불충분한 테스트로 통과되는 의심 패치가 31.08%라는 문제가 확인됐다. 1-2줄 수정으로 해결 가능한 trivial 문제의 비중, 수천 개 독립 샌드박스 환경이 필요한 재현성 문제도 함께 고려해야 한다.
SWE-bench Verified에서 상위 모델이 70%를 넘는 반면, SWE-bench Pro에서는 동일 모델이 23~64% 수준에 머문다. 두 벤치마크가 재는 능력의 층위가 다르다는 뜻이다. Opus 4.7의 Pro 64.3%는 이 더 어려운 척도에서 경쟁 모델보다 크게 앞서는 수치로 제시됐다.
컨텍스트를 작업 상태로 다루는 방식
장기 멀티스텝 작업은 컨텍스트 윈도만 크게 만든다고 안정화되지 않는다. Claude Opus 4.7은 장거리 추론, 태스크 예산, 파일 시스템 기반 메모리를 통해 이 문제를 다룬다.
Amazon Bedrock에서는 최대 100만 토큰 컨텍스트를 지원한다. 핵심은 윈도의 크기 자체보다 큰 컨텍스트 전반에서 추론의 일관성을 유지하고, 후반부 성능 저하를 억제하는 데 있다.
베타 기능인 Task Budgets는 에이전틱 루프의 무제한 토큰 소비를 다룬다. 개발자가 루프 전체의 토큰 목표치를 설정하면 모델은 남은 예산의 카운트다운을 인식하고, 저가치 단계를 건너뛰며 예산 소진 전에 작업을 마무리한다. 오케스트레이션 관점에서는 비용 예측 가능성과 신뢰성을 함께 다루는 장치다.
파일 시스템 기반 메모리는 장기 멀티세션 작업에서 이전 세션의 중요한 메모를 유지하고 활용하는 방식이다. 새 태스크를 시작할 때 초기 컨텍스트 설정 부담을 줄이고, 이어지는 작업 흐름을 지원한다.
고해상도 비전이 화면 기반 작업에 미치는 영향
이미지 처리 향상은 해상도 증가만으로 끝나지 않는다. 고해상도 이미지를 다루면서 이미지당 토큰 소비는 최대 4,784 토큰으로 늘었다. 이전 모델 대비 약 3배이며, 더 세밀한 시각 정보를 표현하는 대신 비용과의 트레이드오프가 생긴다.
XBOW Visual Acuity의 54.5%에서 98.5%로의 변화는 컴퓨터 사용 에이전트의 화면 인식과 관련 있다. 이 벤치마크는 스크린샷에서 UI 요소를 찾고 상호작용하는 능력을 측정한다. 대시보드와 데이터 시각화 분석, 고밀도 텍스트가 있는 PDF·스캔 문서 처리, GUI 자동화 태스크에서의 안정성과 연결되는 변화다.
비용과 검증을 함께 조절하는 에이전트 설정
Claude Opus 4.7은 xhigh 추론 노력 수준을 추가했다. high와 max 사이의 공백을 채우는 설정으로, Anthropic 내부 데이터에 따르면 코딩 태스크에서 약 75%의 성능을 보이면서 max보다 토큰 소비를 크게 줄인다. 품질과 비용 사이에서 워크플로별 선택지를 제공하는 기능이다.
자기 검증(Self-Verification)도 에이전틱 코딩의 신뢰성 설계와 맞닿아 있다. 모델은 태스크를 완료로 선언하기 전에 스스로 테스트를 작성·실행하고, 실패를 수정한다. 이 과정은 오케스트레이터가 별도 검증 레이어를 운영하는 부담과 멀티스텝 파이프라인의 오류 전파를 줄이는 데 목적이 있다.
| 기능 | Opus 4.6 | Opus 4.7 |
|---|---|---|
| SWE-bench Verified | 80.8% | 87.6% |
| SWE-bench Pro | 53.4% | 64.3% |
| XBOW Visual Acuity | 54.5% | 98.5% |
| 최대 이미지 해상도 | 1.15MP | 3.75MP |
| Effort 레벨 | low/medium/high/max | low/medium/high/xhigh/max |
| Task Budgets | 미지원 | 베타 지원 |
공개 모델 경쟁 구도에서의 위치
SWE-bench Pro에서 Claude Opus 4.7은 64.3%로 GPT-5.4의 57.7%보다 6.6%p 높다. MCP-Atlas에서도 Gemini 3.1 Pro와 비교해 77.3% 대 73.9%를 기록했다.
한편 Axios는 Anthropic이 개발 중인 Mythos 모델이 Opus 4.7보다 뛰어남을 인정했다고 보도했다. 이는 Opus 4.7이 현 시점의 공개 모델인 동시에, Anthropic 내부에서는 다음 단계의 역량을 개발하고 있음을 시사한다. 공개 출시 주기보다 모델 개발이 앞서가는 업계 전반의 흐름과도 맞물린다.
Opus 4.7의 변화는 모델 지능을 높이는 데만 머물지 않는다. 어려운 문제셋에서의 성능, Task Budgets와 파일 시스템 메모리, xhigh 설정, 자기 검증은 비용을 예측하면서도 끝까지 검증 가능한 에이전트를 만들기 위한 구성이다. 고해상도 비전과 1M 토큰 컨텍스트 관리의 결합 역시 소프트웨어 엔지니어링 자동화 범위를 넓히는 전제가 된다.
Sources
- Introducing Claude Opus 4.7 - Anthropic
- Claude Opus 4.7 leads on SWE-bench and agentic reasoning - The Next Web
- Introducing Anthropic's Claude Opus 4.7 model in Amazon Bedrock - AWS
- Claude Opus 4.7: benchmarks, features, and migration guide - The AI Corner
- Claude Opus 4.7 Benchmark Full Analysis - Apiyi.com
- SWE-bench: A Comprehensive Review - Atoms.dev
- Claude Opus 4.7 Benchmarks Explained - Vellum
- Anthropic releases Claude Opus 4.7, concedes it trails unreleased Mythos - Axios
- Anthropic Releases Claude Opus 4.7: A Major Upgrade - MarkTechPost
- SWE-Bench Pro Leaderboard - Scale AI