Claude Fable 5와 SWE-Bench Pro 점수가 말해주는 코딩 에이전트 평가 조건
Claude Fable 5의 SWE-Bench Pro 80.3% 주장과 스캐폴딩, 독립 검증, 코딩 에이전트 도입 거버넌스 조건을 정리한다.
2026-08-30 · 최초 발행 2026-07-25
2026년 6월 9일 GA로 출시된 앤스로픽(Anthropic)의 Claude Fable 5는 SWE-Bench Pro 80.3%를 내세우며 프런티어 코딩 모델 경쟁의 선두를 주장했다. 이 수치는 실제 리포지터리 이슈 해결 능력을 겨냥한 벤치마크에서 나온 값이지만, 앤스로픽 자체 스캐폴딩과 데이터 분할에 기반한 벤더 리포트다. 독립 평가가 진행 중인 상황에서는 점수 자체뿐 아니라 평가를 만든 조건까지 읽어야 한다.
Fable 5 성적표를 읽을 때 남는 단서
Claude Fable 5는 Opus 상위 티어의 프런티어 모델로 출시됐다. 공개된 성적은 SWE-bench Verified 95.0%, SWE-Bench Pro 80.3%, FrontierCode Diamond 29.3%다. SWE-Bench Pro에서는 차순위 프런티어 모델보다 약 11점 앞선다고 주장했다.
다만 이 수치는 독립적으로 확정된 결과가 아니다. Epoch AI의 독립 평가는 대기 중이며, 애그리게이터별 수치도 일치하지 않는다. BenchLM의 2026년 7월 집계에서는 Mythos 5 80.3%, Fable 5 80%, Opus 5 79.2% 순으로 근소한 차이를 보였다. GPT-5.6, Gemini 3.6 Flash, Grok 4.5도 코딩 특화 또는 범용 모델로 이 경쟁에 참여하고 있다.
이슈에서 패치까지 이어지는 에이전트 루프
코딩 에이전트의 성능은 모델이 코드를 한 번 생성하는 능력만으로 정해지지 않는다. 리포지터리를 탐색해 의존성과 수정 범위를 파악하고, diff를 만들고, 테스트 결과를 다시 입력으로 받아 반복하는 루프가 결과를 좌우한다.
이 과정에서 에이전트는 다중 파일을 검색하고 의존성 그래프를 파악한 뒤 국소적인 수정 지점을 정한다. 패치는 diff 단위로 산출하며, 기존 테스트와 신규 테스트의 통과 여부가 정답 판정에 사용된다. 따라서 같은 모델도 프롬프트, 도구, 검색 방식, 반복 루프 설계가 달라지면 점수 편차가 커질 수 있다.
SWE-Bench Pro가 측정하는 범위
SWE-Bench Pro는 Scale AI가 공개한 오염 저항성(contamination-resistant) 벤치마크다. 실제 리포지터리에서 발생한 이슈를 해결하는 능력을 측정하도록 설계됐다.
데이터셋은 41개 실무 리포지터리와 1,865개 멀티 언어 태스크로 구성되며, Python·Go·TypeScript·JavaScript를 포함한다. 각 태스크는 버그 수정 또는 기능 추가 커밋 쌍과 이를 검증하는 테스트를 결합한다. 평가는 실제 테스트 스위트를 실행해 Pass@1, 즉 단일 시도 통과율을 판정한다.
학습 데이터 오염을 줄이기 위해 GPL 등 카피레프트 라이선스 저장소만 사용하며, SETUPAGENT는 과거 시점의 의존성과 테스트 환경을 LLM 기반 반복 수리로 재구성한다.
여기서 80.3%를 다른 결과와 같은 선상에 놓을 수 있는지는 별도 문제다. 원논문의 프라이빗 스플릿에서는 GPT-5가 Pass@1 23.3%였고, 최상위 모델도 Pass@1 25% 미만이었다. 스플릿과 하네스가 다르면 높은 점수만으로 동일한 성능을 의미한다고 볼 수 없다.
구매 결정 전에 평가 조건부터 고정한다
코딩 특화 모델을 선택할 때는 단일 벤치마크 수치보다 스캐폴딩과 데이터 분할이 명시됐는지 확인할 필요가 있다. 벤더 리포트는 Epoch AI와 Scale Labs 리더보드 같은 독립 평가와 교차해 읽고, 자사 코드베이스의 대표 태스크로 파일럿을 수행한 뒤 채택을 결정하는 편이 낫다.
PR 단위로 회귀 테스트, 정적 분석, 라이선스 스캔을 통과 조건으로 강제하면 AI 생성 패치도 기존 개발 흐름 안에서 관리할 수 있다. 태스크당 토큰 비용과 지연은 품질과 함께 3축으로 관리해야 한다. 생성 코드 표기, 승인된 도구 목록, 인간 리뷰 기준도 별도의 예외가 아니라 기존 거버넌스에 포함해야 한다.
모델을 하나로 고정할 필요도 없다. 고난도 작업에는 Fable 5를 쓰고, 대량 반복 작업은 저가 티어인 GPT-5.6 Luna 같은 모델로 분산하는 다티어 운용이 가능하다.
성능표와 운영비 사이의 선택지
| 항목 | Claude Fable 5 | GPT-5.6 (Sol) | Gemini 3.6 Flash |
|---|---|---|---|
| SWE-Bench Pro | 80.3%(벤더 리포트) | 벤치마크 문제 제기 | 공개 코딩 평가 하위권 |
| 입력/출력 단가($/M토큰) | 10 / 50 | 5 / 30 | 1.5 / 7.5 |
| 강점 | 최고난도 품질·최상위 스코어카드 | 효율·에이전트 작업·컴퓨터 사용 | 속도·경량·저비용 |
| 포지셔닝 | 피크 품질 우선 | 비용 대비 생산성 우선 | 대량·저지연 우선 |
Fable 5는 최고 수준의 품질과 스코어카드에 무게를 두고, GPT-5.6은 절반 이하 비용으로 에이전트 효율 우위를 내세운다. Gemini 3.6 Flash는 속도와 경량성, 저비용 중심의 선택지다.
통제 실험에서 55% 단축이 관찰돼도 실무 중앙값 생산성 향상은 5.4%에 그친다는 점은 벤치마크와 업무 생산성을 구분해야 하는 이유다. 코딩 특화 모델의 최상위 점수 역시 자사 태스크 적합성을 보장하지 않는다. OpenAI는 2026년 7월 감사에서 공개 태스크 약 30%가 손상됐다고 추정하며 채택 권고를 철회했다.
조달과 감사에서 필요한 통제
외부 벤치마크를 조달 근거로 쓸 수는 있지만, 재현 가능한 하네스와 스플릿의 명시를 요구해야 한다. SWE-Bench Pro 같은 외부 지표를 사내 KPI에 바로 연결하기보다 보정 지표를 병행하는 방식이 필요하다.
벤더 리포트와 독립 검증 사이의 차이는 계약 조건과 성능 보증에 명문화할 대상이다. 엔지니어당 월 200~2,000달러+ 토큰 비용은 재무 거버넌스 범위에 넣어야 하며, 카피레프트 라이선스 학습과 생성 코드의 라이선스 오염 위험도 사전에 점검해야 한다. AI 생성 코드 식별, 리뷰 이력, 회귀 게이트 통과 기록은 감사 로그로 남겨야 한다.
점수 경쟁 이후의 변화
스캐폴딩과 데이터 분할을 공시해야 한다는 요구가 커지고, 독립 애그리게이터의 영향력도 확대될 전망이다. RealBench와 SWE Atlas처럼 리포지터리 수준의 실무 정렬 평가도 함께 자리 잡을 수 있다.
최고난도 특화 모델과 저가 범용 모델을 티어별로 혼용하는 방식도 표준화될 가능성이 있다. 97% 채택 대비 30% 통제의 격차는 규제와 감사 이슈로 부상할 수 있다. 벤치마크 점수보다 프롬프트 품질과 통합 비용이 실질 ROI를 좌우한다는 점에서, 경쟁의 중심은 최고 점수에서 이를 운영 가능한 생산성으로 바꾸는 체계로 옮겨가고 있다.
Sources
- Claude Fable 5 Benchmarks: 80.3% on SWE-Bench Pro, 11 Points Ahead of the Field
- Claude Fable 5 Claims 80% on SWE-Bench Pro: What's Verified, What's Vendor-Reported
- SWE-bench Pro Leaderboard (July 2026): Claude Mythos 5 Leads at 80.3% | BenchLM.ai
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? (Scale AI PDF)
- SWE-Bench Pro Leaderboard AI Coding Benchmark (Public Dataset) | Scale Labs
- Best LLM for Coding (2026): 12 Models Ranked by SWE-bench and Cost per Task
- AI Coding Governance Gap: 97% Adoption, 30% Control (2026) | Nerd Level Tech
- arXiv: SWE-Bench Pro (2509.16941)