Claude Fable 5와 SWE-Bench Pro로 본 에이전틱 코딩

Claude Fable 5의 SWE-Bench Pro 성능과 멀티 에이전트 구조를 분석하고, 실제 코드베이스에서 검증하고 적용할 기준을 정리한다.

2026-08-14 · 최초 발행 2026-08-02

어려운 저장소에서 벌어진 성능 격차

Anthropic은 2026년 6월 9일 Claude Fable 5를 공식 출시했다. 이 모델은 SWE-Bench Pro에서 80.3%를 기록해 GPT-5.5의 58.6%, Gemini 3.1 Pro의 54.2%보다 21.7%p 이상 앞섰다. Mythos 클래스의 성능을 일반 가용 형태로 제공하면서, 프런티어 코딩 모델을 평가하는 기준도 단순 코드 생성에서 장기 실행형 소프트웨어 작업으로 옮겨 놓았다.

이 결과에서 눈여겨볼 부분은 정답 코드 한 조각을 만드는 능력만이 아니다. Fable 5는 코드베이스를 읽고 작업을 분해한 다음 패치를 작성하고, 테스트 실패를 분석해 다시 수정하는 에이전틱 코딩 구조를 전제로 한다. 복잡한 변경을 끝까지 처리하는 과정 전체가 성능에 반영된다.

SWE-Bench Pro는 패치를 실제 저장소에서 검증한다

Scale AI가 관리하는 SWE-Bench Pro는 41개의 활성 오픈소스·상용 레포지토리에서 추출한 1,865개 문제로 구성된다. 모델이 만든 패치를 대상 레포지토리에 적용하고 테스트 스위트를 실행해 이슈가 해결됐는지 판정한다. 알고리즘 문제나 짧은 코드 완성과 달리, 실제 코드의 맥락을 읽고 여러 파일과 모듈을 함께 수정해야 한다.

평가 환경은 Docker로 컨테이너화해 플랫폼 차이를 줄인다. 각 태스크는 버그 수정이나 기능 추가를 입증하는 연속 커밋 쌍과 테스트 케이스를 바탕으로 만들어진다.

데이터는 공개 세트 11개 레포지토리, 홀드아웃 세트 12개 레포지토리, 상용 세트 18개 비공개 레포지토리로 나뉜다. 공개 데이터에 대한 오버피팅과 엔터프라이즈 코드베이스에서의 난도를 함께 확인하려는 구성이다.

기존 SWE-Bench Verified와의 성능 차이도 크다. 모델들은 Verified에서 Pro로 이동할 때 평균 15~35%p 하락했다. Opus 4.5는 80.9%에서 45.9%로, Gemini 3.1 Pro는 80.6%에서 46.1%로 떨어졌다. 비즈니스 애플리케이션, B2B 서비스, 개발자 도구를 아우르는 저장소 구성이 특정 프레임워크나 라이브러리에 치우친 모델의 한계를 드러낸다.

탐색·수정·검증으로 이어지는 에이전트 구조

Fable 5의 코딩 작업은 코드 생성 한 번으로 끝나지 않는다. 이슈나 사양을 받아 코드베이스를 읽고, 작업 계획을 나눈 뒤 독립적인 실행 단위에서 변경을 진행한다. 생성한 패치가 테스트를 통과하지 못하면 오류를 분석해 다시 수정한다.

NoYes코딩 태스크 입력(이슈 / PR / 사양)장기 컨텍스트코드베이스 독해(1M 토큰 컨텍스트)태스크 분해& 계획 수립멀티 에이전트병렬 실행(각 에이전트 독립 Git체크아웃)검증 루프테스트 통과?오류 분석& 수정 재시도패치 통합& 최종 검증코드 생성 완료(SWE-Bench: 패치 적용)

1M 토큰 장기 컨텍스트는 대규모 레포지토리의 파일 간 의존성, API 계약, 기존 아키텍처 패턴을 함께 읽는 데 쓰인다. 패치를 만든 뒤 테스트를 실행하고 오류를 분석해 재수정하는 멀티스텝 루프는 자기 교정 메커니즘으로 작동한다.

병렬 작업에서는 각 에이전트가 독립적인 Git 체크아웃을 사용하고 Git을 통해 변경 사항을 공유한다. 모든 멀티 에이전트 변형은 최고 단일 에이전트를 파레토 지배했으며, 비동기 서브에이전트 하네스는 BrowseComp에서 93.3%를 기록했다.

ProgramBench에서는 5개 에이전트 팀이 단일 에이전트보다 7.9%p 높은 점수를 냈고, 히든 테스트 60% 통과 속도를 3.2배 단축했다. 이전 세대보다 적은 턴으로 복잡한 멀티 에이전트 워크플로우를 처리하는 토큰 효율성도 아키텍처의 한 축이다.

입력 형식은 텍스트에 머물지 않는다. 이미지와 파일을 함께 처리하므로 다이어그램, UI 목업, 문서를 참조한 코드 생성에도 사용할 수 있다.

Verified 순위만으로는 설명되지 않는 차이

2026년 6월 기준 SWE-Bench Pro 결과를 나란히 놓으면 모델별 격차가 분명해진다.

SWE-Bench Pro2026년 6월 기준Claude Fable 580.3%AnthropicGPT-5.558.6%OpenAIGemini 3.1 Pro54.2%GoogleClaude Opus 4.8~69%Anthropic(1위) 21.7%p 격차$10/M 입력 · $50/M 출력1M 토큰 컨텍스트(3위) SWE-Bench Verified88.7% 1위이나Pro에서 급락(4위) Verified 80.6%→Pro 46.1% (-34.5%p)가장 성능 하락폭(2위) Fable 5와의 격차가Opus 4.8과 Gemini 차이보다 세대 도약

GPT-5.5는 SWE-Bench Verified에서 88.7%로 1위였지만 Pro에서는 크게 밀렸다. 이 차이는 Verified의 단순화된 태스크 구성과 훈련 데이터 오염 가능성이라는 구조적 한계를 보여준다. Fable 5는 두 벤치마크에서 모두 일관된 고성능을 유지했다.

Gemini 3.1 Pro는 Verified 대비 Pro에서 34.5%p 하락했다. 이 결과는 단일 파일 수준의 합성 태스크에 최적화된 훈련 전략의 한계를 시사한다. Fable 5의 우위는 실제 저장소를 대상으로 한 장기 컨텍스트 추론과 멀티파일 수정 능력에서 나타난다.

벤치마크를 내부 코드베이스에서 다시 검증해야 하는 이유

SWE-Bench Pro 80.3%가 모든 프로덕션 환경의 성능을 보장하지는 않는다. Anthropic이 보고한 수치는 자체 스캐폴딩을 사용한 결과다. Scale의 표준화된 SEAL 리더보드에서는 다른 결과가 나올 수 있으므로, 도입 조직은 실제 운영에 사용할 스캐폴딩을 고정한 뒤 평가해야 한다.

코드베이스 규모도 변수다. 소규모 프로젝트와 대규모 모노레포에서는 컨텍스트 사용 방식이 달라질 수 있다. 조직의 실제 저장소 크기와 구조를 반영한 사전 프로파일링이 필요하다.

에이전트 구성은 단일 에이전트, 3에이전트, 5에이전트 순으로 정확도와 속도가 향상됐다. 다만 태스크마다 비용과 성능의 균형이 다르므로 하나의 구성을 모든 작업에 적용하기보다는 변경 범위와 난도에 맞춰 선택해야 한다.

모델의 패치는 기존 테스트 스위트와 회귀 테스트를 통과한 뒤 프로덕션 파이프라인으로 보내야 한다. 범용 점수 외에도 조직이 사용하는 언어, 프레임워크, 업무 도메인을 반영한 내부 평가 세트를 만들고 정기적으로 측정하면 모델 교체나 구성 변경의 영향을 추적할 수 있다.

시스템 아키텍처 관점에서는 SWE-Bench Pro 점수를 그대로 요구사항으로 쓰기 어렵다. 소프트웨어 유지보수성, 코드 품질 자동화, 기술 부채 관리처럼 조직이 운영하는 품질 지표와 연결해야 의사결정에 활용할 수 있다.

개발 파이프라인에 연결하는 방식

Claude Code나 API를 통해 Fable 5를 저장소 작업에 연결할 수 있다. 이때 에이전트에게 모호한 요청만 전달하기보다 재현 단계, 기대 동작, 제약 조건을 이슈에 명시해야 한다. 이후 생성된 패치는 사람의 리뷰와 CI/CD 테스트를 차례로 거친다.

NoYesNoYes기술 부채 또는신규 기능 요구사항이슈 상세화(재현 단계 · 기대 동작 · 제약)Fable 5 에이전트 호출(Claude Code / API)코드베이스 분석(1M 컨텍스트 활용)패치 초안 생성& 자기 검증 루프PR 리뷰품질 기준 충족?인간 리뷰어피드백 제공CI/CD 파이프라인자동화 테스트 실행모든 테스트 통과?프로덕션 배포완료

멀티 에이전트 하네스를 구성한다면 에이전트별 독립 Git 체크아웃뿐 아니라 충돌 해결 정책과 코드 통합 전략도 명시해야 한다. 1M 토큰 컨텍스트에는 전체 레포지토리나 관련 모듈 집합을 담아 파일 사이의 계약을 함께 분석하도록 할 수 있다.

모델 내부의 수정-검증 사이클만 신뢰해서는 안 된다. 외부 테스트 실행기를 연결해 패치를 다시 검증하는 이중 구조가 필요하다. 비용 측면에서는 입력 $10/M, 출력 $50/M 토큰의 가격 구조를 고려해 탐색 단계에는 하위 모델을 사용하고 최종 패치 생성 단계에서 Fable 5를 호출하는 계층형 구성을 적용할 수 있다.

Fable 5의 SWE-Bench Pro 80.3%는 에이전틱 코딩 모델이 실제 소프트웨어 엔지니어링 문제를 처리하는 수준에 도달했음을 시사한다. 멀티 에이전트 병렬 실행, 1M 토큰 장기 컨텍스트, 자기 교정 루프가 결합되면서 복합적인 저장소 변경을 다룰 수 있게 됐다. 조직에서의 가치는 순위 자체보다 실제 코드베이스와 테스트 인프라에 연결했을 때 기술 부채를 얼마나 효율적으로 줄이고 개발 생산성을 높이는지에 따라 결정된다.

Sources

Claude Fable 5SWE-Bench Pro에이전틱 코딩코딩 모델멀티 에이전트