자율 코딩 에이전트 벤치마크 Terminal-Bench 2.1, Claude Fable 5는 어떻게 85% 벽을 넘었나

Terminal-Bench 2.1 리더보드로 보는 Codex CLI·Claude Fable 5·Gemini CLI 성능 비교와 자율 코딩 에이전트 엔터프라이즈 도입 전략

2026-08-12 · 최초 발행 2026-08-02

2026년 6월 18일 갱신된 Terminal-Bench 2.1 리더보드에서 Codex CLI(GPT-5.5)가 83.4%로 Claude Code(Fable 5)의 83.1%를 근소하게 앞섰다. 하지만 이 순위는 오래가지 않았다. 이후 Claude Fable 5가 88.0%로 재평가되면서 Terminal-Bench 역사상 처음으로 85% 장벽을 돌파했고, 최종 1위 자리를 가져갔다. 31개 모델을 대상으로 한 이번 갱신은 자율 코딩 에이전트의 현재 역량을 가늠하는 기준점으로 참고할 만하다.

코드 스니펫이 아니라 워크플로우를 채점한다

Terminal-Bench는 격리된 함수 단위로 코드를 채점하던 기존 벤치마크의 한계를 넘어서기 위해 설계됐다. 컴파일, 모델 학습, 시스템 설정, 디버깅처럼 실제 터미널에서 벌어지는 복합 작업을 에이전트가 끝까지 완주할 수 있는지를 측정한다.

2.1 버전은 89개의 수작업·인간 검증 태스크로 구성되며, 각 태스크는 자연어 지시문·Docker 실행 환경·검증 테스트 스위트·오라클 솔루션 네 요소로 정의된다. 태스크 도메인은 과학 컴퓨팅, 소프트웨어 엔지니어링, 머신러닝, 보안, 시스템 관리, 데이터 사이언스로 나뉜다.

각 태스크는 AWS EC2 위의 독립 Docker 컨테이너에서 실행되는데, 이 설계는 두 가지를 동시에 노린다. 이전 태스크의 시스템 상태가 다음 태스크로 새어나가지 않도록 막는 상호 오염 방지, 그리고 모든 모델이 동일한 초기 환경에서 평가받도록 하는 재현성 확보다. 참고로 2.1은 이전 버전(2.0)의 검증 로직 오류를 수정한 버전이라, 같은 모델이라도 2.0과 2.1에서 기록한 점수가 다소 어긋날 수 있다.

멀티 턴 루프와 측정 지표

Terminal-Bench가 평가하는 에이전트는 한 번의 함수 호출로 끝나지 않는다. 지시문을 받으면 셸 명령을 실행하고, stdout/stderr를 관찰하고, 파일을 읽고 쓰는 관찰-계획-행동 사이클을 반복하다가 스스로 완료 신호를 보내면 그제야 검증 테스트가 돌아간다.

"검증 테스트 스위트""파일 시스템""터미널/Shell""AI 에이전트\n(LLM 코어)""Terminal-Bench\n태스크 지시문""검증 테스트 스위트""파일 시스템""터미널/Shell""AI 에이전트\n(LLM 코어)""Terminal-Bench\n태스크 지시문"loop["자율 에이전트 루프 (Multi-Turn)"]"자연어 지시문 전달""명령어 실행 (bash, pip, gcc 등)""stdout / stderr 반환""파일 읽기/쓰기/수정""파일 내용 반환""관찰 → 계획 → 행동 사이클""태스크 완료 신호""프로그래밍적 검증 실행""Pass / Fail 결과"

이 루프에서 Terminal-Bench 2.1이 실제로 기록하는 지표는 다섯 가지다. 전체 89개 태스크 중 검증을 통과한 비율(태스크 완료율), 인간 개입 없이 이어간 연속 액션 수(자율 실행 깊이), 실패 후 스스로 고쳐서 재시도에 성공하는 비율(오류 복구 능력), 동일 결과를 내는 데 쓴 출력 토큰 수(컨텍스트 활용 효율), 그리고 설치부터 구현·빌드·검증까지 전 과정을 끝까지 완주했는지(엔드투엔드 워크플로우 완주)다.

부분 점수는 없다 — 바이너리 채점의 의미

31개 모델은 모두 같은 조건에서 평가받았다. 채점 방식의 핵심은 부분 점수를 인정하지 않는다는 데 있다. 태스크를 90% 끝내놓고도 검증 테스트를 통과하지 못하면 0점이다. "동작하거나 동작하지 않거나"라는 프로덕션 환경의 냉정한 잣대를 그대로 옮겨온 설계다.

태스크마다 최대 실행 시간 제한이 걸려 있고, 외부 인터넷 접근은 Docker 네트워크 정책에 따라 제한된다. 각 모델은 API를 통해 에이전트 루프에 연결되며, 동일 태스크를 복수 실행한 뒤 평균값을 낸다.

6월 18일의 순위표는 며칠짜리였다

6월 18일 기준 공개된 리더보드와, 이후 Fable 5 재평가를 반영한 최종 리더보드를 나란히 놓으면 순위가 뒤집힌 걸 볼 수 있다.

순위 모델 6월 18일 점수 최종 점수 출시일
1 Claude Fable 5 83.1% 88.0% 2026년 6월 9일
2 Codex CLI (GPT-5.5) 83.4% 83.4% 2026년 4월 23일
3 Claude Code (Opus 4.8) 78.9% 82.7% 2025년 하반기
4 Gemini CLI (Gemini 3.1 Pro) - 70.7% 2026년
... 기타 모델 - ~50-70% 범위 -

Claude Fable 5는 Terminal-Bench 역사상 처음으로 85% 장벽을 돌파한 모델이다. GPT-5.5 대비 4.6점포인트 우위로, Anthropic의 Mythos급 아키텍처가 자율 터미널 작업에서 강점을 보인다는 근거로 인용할 만하다.

AI 코딩 에이전트 Terminal-Bench 2.1 점수 비교Codex CLI (GPT-5.5)Claude Code (Fable 5)Claude Code (Opus 4.8)Gemini CLI (3.1 Pro)9590858075706560Terminal-Bench 점수 (%)

Terminal-Bench 바깥의 다차원 비교도 함께 보면 각 에이전트의 성격이 더 뚜렷해진다.

평가 항목 Codex CLI (GPT-5.5) Claude Code (Fable 5) Claude Code (Opus 4.8) Gemini CLI (3.1 Pro)
Terminal-Bench 2.1 83.4% 88.0% 82.7% 70.7%
SWE-bench Pro 58.6% 80.3% 69.2% 미공개
SWE-bench Verified 미공개 95.0% 미공개 미공개
LiveCodeBench 미공개 89.78% 미공개 미공개
컨텍스트 윈도우 400K 토큰 공개 미확인 200K 토큰 1M+ 토큰
입력 가격 $5/1M 토큰 $10/1M 토큰 $15/1M 토큰 미공개
출력 가격 $30/1M 토큰 $50/1M 토큰 $75/1M 토큰 미공개
서브 에이전트 깊이 제한적 최대 5단계 3단계 제한적

Codex CLI는 GPT-5 패밀리에 라우터와 다양한 추론 수준을 결합한 포스트 트레이닝 업그레이드 성격의 모델이다. GPT-5.4 대비 동일 태스크에서 출력 토큰을 약 40% 절감하며, 컴퓨터 GUI 인터랙션(Computer Use)까지 지원해 브라우저 자동화와 터미널 조작을 한 아키텍처로 묶는다.

Claude Fable 5는 Anthropic 최초의 Mythos급 모델로, 이전 Opus 티어보다 상위에 위치한다. 중첩 서브 에이전트를 최대 5단계 깊이까지 지원해 복잡한 계획 수립과 자체 점검이 가능하고, 더 적은 도구 호출로 동등한 작업을 끝내는 효율을 보인다. SWE-bench Pro 80.3%는 GPT-5.5의 58.6%를 크게 앞서는데, 이는 저장소 수준의 복잡한 코드 리뷰에서 격차가 벌어진다는 뜻이다.

Gemini CLI(Gemini 3.1 Pro)는 Terminal-Bench 2.1에서 70.7%로 상위 모델과 10~17점포인트 격차를 보이지만, 1M+ 토큰 컨텍스트 윈도우라는 확실한 차별점이 있다. 대용량 코드베이스 분석이나 긴 문서 처리가 필요한 작업에서는 이 폭이 그대로 경쟁력이 된다.

성능과 비용, 어느 쪽에 무게를 둘 것인가

Terminal-Bench 점수만 보고 에이전트를 고르는 건 최적이 아니다. 유즈케이스와 비용 구조를 함께 저울질해야 한다.

YesNo예산 풍부최고 성능 요구비용 효율우선예산 중간YesNo높음보통YesNo유즈케이스분류자율 터미널작업 중심?예산 제약수준?저장소 수준코드 리뷰 중심?Claude Fable 5추천 (88.0%)Codex CLI GPT-5.5추천 (83.4%)토큰 40% 절감Claude Opus 4.8추천 (82.7%)복잡도수준?대용량 컨텍스트필요?Claude Fable 5SWE-bench Pro 80.3%Claude Opus 4.8SWE-bench Pro 69.2%Gemini CLI1M+ 토큰 컨텍스트요구사항 재검토필요

월 100만 토큰을 기준으로 비용과 점수를 나란히 놓으면 트레이드오프가 더 선명해진다.

모델 월 100만 토큰 기준 비용 Terminal-Bench 점수 점수/비용 효율
Codex CLI (GPT-5.5) 입력 $5 + 출력 $30 83.4% 높음
Claude Fable 5 입력 $10 + 출력 $50 88.0% 중간
Claude Opus 4.8 입력 $15 + 출력 $75 82.7% 낮음
GPT-5.5-pro 입력 $30 + 출력 $180 동일 수준 매우 낮음

이 트레이드오프는 숫자로만 보면 추상적이지만, 실제로는 꽤 구체적인 리스크로 나타난다. Claude Fable 5를 쓴 한 개발자 팀이 10시간 만에 $1,500을 소진한 사례가 보고된 적이 있는데, 최고 성능 모델을 자율 모드로 풀어두면 비용 모니터링 체계 없이는 예산이 순식간에 새어나갈 수 있다는 뜻이다.

벤치마크 통과와 프로덕션 전환은 다른 문제다

Anaconda와 Forrester가 함께 낸 '2026 에이전틱 AI 현황' 보고서는 에이전트 파일럿의 88%가 프로덕션 전환에 실패하고, 단 12%만이 POC에서 실제 비즈니스 운영으로 넘어간다고 밝혔다. 벤치마크 점수가 아무리 높아도 그 자체로 도입 성공을 보장하지 않는다는 뜻이며, 별도의 엔터프라이즈 적합성 평가가 필요한 이유이기도 하다.

단계4: 프로덕션 결정단계3: 파일럿 운영단계2: POC 설계단계1: 벤치마크 평가YesNoTerminal-Bench 2.1점수 확인SWE-bench Pro점수 확인도메인별 성능매핑실제 내부 코드베이스테스트 태스크 설계비용 시뮬레이션(토큰 소비 측정)보안·컴플라이언스검토소규모 적용(3-5명 개발자)생산성 지표측정 (실제 vs 기대)에이전트 실패패턴 분석ROI긍정적?전사 롤아웃에이전트 교체또는 중단

이 네 단계를 거치는 동안 실무에서 놓치기 쉬운 항목은 크게 기술과 비즈니스 두 축으로 나뉜다. 기술 쪽에서는 자사 코드베이스의 언어·프레임워크와 호환되는지, 서브 에이전트 깊이를 포함한 멀티 에이전트 오케스트레이션을 지원하는지, 컨텍스트 윈도우가 실제 저장소 규모에 맞는지, API Rate Limit이 동시 에이전트 실행을 얼마나 제약하는지를 확인해야 한다. 비즈니스 쪽에서는 태스크 완료 시간 비교로 생산성 향상을 실측하고, 토큰 소비를 모니터링할 월간 API 비용 예산을 세우고, 컴플라이언스를 위한 에이전트 실행 감사 로그 보존 요건과 데이터 보안을 위한 온프레미스·VPC 배포 옵션까지 짚어야 한다.

벤치마크 점수가 실제 생산성으로 이어지는 영역, 그렇지 않은 영역

Terminal-Bench 점수가 실제 개발팀의 생산성 향상과 어느 정도 맞아떨어지는지는 별도로 따져볼 문제다. 스탠드얼론 스크립트 자동화, 의존성 설치·환경 구성 자동화, CI/CD 파이프라인 스크립트 작성, 컨텍스트가 명확한 단순 버그 수정처럼 Terminal-Bench가 직접 측정하는 영역에서는 점수와 실제 성과의 상관관계가 높게 나타난다.

반대로 대규모 레거시 코드베이스 리팩토링처럼 조직 특수 컨텍스트가 필요한 작업, 비즈니스 도메인 지식이 있어야 풀리는 기능 설계, 팀의 코드 컨벤션과 아키텍처 원칙을 지켜야 하는 작업, 코드 리뷰 품질 판단처럼 SWE-bench Pro가 더 적합한 영역에서는 Terminal-Bench 점수만으로 성과를 예측하기 어렵다. 결국 자율 터미널 작업이 중심이라면 Terminal-Bench 점수를, 저장소 수준 작업이 중심이라면 SWE-bench Pro 점수를 우선 참고하는 편이 합리적이다.

에이전트 오케스트레이션, 실무에서 봐야 할 지점

Terminal-Bench가 측정하는 자율 코딩 에이전트의 내부 구조를 뜯어보면, 사용자 요청을 받은 오케스트레이터가 계획을 세우고 이를 서브 에이전트로 분기(Fable 5 기준 최대 5단계)한 뒤, 도구 실행 레이어를 거쳐 터미널·파일 시스템·외부 API에 접근하고, 그 결과를 다시 오케스트레이터가 관찰해 최종 출력을 검증·반환하는 구조로 되어 있다.

AI 코딩 에이전트 시스템 아키텍처사용자 요청(자연어 지시)오케스트레이터에이전트 (LLM)계획 수립(Plan Generation)서브 에이전트 분기(최대 5단계, Fable 5)도구 실행 레이어(Tool Execution Layer)터미널/Shell파일 시스템 API외부 서비스 API결과 관찰(Observation)최종 출력검증 반환

이 구조를 실제로 운영하려면 몇 가지가 함께 따라와야 한다. Docker 격리와 멱등성(Idempotency)으로 에이전트 상태를 관리하고, 컨테이너 샌드박싱과 최소 권한 원칙으로 에이전트가 시스템에 접근하는 범위를 통제하며, Rate Limiting과 비동기 처리로 API 통신을 다뤄야 한다. 계획 수립 단계에서는 Tree-of-Thought나 ReAct 같은 패턴으로 에이전트의 추론 경로를 최적화하는 것도 관건이다. 이런 요소들은 벤치마크 점수표에는 드러나지 않지만, 실제로 에이전트를 프로덕션에 붙일 때는 점수 자체보다 더 많은 엔지니어링 시간을 잡아먹는 부분이다.

2026년 하반기, 다음은 무엇인가

Claude Fable 5가 처음으로 85% 장벽을 돌파(88.0%)하고 단기간에 GPT-5.5(83.4%)를 추월한 흐름을 보면, 2026년 말에는 90%대 모델이 나올 것이라는 전망도 무리는 아니다. 최고 성능 모델들이 하나같이 중첩 서브 에이전트(Fable 5 기준 5단계)를 지원한다는 점도 눈여겨볼 대목이다. 단일 LLM 호출이 아니라 에이전트 오케스트레이션 자체가 고성능의 핵심 요소로 자리잡았다는 뜻이다.

Terminal-Bench는 자율 코딩 에이전트의 사실상 표준 벤치마크로 부상했고, SWE-bench Verified(95.0%, Fable 5)와 교차 검증하는 것이 에이전트를 고르는 표준 방법론이 되어가고 있다. 비용과 성능의 양극화도 뚜렷하다. Codex CLI는 토큰 효율(GPT-5.4 대비 40% 절감)로, Claude Fable 5는 최고 성능으로 서로 다른 시장을 겨냥하고 있어 엔터프라이즈는 유즈케이스에 따라 전략적으로 갈라 선택해야 한다.

여기에 Fable 5의 GitHub Copilot 접근이 2026년 6월 12일 발표로 중단되면서, 코딩 에이전트 생태계는 기반 모델과 에이전트 플랫폼 사이의 경쟁 구도가 한층 복잡해지고 있다. 결국 에이전트 파일럿의 88%가 프로덕션 전환에 실패한다는 수치는, 벤치마크 점수를 쫓는 것만큼이나 기술 성숙도와 조직 적합성을 함께 검증해야 한다는 사실을 다시 한번 일러준다.

Sources

Terminal-Bench자율 코딩 에이전트Claude Fable 5Codex CLI에이전트 벤치마크