Terminal-Bench 2.1로 읽는 AI 코딩 에이전트 선택 기준

Terminal-Bench 2.1 성능과 Claude Code 세션 연구를 바탕으로 Codex CLI, Claude Code, Antigravity의 선택 기준을 비교한다.

2026-08-14 · 최초 발행 2026-08-02

터미널에서 끝까지 해내는 능력을 평가한다

2026년 6월 발표된 Terminal-Bench 2.1 순위에서는 Codex CLI(GPT-5.5)가 83.4%로 1위, Claude Code(Fable 5)가 83.1%로 2위, Claude Code(Opus 4.8)가 78.9%로 3위를 기록했다. 같은 시기 Anthropic이 약 40만 건의 세션을 분석한 결과는 다른 질문을 던졌다. 에이전트의 성과를 가르는 요인이 코딩 기술보다 사용자의 도메인 전문성일 수 있다는 것이다.

Terminal-Bench 2.1은 Stanford와 Laude Institute가 제도적 무결성을 보증하는 오픈 리더보드 벤치마크다. v2.0의 89개 태스크 기반을 개선해, 실제 업무 환경에서 AI 에이전트가 복잡한 터미널 작업을 얼마나 자율적으로 처리하는지 측정한다.

평가 범위는 코드 자동 완성이나 단일 명령 실행에 머물지 않는다. 레거시 시스템과 서버 설정, 패키지 의존성 관리, 복합 빌드 시스템과 크로스 플랫폼 컴파일을 포함한다. 모델 학습과 데이터 파이프라인 구축, 사이버보안 취약점 분석 및 패치, 공개된 ML 논문의 구현과 재현성 검증도 다룬다. 코드 리뷰, 브랜치 관리, 병합 충돌 해결과 같은 Git·소프트웨어 엔지니어링 작업도 평가 대상이다.

각 태스크에는 고유한 실행 환경, 사람이 작성한 솔루션, 실행 기반 검증 테스트가 함께 제공된다. 에이전트가 완료를 선언하는 것만으로는 부족하다. 검증 테스트를 통과해야 성공으로 집계된다.

탐색·실행·검증을 반복하는 에이전트 루프

아니오통과실패태스크 수신환경 탐색(ls, cat, git log)계획 수립가능?멀티 실행(bash, python, nvim)컨텍스트 확장(man, --help, curl docs)검증 테스트통과?태스크 완료성공 기록오류 분석재계획다음 태스크또는 종료

에이전트는 수십 회의 멀티 턴 상호작용을 이어가며 환경을 파악하고 명령을 실행한 뒤 결과를 검증한다. 실패하면 오류를 분석해 계획을 고치고 다시 실행한다. Terminal-Bench 2.1의 자율성 지표는 이처럼 인간의 개입 없이 긴 작업 사슬을 유지하는 능력을 평가한다.

순위 역시 기반 모델만 놓고 계산하지 않는다. 동일한 모델도 결합된 에이전트 프레임워크에 따라 결과가 달라질 수 있으므로, 평가 단위는 에이전트 + 모델 쌍이다.

순위 에이전트 + 모델 Terminal-Bench 2.1 점수
1 Codex CLI + GPT-5.5 83.4%
2 Claude Code + Fable 5 83.1%
3 Claude Code + Opus 4.8 78.9%
참고 Gemini CLI + Gemini 3.1 Pro 70.7%
참고 Antigravity (MCP Atlas) 83.6%
참고 Claude Code + Fable 5 (별도 구성) 88.0%

Fable 5는 구성 방식에 따라 83.1%와 88.0%라는 서로 다른 결과를 냈다. 모델 자체의 능력만큼 에이전트 루프 설계가 결과에 영향을 준다는 뜻이다.

Claude Code 세션에서 드러난 도메인 지식의 영향

Anthropic은 2025년 10월부터 2026년 4월까지 약 40만 건의 Claude Code 세션을 프라이버시 보존 방식으로 분석했다. 연구의 초점은 AI 코딩 에이전트의 성과를 실제로 좌우하는 요인이 무엇인지 밝히는 데 있었다.

분석 결과, 코딩 배경이 없는 직군도 소프트웨어 엔지니어와 거의 같은 성공률을 보였다. 도메인 전문가는 Claude에 더 정확하고 구체적인 요구사항을 전달했고, 그 결과 지시당 처리하는 작업량이 많았다. 도메인 전문성이 높을수록 세션 성공률도 높아졌다. 다만 중급자와 전문가의 격차는 크지 않았다. 핵심 역량의 임계값을 넘은 뒤에는 코딩 숙련도보다 해당 업무를 얼마나 깊이 이해하는지가 더 중요하다는 해석이다.

Claude Code에 맡기는 작업의 구성도 달라졌다.

작업 유형 2025년 10월 2026년 4월 변화
버그 수정 33% 19% -14%p
소프트웨어 운용 14% 21% +7%p
글쓰기·데이터 분석 10% 20% +10%p

버그 수정 비중은 33%에서 19%로 줄었고, 소프트웨어 운용은 14%에서 21%로 늘었다. 글쓰기·데이터 분석도 10%에서 20%로 증가했다. 코딩 에이전트가 개발 작업에만 머물지 않고 소프트웨어를 매개로 지식 업무를 수행하는 인터페이스로 확장되고 있음을 보여주는 변화다.

Anthropic은 프리랜서 마켓플레이스의 실제 작업 단가를 기준으로 세션의 경제적 가치도 추정했다. 평균 세션 가치는 6개월 동안 27% 상승했다. 사용 범위가 고부가가치 작업으로 옮겨가고 있다는 해석이 뒤따른다.

Codex CLI, Claude Code, Antigravity가 갈리는 지점

Terminal-Bench 점수만 보면 상위 도구의 차이는 크지 않다. 실제 선택에서는 에이전트가 사람과 어떤 방식으로 일하도록 설계됐는지를 함께 봐야 한다.

Codex CLI(OpenAI)는 무감독 자율성에 무게를 둔다. Goal 모드에서는 인간의 개입 없이 수 시간 동안 작업을 이어가며, Terminal-Bench 2.1처럼 장시간 멀티 턴 실행이 필요한 태스크에 강하다. 코드 편집 승인 요청이 거의 없어 CI/CD 파이프라인이나 야간 배치 작업과 맞는다.

Claude Code(Anthropic)는 사람과 긴밀하게 협업하는 페어 프로그래밍 방식을 취한다. 편집 전에 승인을 요청하고 진행 과정을 설명한다. SWE-Bench Pro에서는 64.3%의 출력 품질을 보였으며, 코드 정확성만큼 작업의 이해 가능성을 중시한다.

Antigravity CLI(Google)는 2026년 6월 18일 Gemini CLI를 대체한 신규 도구로, Go 언어로 재작성됐다. 기본 모델인 Gemini 3.5 Flash는 Google 주장 기준으로 다른 프론티어 모델보다 4배 빠르다. MCP Atlas 지표에서는 83.6%를 기록해 멀티 스텝 도구 오케스트레이션에서 강점을 보였다.

업무 유형에 맞춰 보면 선택 기준이 더 분명해진다.

유즈케이스 권장 도구 이유
야간 배치 자동화 Codex CLI 무감독 장시간 실행 강점
코드 품질 중심 개발 Claude Code + Fable 5 높은 출력 품질, 인간 협력
대규모 병렬 태스크 Antigravity CLI 속도 최적화, 멀티 도구 조율
비용 효율 중심 Claude Code + Opus 4.8 Fable 5 대비 절반 비용, 78.9% 성능
엔터프라이즈 고가치 작업 Claude Code + Fable 5 SWE-Bench Pro 1위 수준

비용은 성능 지표와 함께 해석해야 한다. Claude Fable 5의 API 단가는 입력 백만 토큰당 $10, 출력 백만 토큰당 $50이다. Opus 4.8의 $5/$25와 비교하면 두 배다. FrontierCode Diamond에서는 Fable 5가 29.3, Opus 4.8이 13.4를 기록했다. Terminal-Bench 점수만 비교하면 83.1%와 78.9%의 차이에 비해 비용 부담이 커 보이지만, 복잡한 고가치 작업에서는 Fable 5의 성능이 전체 작업 비용을 낮출 수 있다.

조직의 작업 구조에 맞춰 에이전트를 배치한다

도입 판단의 출발점은 조직이 에이전트에 맡길 작업을 복잡도에 따라 나누는 것이다. 반복 자동화는 단순 작업, 일반 개발은 중간 작업, 연구와 고난도 엔지니어링은 복잡 작업으로 분류할 수 있다. Terminal-Bench 2.1 점수는 이 가운데 복잡 태스크의 성능과 가장 강한 상관관계를 보인다.

그다음에는 단일 도구가 아닌 에이전트 포트폴리오를 설계한다. 2026년 프로덕션 팀에서 쓰이는 레이어드 스택은 Claude Code를 로컬 정밀 작업에 두고, 별도 셸의 Codex CLI에는 지구력이 필요한 작업을 맡기며, Cursor Background Agents로 클라우드 병렬 팬아웃을 처리하는 방식이다.

라우팅은 중앙 게이트웨이에서 맡을 수 있다. 태스크의 복잡도를 판별해 고가치 복잡 작업은 Fable 5로 보내고, 나머지는 Opus 4.8이나 Flash 계열로 전달한다. Anthropic 연구에 따르면 이 게이트웨이의 규칙을 도메인 전문가가 정의할 때 성과가 가장 높다.

이 과정은 태스크 복잡도 분류, 에이전트 포트폴리오 설계, 복잡도 기반 라우팅 게이트웨이의 3단계로 이어진다.

벤치마크 점수를 실제 업무 성과로 오해하지 않기

Terminal-Bench는 격리된 환경에서 독립 태스크를 평가한다. 반면 실제 업무의 결과는 팀의 컨텍스트, 코드베이스 히스토리, 조직 내부의 암묵적 지식에 영향을 받는다. Anthropic의 연구처럼 같은 모델도 도메인 전문가가 사용할 때 성과가 달라진다.

따라서 Terminal-Bench 점수는 복잡한 작업을 수행할 수 있는 성능 하한선을 판단하는 필요조건으로 볼 수 있지만, 실제 업무 성과를 보장하는 충분조건은 아니다. 도입 전에는 모델의 순위와 함께 승인 방식, 자율 실행 시간, 비용, 조직의 작업 지식을 에이전트에 전달하는 구조를 살펴야 한다.

이 평가 방식은 소프트웨어 테스트와 AI 시스템 품질 관리에도 연결된다. 멀티 턴 실행 후 테스트 통과를 완료 기준으로 삼는 구조는 테스트 주도 개발(TDD)과 CI/CD 자동화의 관점에서 읽을 수 있다. 격리 환경, 독립 태스크, 실행 기반 검증은 ML 모델 평가 체계에도 적용되는 원칙이다.

레거시 시스템 설정과 마이그레이션 능력은 DB 마이그레이션, 시스템 통합, 운용 자동화와 맞닿아 있다. 에이전트 선정을 조달 의사결정으로 확장하면 벤더 평가와 ROI 분석의 기준으로도 활용할 수 있다.

2026년 에이전트 운영에서 보이는 흐름

Stanford와 Laude Institute가 참여하고 지속적인 검증 프로세스를 갖춘 Terminal-Bench 2.1은 마케팅용 점수를 넘어 조달과 계약의 판단 기준으로 쓰이기 시작했다. 이는 AI 에이전트 시장이 성숙 단계로 들어섰다는 신호다.

동시에 Anthropic의 약 40만 세션 연구는 도메인 전문가의 역할을 부각했다. 법률, 의료, 금융, 제조 분야의 비개발자 전문가가 AI를 이용해 소프트웨어를 만드는 방식이 현실의 업무 흐름으로 들어오고 있다.

단일 도구가 모든 작업에서 우위를 차지하지 않는 만큼 조직은 복잡도와 필요한 자율성에 따라 여러 에이전트를 조합하게 된다. Terminal-Bench 점수는 레이어드 에이전트 스택에서 각 모델과 도구를 어디에 배치할지 판단하는 근거가 된다.

Codex CLI의 83.4%와 Claude Code(Fable 5)의 83.1%는 단순한 순위 차이로만 읽기 어렵다. 무감독 자율성을 우선할지, 사람과의 협업 품질을 택할지에 따라 선택이 달라진다. 여기에 Anthropic의 연구가 보여준 도메인 전문성까지 고려하면, 2026년 하반기의 도구 선택은 벤치마크 점수와 조직 내부 전문가를 에이전트 워크플로에 연결하는 방식이 함께 결정하게 된다.

Sources

AI 코딩 에이전트Terminal-BenchCodex CLIClaude Code도메인 전문성