Claude Sonnet 4.5는 어떻게 30시간을 버티는가: SWE-bench Verified와 장기 실행 에이전트 설계
Claude Sonnet 4.5의 SWE-bench Verified 77.2% 성과와 30시간 연속 실행을 가능하게 하는 상태 지속성·토큰 자기 인식 아키텍처를 Claude Code·Codex·Gemini CLI와 비교 분석한다.
2026-08-14 · 최초 발행 2026-05-04
SWE-bench가 코딩 에이전트를 평가하는 방식
Anthropic이 2025년 9월 출시한 Claude Sonnet 4.5는 실제 소프트웨어 개발 능력을 측정하는 SWE-bench Verified 벤치마크에서 77.2%라는 최고 성능을 기록하며 에이전틱 코딩 모델의 기준을 새로 세웠다. 이 수치 이면에는 30시간 이상 연속 실행을 가능하게 하는 정교한 아키텍처 설계가 자리한다.
SWE-bench는 2023년 프린스턴 대학교 연구팀이 공개한 벤치마크로, AI 에이전트가 실제 GitHub 이슈를 얼마나 잘 해결하는지 측정한다. 기존 코딩 벤치마크가 격리된 알고리즘 문제나 단순 함수 작성 능력을 재던 것과 달리, SWE-bench는 수천 줄의 실제 코드베이스에서 발생한 버그 리포트나 기능 요청을 해결하는 능력을 평가한다. OpenAI가 2024년 8월 공개한 SWE-bench Verified는 원본 데이터셋에서 전문 소프트웨어 개발자들이 500개의 고품질 테스트 케이스를 직접 검수한 버전이다. 원본의 일부 이슈가 모호한 설명이나 불완전한 테스트를 포함해 평가 신뢰성에 문제가 있었는데, Verified 버전은 이를 인간 전문가 검증으로 해소했다.
평가는 두 단계 테스트로 이뤄진다. 이슈가 보고되기 전 실패하던 테스트가 패치 적용 후 통과하는지 확인하는 FAIL_TO_PASS 테스트가 이슈를 실제로 해결했는지 검증하는 핵심 지표이고, 기존에 통과하던 테스트가 패치 이후에도 여전히 통과하는지 보는 PASS_TO_PASS 테스트가 다른 기능을 의도치 않게 망가트리지 않았는지 확인하는 회귀 테스트다. 에이전트는 bash 도구 하나만 제공받아 명령행으로 파일을 탐색·수정하고 테스트를 실행한다. 이 미니멀한 설계는 평가 부담이 하네스가 아닌 모델 자체 능력에 집중되도록 하기 위함이다.
Claude Sonnet 4.5는 2도구 스캐폴드(bash + 파일 편집)·200K 컨텍스트 설정에서 77.2%, 1M 컨텍스트 설정에서 78.2%, 병렬 샘플링과 거절 샘플링을 적용하면 82.0%를 기록했다. 기본 설정에서 10회 평균으로 77.2%를 기록했다는 점이 주목할 만하다 — 단일 최고 실행값이 아닌 평균이라 재현 가능성이 높다. OSWorld-Verified 벤치마크에서도 61.4%를 기록해 Claude Sonnet 4의 42.2%에서 크게 도약했는데, 이는 브라우저와 데스크톱 UI 조작 능력도 함께 강화됐음을 보여준다.
| 설정 | 정확도 |
|---|---|
| 2도구 스캐폴드(bash + 파일 편집), 200K 컨텍스트 | 77.2% |
| 1M 컨텍스트 설정 | 78.2% |
| 병렬 샘플링 + 거절 샘플링 적용 | 82.0% |
30시간을 버티는 아키텍처
대부분의 LLM 에이전트는 컨텍스트 윈도우 한계와 상태 비저장(stateless) 특성 때문에 장시간 작업에서 방향을 잃거나 중간에 실패하는 경향이 있다. Claude Sonnet 4.5가 30시간 이상 복잡한 작업을 처리할 수 있는 배경에는 여러 아키텍처적 개선이 함께 작동한다.
상태 지속성 메커니즘: 모델은 외부 파일 기반 메모리 시스템을 통해 컨텍스트 윈도우 밖에 정보를 저장한다. 전용 메모리 디렉토리에 진행 상황·발견된 정보·결정 이력을 기록하며, 이 파일들은 세션 간에도 유지된다. 에이전트가 재시작되더라도 이전 작업의 정확한 상태를 복원할 수 있다.
토큰 사용량 자기 인식: 각 도구 호출 이후 자신의 토큰 사용량을 업데이트받는다. 이 자기 인식 능력은 컨텍스트가 부족해지기 전에 작업을 조정하거나 중요 정보를 압축하는 선제적 행동을 가능하게 한다. 기존 모델들이 컨텍스트 한계에 갑자기 부딪혀 작업을 포기하던 문제를 해결한 것이다.
오류 복구 전략: 장기 실행 중 도구 호출 실패나 예상치 못한 결과를 만났을 때 단순히 작업을 중단하는 대신, 대안 접근법을 시도하고 실패 원인을 진단하며 사실 기반 진행 보고를 유지한다. 과도한 낙관적 보고 없이 실제로 완료된 작업만을 정확히 보고하는 신뢰성도 함께 향상됐다.
병렬 도구 호출 최적화: 연구 단계에서 여러 검색을 동시에 실행하고 여러 파일을 병렬로 읽어 컨텍스트를 빠르게 구축한다. 순차 실행 대비 작업 속도가 크게 향상되며, 제한된 컨텍스트 윈도우 안에서 더 많은 실질적 작업을 처리할 수 있다.
Claude Code는 Amazon Bedrock의 서비스 티어와도 통합돼, 기업 개발팀이 이 에이전틱 코딩 능력을 기존 AWS 인프라와 보안 정책 내에서 활용할 수 있다. Bedrock 서비스 티어는 사용량 예측 가능성과 비용 최적화를 제공하며, 특히 비용 관리가 중요한 기업 환경의 장기 실행 워크플로우에 적합하다.
Claude Code vs Codex vs Gemini CLI: 갈라지는 설계 철학
에이전틱 코딩을 지향하는 세 도구는 설계 철학과 아키텍처에서 뚜렷이 갈린다.
Claude Code는 개발자의 로컬 터미널과 파일시스템에 직접 접근하는 방식을 택했다. 파일 읽기·쓰기·실행 권한을 명시적으로 승인하는 방식으로 보안과 투명성을 확보하며, 에이전트가 실행하는 모든 명령을 개발자가 실시간으로 확인하고 승인할 수 있다. 멀티-턴 대화에서 이전 컨텍스트를 누적하는 방식으로 복잡한 작업을 단계적으로 처리한다.
OpenAI Codex는 격리된 클라우드 샌드박스에서 코드를 실행하는 아키텍처를 택했다. 인앱 브라우저와 macOS 컴퓨터 사용 기능을 포함해 코드 실행을 넘어 UI 조작까지 지원한다. 클라우드 격리는 보안상 이점이 있지만 로컬 환경과의 상태 동기화 복잡성이 생긴다. PR 리뷰 통합으로 코드 변경의 검토와 병합 과정까지 지원한다.
Gemini CLI는 Markdown과 YAML로 에이전트의 역할·도구·행동 지침을 선언적으로 정의하는 차별화된 접근법을 취한다. 서브에이전트 기능으로 복잡한 작업을 독립 컨텍스트 윈도우를 가진 하위 에이전트에 위임하고 결과를 집계한다. 선언적 설계는 반복 가능하고 버전 관리 가능한 에이전트 구성을 가능하게 한다.
| 항목 | Claude Code | Codex | Gemini CLI |
|---|---|---|---|
| 실행 환경 | 로컬 파일시스템 | 클라우드 샌드박스 | 로컬 + 선언적 |
| 에이전트 정의 | 대화형 | 대화형 | 선언적(YAML) |
| 서브에이전트 | 제한적 | 없음 | 지원 |
| 컨텍스트 전략 | 외부 파일 메모리 | 세션 기반 | 독립 컨텍스트 |
| 장기 실행 | 30시간+ | 미공개 | 병렬 위임 |
30시간 실행 능력이 바꾸는 작업
Claude Sonnet 4.5의 장기 실행 능력은 몇 가지 실질적인 개발 시나리오에서 게임 체인저가 된다. 수십만 줄 코드베이스의 레거시 코드를 현대적 패턴으로 전환하는 대규모 리팩터링은 기존에 며칠이 걸리던 작업인데, 에이전트가 코드베이스를 탐색하고 패턴을 파악하고 점진적으로 변환하면서 각 단계에서 테스트를 실행해 회귀를 방지하는 전 과정을 자율적으로 수행할 수 있다. 전체 코드베이스를 체계적으로 스캔하고 취약점을 수정하며 테스트로 검증하는 반복 과정인 취약점 탐지 및 수정에서는 장기 실행 에이전트가 중단 없이 처리하며 발견된 취약점과 수정 이력을 외부 파일에 지속적으로 기록한다. 프레임워크 버전 업그레이드나 클라우드 플랫폼 이전처럼 수백 개 파일을 일관되게 수정해야 하는 마이그레이션 작업에서는 상태 추적 능력이 빛을 발한다 — 중간에 실패하더라도 외부 파일에 저장된 진행 상황을 기반으로 정확히 중단된 지점부터 재개할 수 있다.
Sources
- Introducing Claude Sonnet 4.5 - Anthropic
- Claude Sonnet 4.5 Tops SWE-Bench Verified, Extends Coding Focus beyond 30 Hours - InfoQ
- Introducing Claude Sonnet 4.5 in Amazon Bedrock - AWS
- Introducing SWE-bench Verified - OpenAI
- SWE-bench Verified - Epoch AI
- Claude Sonnet 4.5: A Technical Analysis & Benchmarks - Cirra
- What's new in Claude 4.5 - Claude API Docs
- Claude Sonnet 4.5 New Features Explained: Memory, VS Code, Long Tasks - Shelly Palmer