Claude Code와 Codex CLI 아키텍처·성능·운영 방식 비교

Claude Code와 Codex CLI의 실행 모델, 컨텍스트, 샌드박싱, 멀티에이전트 구조와 성능을 Antigravity까지 포함해 비교한다.

2026-08-14 · 최초 발행 2026-06-10

모델보다 먼저 봐야 할 실행 구조

2026년 중반 AI 코딩 에이전트 시장은 Anthropic의 Claude Code, OpenAI의 Codex CLI, Google의 Antigravity(구 Gemini CLI)가 경쟁하는 구도로 성숙 단계에 들어섰다. 이 도구들은 코드베이스를 읽고, 여러 단계의 변경을 계획해 실행하며, 테스트 실패를 고쳐 코드를 출하하는 수준까지 작업 범위를 넓혔다.

겉으로는 비슷해 보여도 실행 모델과 컨텍스트 설계, 샌드박싱, 멀티에이전트 오케스트레이션 방식은 다르다. 어느 모델의 점수가 더 높은지만으로 선택하기 어려운 이유다. 실제 운영에서는 개발자가 에이전트와 대화하는 방식, 코드를 실행할 위치, 보안 정책, 병렬 작업 규모가 판단 기준이 된다.

AI 코딩 에이전트는 자연어 지시를 받은 뒤 코드베이스 분석, 계획 수립, 파일 수정, 테스트, 커밋을 자율적으로 이어 가는 소프트웨어 시스템이다. 단순 코드 자동완성에 머물렀던 Copilot 1세대와 달리 멀티스텝 추론, 도구 호출, 실행 환경의 피드백을 반영하는 루프를 갖는다.

성능 평가는 SWE-bench 계열을 중심으로 이뤄진다. 실제 GitHub 이슈 해결률을 다루는 SWE-bench Verified와 고난도 리팩터링을 평가하는 SWE-bench Pro가 사실상 업계 표준으로 자리 잡았고, CursorBench는 에디터 통합 관점의 보완 지표로 쓰인다.

에이전트 SWE-bench Pro SWE-bench Verified 속도
Claude Code (Opus 4.7) 64.3% 87.6% ~67 tok/s
Codex CLI (GPT-5.5) 58.6% 88.7% 1,000+ tok/s
Antigravity 2.0 55.1% 미공개 289 tok/s

이 결과에서 Claude Code는 복잡한 리팩터링 품질, Codex CLI는 비동기 처리량과 SWE-bench Verified 최고점에 강점을 보인다. Antigravity는 Google 생태계 통합과 속도에 무게를 둔다.

Claude Code는 개발자 머신에서 바로 움직인다

Claude Code는 터미널을 중심으로 동작하는 로컬 실행 에이전트다. 별도의 클라우드 샌드박스를 거치지 않고 개발자 머신의 파일을 읽고 쓰거나 삭제하며, 셸 명령을 실행하고 git 커밋까지 처리한다. 네트워크 레이턴시를 줄이고 에이전트의 작업 결과를 즉시 확인하며 대화를 이어 가기 좋은 구조다.

이 설계의 중심에는 긴 컨텍스트가 있다. 2026년 4월 16일 출시된 Claude Opus 4.7은 Max·Team·Enterprise 플랜에서 기본적으로 1M 토큰 컨텍스트를 활성화한다. 수십만 줄 규모의 모노레포를 단일 컨텍스트 안에서 처리할 수 있는 범위다. 5월 28일에는 Opus 4.8이 출시돼 추론 효율이 추가로 개선됐다. 기본 노력 수준은 "xhigh"이며, 태스크 복잡도에 따라 적응형 추론이 활성화된다.

클라우드 격리 대신 정책 집행은 애플리케이션 레이어에서 이뤄진다. 20여 종 이상의 라이프사이클 이벤트 훅을 제공하며, PreToolUse·PostToolUse 훅으로 도구 사용의 허용·차단 규칙을 선언할 수 있다. 엔터프라이즈 보안 정책과 세밀하게 연결하기 좋은 반면, OS 커널 수준의 격리는 Codex CLI보다 약하다.

로컬 환경에 직접 접근하는 구조는 Computer Use에서도 장점으로 이어진다. 실제 데스크톱 환경의 GUI를 다룰 수 있어 브라우저 자동화와 웹 UI 인터랙션은 Codex CLI보다 강하다.

Codex CLI는 작업을 격리하고 병렬로 돌린다

Codex CLI의 구별되는 지점은 클라우드 기반 비동기 실행이다. 개발자가 작업을 큐에 등록하면 에이전트가 OS 커널 수준의 샌드박스 컨테이너에서 독립적으로 실행되고, 완료된 작업은 풀 리퀘스트 형태로 돌아온다. 작업 중 활성 세션을 계속 유지하지 않아도 되므로 야간 배치와 백그라운드 병렬 처리에 맞는다.

모델은 용도에 따라 나뉜다. GPT-5.5는 장시간 자율 세션에 최적화됐고, GPT-5.3-Codex-Spark는 1,000+ tok/s 속도로 실시간 페어 프로그래밍을 지원한다. GPT-5.5-Codex는 NVIDIA GPU가 아니라 Cerebras 하드웨어에서 구동된다. 이 구성은 2026년 초 체결된 100B+ 파트너십을 기반으로 하며 처리량에서 우위를 제공한다.

멀티에이전트 기능도 이 실행 구조와 결합된다. v0.115.0이 공개된 2026년 3월 16일 서브에이전트 GA가 선언됐으며, 최대 6개 서브에이전트를 동시에 실행할 수 있다. PostToolUse 훅, Smart Approvals, 워크트리 자동화, 매니지드 엔터프라이즈 설정도 지원한다. 하나의 큰 변경을 영역별로 나누어 병렬 처리하는 작업에 적합하다.

컨테이너 수준의 격리는 에이전트가 로컬 파일시스템을 오염시킬 위험을 줄인다. 코드 실행 환경을 분리해야 하는 금융·의료 같은 규제 산업에서 특히 의미가 있다.

실행 모델을 한눈에 비교하면

Codex CLI 아키텍처Claude Code 아키텍처개발자CLI 터미널Opus 4.7 (1M ctx)로컬 파일시스템 레이어Computer UseCLI /GPT-5.5 / SparkOS 커널 샌드박스멀티에이전트 (최대 6)PR 결과 반환

Claude Code는 개발자 머신과 에이전트 사이의 거리를 줄이는 방향이다. Codex CLI는 작업을 격리된 환경으로 보내고 여러 실행 단위를 관리하는 방향에 가깝다. 이 차이는 코드 탐색, 테스트, 보안 통제 방식에 그대로 반영된다.

코드베이스 탐색과 변경 처리의 차이

Claude Code의 1M 토큰 컨텍스트는 대규모 모노레포를 단일 패스로 읽고 의존성을 깊게 분석하는 데 유리하다. Codex CLI의 컨텍스트 크기는 명시되지 않았지만, 여러 서브에이전트가 코드베이스의 서로 다른 영역을 동시에 분석하는 방식으로 이를 보완한다.

테스트 자동화는 두 도구 모두 실행, 실패 감지, 수정, 재실행으로 이어지는 피드백 루프를 지원한다. Claude Code는 로컬 셸에서 pytestjest를 직접 실행하고 출력을 바로 컨텍스트에 반영한다. Codex CLI는 샌드박스 안에서 테스트 환경을 격리하므로 의존성 오염 없이 반복 실험할 수 있다.

에디터와 연결되는 방식도 다르다. CursorBench에서 Claude Code(Opus 4.7)는 70%를 기록했고, 이는 Opus 4.6보다 12%p 향상된 결과다. Codex CLI는 VS Code 확장과 GitHub Copilot 파이프라인으로 통합된다. Antigravity는 전용 데스크톱 IDE를 함께 제공한다.

복잡한 멀티스텝 변경에서는 SWE-bench Pro 결과상 Claude Code가 우위를 보인다. Notion Agent 벤치마크에서는 툴 오류가 Opus 4.6 대비 1/3로 감소했고, SWE-bench Verified에서는 3배 더 많은 태스크를 해결했다.

워크플로와 보안 정책으로 선택하기

Claude Code는 복잡한 리팩터링과 높은 품질의 코드 변경이 필요하거나, 개발자가 즉각적인 피드백을 주고받으며 작업할 때 어울린다. Computer Use를 활용한 브라우저 자동화가 필요하고, 엔터프라이즈 정책을 훅으로 세밀하게 통제하려는 환경에도 맞는다.

Codex CLI는 야간 배치와 백그라운드 작업이 많을 때 강점이 선명하다. OS 수준의 샌드박싱이 필요한 규제 환경, raw 토큰 비용과 처리량을 중시하는 대형 조직, 멀티에이전트로 대규모 작업을 분해하려는 팀이 주요 대상이다.

Google 생태계에 깊게 들어가 있는 조직이라면 Antigravity도 선택지다. GCP, Workspace, BigQuery와의 통합을 우선하거나 코드 품질보다 속도가 중요한 초기 프로토타이핑 단계, Go 기반 CLI와 번들 IDE를 선호하는 팀에 맞는다.

비용 구조는 운영 형태에 따라 갈린다. Claude Code는 Claude Max의 $100~200/월 시트 단위 요금을 적용한다. Codex CLI는 raw 토큰 기반이라 고처리량 워크로드에서 단가 우위를 가질 수 있다. Antigravity는 Google Cloud 크레딧과 연결된 소비 과금 모델을 사용한다.

Antigravity가 끼어든 경쟁 구도

2026년 Google I/O에서 공개된 Antigravity 2.0은 Gemini CLI를 대체한다. 데스크톱 IDE, Go CLI, 커스텀 에이전트 SDK를 하나의 구성으로 제공하며 Gemini 3.5 Flash를 기반으로 289 tok/s를 달성한다.

SWE-bench Pro 점수는 55.1%로 세 경쟁자 가운데 가장 낮다. Google은 복잡한 코드 변경의 해결률보다 속도와 자사 플랫폼 통합을 차별화 축으로 삼은 것으로 해석할 수 있다.

개발 프로세스에 들어온 에이전트를 보는 관점

AI 코딩 에이전트는 요구사항 분석, 설계, 구현, 테스트로 이어지는 SDLC 전반에 자율적으로 참여한다. Claude Code의 멀티스텝 변경은 구현과 테스트, 수정 사이클을 연결하면서 전통적인 폭포수 모델의 단계 경계를 흐린다.

형상 관리에서는 두 에이전트 모두 git 기반 변경 관리를 핵심으로 사용한다. 특히 Codex CLI가 결과를 PR로 반환하는 구조는 git-flow와 바로 연결되며 기존 코드 리뷰 게이트웨이를 유지한다.

보안 아키텍처에서는 애플리케이션 레이어 훅과 OS 커널 격리의 차이를 구분해야 한다. 이는 정보보호 관리체계(ISMS)를 적용할 때도 중요한 선택 기준이다. 금융권 규제 환경에서는 Codex CLI의 커널 샌드박스가 내부 데이터 유출 방지(DLP) 정책과 높은 정합성을 보인다.

성능 평가 역시 단일 점수의 순위로만 읽기 어렵다. SWE-bench 계열은 기존 소프트웨어 품질 지표인 결함 해결률(Defect Resolution Rate)을 AI 에이전트에 적용한 형태로 볼 수 있다. SWE-bench Pro의 64.3%와 58.6% 차이는 단순한 점수 격차를 넘어 복잡도 유형별 문제 해결 역량의 질적 차이를 담는다.

Claude Code와 Codex CLI는 각각 로컬 대화형 고품질 실행과 클라우드 비동기 병렬 처리라는 상반된 설계를 대표한다. Claude Code는 Opus 4.7의 1M 컨텍스트와 낮은 툴 오류율을 바탕으로 복잡한 리팩터링에 강하고, Codex CLI는 멀티에이전트 병렬 실행과 커널 샌드박스로 대규모 엔터프라이즈 작업에 유리하다. 하나를 고르는 대신 워크플로, 보안 정책, 코드 복잡도에 따라 두 도구를 병행하는 하이브리드 운영도 현실적인 선택지다.

Sources

Claude CodeCodex CLIAI 코딩 에이전트멀티에이전트개발 도구