Codex 멀티 서피스 코딩 에이전트 플랫폼 전략

GPT-5.5와 GPT-5.3-Codex의 역할 분담부터 CLI·IDE·모바일·Chrome 확장까지 Codex 플랫폼 전략과 운영 과제를 분석한다.

2026-08-14 · 최초 발행 2026-08-02

코딩 도구에서 작업 플랫폼으로 넓어진 Codex

2026년 6월 Codex의 변화는 새 모델을 추가한 수준에 머물지 않는다. 로컬 세션에는 GPT-5.5를, 클라우드와 코드리뷰에는 GPT-5.3-Codex를 배치하고 CLI·IDE 확장·Codex Cloud·ChatGPT 앱 사이드바·모바일 GA·Chrome 확장을 하나의 작업 흐름으로 묶었다.

각 접점은 독립적으로 사용할 수 있지만 세션 상태를 공유한다. Mac에서 시작한 작업을 iOS·Android에서 확인하고, 동일한 프로젝트·플러그인·Chrome 세션을 이어서 다루는 구조다. 2026년 초와 비교하면 주간 활성 사용자는 8배 증가해 400만 명 이상에 도달했다. 경쟁의 기준도 단일 코딩 기능에서 사용자가 오가는 환경 전체를 누가 연결하느냐로 이동하고 있다.

로컬 응답성과 클라우드 실행을 나눈 모델 구조

GPT-5.5와 GPT-5.3-Codex의 구분은 단순한 버전 차이가 아니다. 태스크가 실행되는 위치와 요구되는 작업 방식에 따라 모델의 책임을 나눈 설계다.

GPT-5.5는 CLI와 IDE 확장에서 수행하는 일반 코딩의 권장 모델이다. 복잡한 코딩뿐 아니라 컴퓨터 사용, 지식 작업, 리서치 워크플로우를 담당하며 ChatGPT Plus·Pro·Business·Enterprise 플랜에 포함된다. Terminal-Bench 2.0에서는 82.7%를 기록했다.

GPT-5.3-Codex는 2026년 2월 5일 출시된 클라우드·코드리뷰용 통합 추론 에이전틱 모델이다. 컨텍스트 윈도우는 400,000 토큰이며 Perfect Recall 어텐션과 128,000 토큰 최대 출력을 제공한다. GPT-5.2-Codex보다 속도가 25% 향상됐고, GitHub Copilot Business와 Enterprise의 기본 모델로도 채택됐다.

이 모델은 Codex 팀이 초기 버전으로 모델 자체의 훈련을 디버깅하고 배포를 관리하며 평가를 진단한 자기 참조적 개발의 결과이기도 하다. 2025년 11월의 GPT-5.2-Codex가 코드 작성과 디버깅에 초점을 맞췄다면, GPT-5.3-Codex의 작업 범위는 Jira 티켓 업데이트와 문서 작성까지 포함하는 엔드 투 엔드 흐름으로 넓어졌다.

실시간 로컬 작업클라우드 / 코드리뷰사용자 코딩 태스크 요청태스크 유형 분류GPT-5.5로컬 세션 모델GPT-5.3-Codex클라우드 모델CLI 터미널IDE 확장 사이드바Codex Cloud UIGitHub CopilotBusiness/Enterprise세션 상태 동기화모바일 GAiOS/AndroidChrome 확장브라우저 컨텍스트ChatGPT 사이드바

개발자가 오가는 접점이 하나의 세션으로 이어진다

터미널에서는 실행과 파일 변경까지 맡긴다

Codex CLI는 Rust 기반으로 구현됐으며 GitHub의 openai/codex 저장소에 오픈소스로 공개돼 있다. 권장 프런티어 모델은 GPT-5.5다. 에이전트는 엄격한 샌드박싱 프로토콜 안에서 실행되고, 선택한 승인 모드에 따라 코드 실행과 파일 수정, 명령 실행을 자율적으로 처리한다.

에디터 안에서는 여러 에이전트를 작업별로 고른다

IDE 확장은 VS Code와 그 기반 포크인 Cursor·Windsurf에서 사용할 수 있다. 2026년 1월부터는 IntelliJ IDEA·PyCharm·WebStorm·Rider 등 JetBrains IDE에도 네이티브 통합이 제공된다.

설치 후에는 에디터 사이드바에서 Codex를 호출한다. 인증 방식은 ChatGPT 계정, API 키, JetBrains AI 구독을 지원한다. 2026년 2월부터 VS Code에서는 Codex·Claude Code·GitHub Copilot을 동시에 활성화할 수 있어 태스크 성격에 따라 에이전트를 바꿔 쓰는 구성이 가능해졌다.

오래 걸리는 작업은 웹에서 비동기로 보낸다

Codex Cloud는 ChatGPT 웹 인터페이스에서 태스크를 만들고 비동기로 실행하는 환경이다. 세션이 끝난 뒤에도 백그라운드 작업이 계속되므로 장시간 실행되는 에이전틱 워크플로우에 맞는다.

ChatGPT 앱에서는 Codex가 사이드바에 들어간다. 대화 중 쌓인 컨텍스트를 유지한 채 코딩 태스크를 위임할 수 있어 자연어 협업과 에이전트 실행이 같은 워크스페이스에서 연결된다.

모바일은 원격 감독 접점이 된다

OpenAI는 2026년 5월 14일 ChatGPT 모바일 앱에서 Mac용 Codex 데스크톱 앱에 원격으로 연결하는 기능을 추가했다. Windows 기기에서 iOS·Android 앱을 이용해 Mac에서 실행 중인 Codex 작업을 확인하고 제어할 수 있다.

프로젝트와 플러그인, Chrome 세션도 모바일에서 공유된다. 개발 환경 자체를 휴대하는 방식이 아니라 이동 중에 비동기 작업의 상태를 보고 필요한 결정을 내리는 접점에 가깝다.

Chrome 확장은 코드 밖의 업무 흐름을 연결한다

2026년 5월 7일에는 Codex 데스크톱 앱의 Plugins 시스템과 함께 Chrome 확장이 출시됐다. 에이전트가 사용자의 실제 Chrome 프로파일을 구동하기 때문에 Salesforce 업데이트, Gmail 검색, 내부 Grafana 대시보드 스크래핑 같은 브라우저 컨텍스트 작업을 자격 증명 없이 수행할 수 있다.

이 접점에서는 코딩 에이전트와 업무 자동화 도구의 경계가 흐려진다. 코드 편집과 실행에 머물던 에이전트가 기업 SaaS를 사용하는 작업까지 이어받는 구조다.

Codex·Claude Code·Antigravity·Cursor가 겨루는 기준

2026년 6월의 코딩 에이전트 시장에서는 Codex·Claude Code·Antigravity·Cursor가 유사한 에이전틱 코딩 블루프린트로 수렴하고 있다. 다만 벤치마크와 컨텍스트 크기, 지원 접점, 가격 구조가 달라 하나의 지표만으로 우위를 정하기는 어렵다.

에이전트 대표 모델 SWE-Bench Verified Terminal-Bench 2.0 컨텍스트 윈도우
Codex GPT-5.5 - 82.7% 200K 토큰
Claude Code Claude Opus 4.8 88.6% - 200K 토큰
Antigravity 2.0 Gemini 3.5 55.1% (SWE-Bench Pro) - 1M 토큰
Cursor Pro 다중 모델 선택 - - 200K+

Codex는 ChatGPT 플랜을 발판으로 사용자를 빠르게 늘리고, CLI에서 Chrome까지 접점을 함께 운영하는 전략을 택했다. 2026년 4월에는 $100/월 Pro 티어가 출시됐다.

Claude Code는 아키텍처와 계획 수립에서 높은 품질로 평가되며 VS Code·JetBrains 확장과 서브에이전트를 지원한다. 복잡한 태스크에서는 64.3% SWE-Bench Pro를 달성했다.

Antigravity 2.0은 289 tok/s의 토큰 생성 속도와 1M 토큰 컨텍스트를 내세운다. 개인 사용자에게 무료 공개 베타로 제공되며 데스크톱·CLI·SDK를 결합한다. Cursor Pro는 VS Code 포크 기반의 직접 편집 경험에 집중한 AI 코드 에디터이며 $20/월부터 시작한다.

현장에서는 한 제품으로 모든 단계를 처리하기보다 역할을 나누기도 한다. Claude Code는 아키텍처 설계와 계획 수립, Codex는 빠른 구현 루프와 tight 반복 작업, Antigravity 2.0은 브라우저 테스팅과 백그라운드 리팩터링에 배치하는 식이다.

아키텍처 설계복잡 추론빠른 구현 루프터미널 작업브라우저 테스팅백그라운드 리팩터코딩 에이전트 태스크태스크 성격 분류Claude CodeOpus 4.8SWE-Bench 88.6%CodexGPT-5.5Terminal-Bench 82.7%Antigravity 2.0Gemini 3.51M 토큰 컨텍스트고품질 코드 생성설계 문서화Chrome 확장비즈니스 워크플로우병렬 멀티 에이전트빠른 속도 289 tok/s통합 CI/CD 파이프라인

도입 판단은 모델 점수보다 워크플로우에서 시작해야 한다

Codex의 확장은 개발 도구가 코딩·리뷰·테스트·배포로 분절된 상태에서 하나의 에이전트 인터페이스로 모이는 흐름을 보여준다. VS Code에서 Codex·Claude Code·GitHub Copilot을 함께 실행하는 환경은 개발 단계마다 적합한 도구를 선택할 수 있게 한다.

GPT-5.3-Codex를 클라우드의 코드리뷰 모델로 분리한 구조는 품질 보증 자동화에도 영향을 준다. 리뷰를 비동기 태스크로 오프로드하면 로컬 개발 흐름을 유지하면서 별도의 품질 게이트를 운영할 수 있다.

Chrome 프로파일을 이용하는 브라우저 컨텍스트는 기존 RPA 영역과 맞닿는다. Salesforce·Jira·Grafana 같은 기업 SaaS와 개발 에이전트를 연결할 수 있기 때문이다. 모바일 GA는 장시간 실행되는 태스크를 사람이 원격에서 확인하고 승인하거나 취소하는 ‘감독하는 인간(human-in-the-loop)’ 구조를 확장한다.

이런 통합은 편의만으로 평가하기 어렵다. 조직에서 운영하려면 다음 통제 지점을 함께 설계해야 한다.

  • 에이전트의 코드 실행 환경을 엄격한 샌드박스로 격리한다.
  • Chrome 확장이 접근하는 사용자 프로파일의 권한 범위를 관리한다.
  • Codex Cloud의 비동기 실행 이력과 승인 로그를 감사 추적에 남긴다.

Codex의 2026년 6월 확장은 모델 성능 경쟁을 플랫폼 경쟁으로 옮겼다. GPT-5.5와 GPT-5.3-Codex를 실시간 로컬 작업과 클라우드 에이전틱 태스크에 나누고, 여러 장치와 애플리케이션 사이에서 작업 컨텍스트를 유지하는 전략이다. 2026년 하반기의 선택 기준은 단일 벤치마크 순위보다 조직의 개발 흐름에 어떤 에이전트 조합이 맞는지, 그리고 그 연결을 어떻게 통제할지에 놓이게 된다.

Sources

Codex코딩 에이전트GPT-5.5브라우저 에이전트개발 도구