Codex가 GPT-5.5로 macOS를 직접 조작하기 시작했다: 이중 격리 샌드박스와 컴퓨터 사용 아키텍처
OpenAI Codex의 GPT-5.5 탑재와 macOS 컴퓨터 사용 기능을 Landlock·seccomp 이중 격리 샌드박스, ScreenCaptureKit·접근성 API 구현 기법, EU 규제 대응 기능 플래깅으로 분석한다.
2026-08-14 · 최초 발행 2026-05-04
GPT-5.5가 가져온 성능과 토큰 효율
2026년 4월 OpenAI는 GPT-5.5를 Codex의 기본 권장 모델로 지정하며 에이전틱 코딩 도구 경쟁의 새 장을 열었다. Terminal-Bench 2.0에서 82.7% 정확도를 기록하고 macOS 데스크톱 앱을 직접 조작하는 컴퓨터 사용 기능까지 추가됐다. 다만 EEA, 영국, 스위스에서는 지역 규제로 컴퓨터 사용 기능이 제한된다.
GPT-5.5는 2026년 4월 24일 Plus, Pro, Business, Enterprise 사용자에게 순차 배포됐다. 에이전틱 코딩 분야에서 이전 세대 대비 뚜렷한 성능 향상을 기록했는데, Terminal-Bench 2.0(터미널 기반 코딩 에이전트 평가)에서 82.7%, SWE-Bench Pro(실제 GitHub 이슈 해결률)에서 58.6%를 기록했다.
| 벤치마크 | GPT-5.5 성능 | 설명 |
|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 터미널 기반 코딩 에이전트 평가 |
| SWE-Bench Pro | 58.6% | 실제 GitHub 이슈 해결률 |
| 토큰 효율 | GPT-5.4 대비 향상 | 동일 품질 달성 시 토큰 소비 감소 |
GPT-5.5는 단순히 더 강력한 모델이 아니라 토큰 효율도 함께 개선했다는 점이 주목할 만하다. Codex는 GPT-5.5가 GPT-5.4보다 대부분의 사용자 작업에서 더 적은 토큰으로 더 나은 결과를 내도록 세밀하게 조정됐다. 더 높은 가격에도 불구하고 실질 사용 비용은 유사하거나 낮을 수 있다.
인앱 브라우저와 스레드 채팅은 에이전트가 웹 탐색과 컨텍스트 누적을 함께 처리하며 복잡한 지식 작업을 수행하도록 지원한다. PR 리뷰 강화는 코드 변경 사항을 자동으로 분석하고 리뷰 코멘트를 생성하는 기능으로 코드 리뷰 워크플로우에 직접 통합된다.
클라우드 샌드박스는 로컬 접근과 무엇이 다른가
Codex는 에이전트가 격리된 클라우드 컨테이너 내에서 실행되는 아키텍처를 채택한다. 로컬 파일시스템에 직접 접근하는 Claude Code와는 근본적으로 다른 설계 철학이다.
Codex는 주요 에이전트 중 기본적으로 샌드박싱이 활성화된 유일한 도구라고 OpenAI는 강조한다. Landlock은 파일시스템 접근을 커널 수준에서 제어하고, seccomp(Secure Computing Mode)는 허용된 시스템 콜만 실행되도록 필터링한다. 이 Landlock과 seccomp 기반 이중 격리로 에이전트가 승인되지 않은 파일이나 시스템 자원에 접근하는 것을 원천 차단한다.
네트워크 격리도 함께 작동한다. 작업 실행 중 인터넷 접근은 기본적으로 비활성화되며, 에이전트는 GitHub를 통해 명시적으로 제공된 코드와 사전 설치된 의존성만 접근할 수 있다. 네트워크 통신은 보안 및 남용 방지를 위한 HTTP/HTTPS 프록시를 통해서만 이뤄진다. 에이전트는 주요 언어·패키지·도구가 사전 설치된 'universal' 기본 컨테이너 이미지에서 실행되며, 사용자는 설정 스크립트로 프로젝트별 의존성을 추가 구성할 수 있다.
에이전트의 작업 루프는 터미널 명령 실행 → 코드 편집 → 검증 → 반복의 구조를 따른다. AGENTS.md 지원으로 에이전트는 리포지토리별 맞춤 지침을 파악하고, MCP(Model Context Protocol) 통합으로 서드파티 도구를 확장해 사용할 수 있다.
화면을 보고 클릭하는 방법
Codex의 macOS 컴퓨터 사용 기능은 두 가지 핵심 기술 위에 구축된다. Apple의 ScreenCaptureKit 프레임워크가 화면 내용을 고성능으로 캡처하는 ScreenCaptureKit 기반 화면 캡처를 담당한다. 사용자가 Screen Recording 권한을 부여하면 에이전트는 현재 화면 상태를 실시간으로 분석할 수 있으며, 전통적인 OCR 기반 접근법보다 낮은 지연시간으로 화면 내용을 파악한다. macOS 접근성 API는 화면의 시각적 내용을 픽셀 수준이 아닌 구조화된 UI 요소 트리로 노출하는 접근성 API 기반 UI 트리 접근을 제공한다. 버튼, 텍스트 필드, 메뉴 항목 등 각 UI 요소의 역할과 상태를 직접 읽고 조작할 수 있어 시각 기반 분석보다 훨씬 안정적이다.
사용자는 Codex 앱의 Computer Use 플러그인에서 대상 앱이나 브라우저를 승인하고 Screen Recording과 Accessibility 권한을 macOS 수준에서 부여한다. 이 명시적 권한 승인 체계는 에이전트가 무분별하게 화면을 감시하거나 조작하는 것을 막는 보안 설계다.
Codex는 여러 에이전트를 Mac에서 동시에 실행하며, 각 에이전트가 사용자의 작업을 방해하지 않는다. 이는 에이전트 간 화면 공간 격리와 입력 이벤트 라우팅을 통해 구현된다. 개발자는 여러 독립 작업을 동시에 병렬로 위임할 수 있어 전체 작업 처리량이 크게 증가한다.
화면을 캡처하는 순간 규제가 개입한다
GPT-5.5 컴퓨터 사용 기능은 출시 시점에 EEA(유럽경제지역), 영국, 스위스에서 제한된다. 지역별 데이터 보호 규정과 AI 규제 프레임워크에 따른 조치다.
2024년 발효된 EU AI Act는 고위험 AI 시스템 분류에 따른 준수 의무를 부과한다. 화면을 직접 캡처하고 UI를 자율적으로 조작하는 컴퓨터 사용 에이전트는 개인정보 처리, 자동화된 결정 등 여러 규제 요소와 교차한다. EU AI Office는 AI 에이전트 관련 개발이 빠르게 진화하고 있어 예비적 검토 단계에 있다고 밝혔다. 영국에서 기업이 컴퓨터 사용 에이전트를 배포하려면 모든 되돌릴 수 없는 작업에 대한 사람 검토 체크포인트 구현, GDPR 준수 감사 로그 유지, UK Data Use and Access Act 2025의 자동화된 의사결정 보호 조항 준수가 요구된다.
지역별 규제 준수를 위한 기능 플래깅 전략은 단순한 on/off 스위치가 아니라 정교한 계층 구조로 설계된다.
지역 감지는 IP 주소 기반 감지, 계정 가입 시 선택한 지역, 청구 주소 등 여러 신호를 조합한다. 단일 신호에 의존하면 VPN 등을 통한 우회가 가능하므로 다중 신호 검증이 필요하다. 제한 지역에서 컴퓨터 사용 기능이 비활성화될 때, 에이전트는 단순히 기능을 거부하는 대신 API 기반 자동화·코드 생성 같은 대안적 접근법을 제안하는 **우아한 기능 저하(Graceful Degradation)**로 작업을 계속 처리할 수 있다. 각 기능 릴리스마다 지역별 규제 준수 상태를 문서화하고 규제 변화에 따라 플래그를 업데이트하는 프로세스도 함께 유지된다.
Claude Code와 Codex, 무엇이 갈라놓는가
두 도구의 근본적 차이는 에이전트 실행 환경에 대한 철학적 입장에서 비롯된다.
| 항목 | Claude Code | OpenAI Codex |
|---|---|---|
| 실행 환경 | 로컬 파일시스템 직접 접근 | 격리된 클라우드 샌드박스 |
| 보안 모델 | 명시적 사용자 승인 | 기술적 격리 + 권한 최소화 |
| 컴퓨터 사용 | 없음 | macOS/Windows 지원 |
| PR 통합 | 로컬 git 워크플로우 | 클라우드에서 직접 PR 생성 |
| 오프라인 작동 | 가능 | 불가능(클라우드 의존) |
| 지역 제한 | 없음 | EEA/UK/CH 컴퓨터 사용 제한 |
클라우드 샌드박스 방식은 보안 격리 측면에서 강점이 있으나 네트워크 연결 필요성과 지역 규제 준수 부담이 따른다. 로컬 실행 방식은 개발자의 기존 환경과 통합이 자연스럽고 오프라인에서도 작동하지만, 에이전트 행동 통제는 기술적 격리가 아닌 사용자 승인에 의존한다.
Landlock과 seccomp 기반의 이중 격리 클라우드 샌드박스 아키텍처는 강력한 보안 기반을 제공하며, ScreenCaptureKit과 접근성 API를 결합한 컴퓨터 사용 구현은 실용적인 UI 자동화를 가능하게 한다. EEA와 영국 등 규제 지역에서의 기능 플래깅 전략은 글로벌 AI 서비스가 지역별 규제 환경을 어떻게 항법해야 하는지에 대한 선행 사례를 제시한다.
Sources
- Introducing GPT-5.5 - OpenAI
- OpenAI Debuts GPT-5.5 Claiming Agentic Coding and Research Gains - MacRumors
- Codex for (almost) everything - OpenAI
- Cloud environments – Codex web - OpenAI Developers
- OpenAI's New GPT-5.5 Powers Codex on NVIDIA Infrastructure - NVIDIA Blog
- OpenAI Releases GPT-5.5 With Stronger Agentic Coding - gHacks Tech News
- Engineering a macOS AI Agent: Lessons from Building Fazm - Dev Journal
- Codex Computer Use: When to Use It - LaoZhang AI Blog
- Changelog – Codex - OpenAI Developers