GPT-5.4의 네이티브 컴퓨터 사용과 Codex 에이전트 아키텍처
GPT-5.4의 네이티브 컴퓨터 사용, 1M 컨텍스트, Codex 통합 구조를 분석하고 자동화 적용과 비용 설계 기준을 정리한다.
2026-08-14 · 최초 발행 2026-08-02
2026년 3월 5일 공개된 GPT-5.4의 변화는 단순한 모델 성능 향상에 머물지 않는다. Codex 계열 최초로 네이티브 컴퓨터 사용(computer-use)을 내장했고, API에서는 실험적으로 100만 토큰 컨텍스트 윈도우를 지원한다. 코딩·추론·컴퓨터 조작을 별도 전문 모델의 조합이 아니라 하나의 모델로 처리하는 범용 에이전트 구조가 구체화된 셈이다.
코딩과 화면 조작이 하나의 실행 루프로 들어왔다
GPT-5.4는 ChatGPT와 API뿐 아니라 Codex 앱·CLI·IDE 확장·Codex Cloud에 동시에 적용됐다. 핵심 변화는 GPT-5.2에서 분리돼 있던 reasoning 모드와 computer-use 기능을 단일 가중치로 통합한 데 있다.
네이티브 computer-use는 운영체제 화면을 시각적으로 인식하고 마우스와 키보드 명령을 생성한다. OSWorld-Verified 점수는 75%로, GPT-5.2의 47.3%보다 27.7%p 높으며 인간 전문가의 72.4%도 넘어섰다. 추론에 쓰는 토큰 수도 GPT-5.2보다 대폭 줄어 속도와 비용을 개선했다.
2026년 3월 기준 API 가격은 다음과 같다.
| 구분 | 입력 ($/1M 토큰) | 출력 ($/1M 토큰) |
|---|---|---|
| GPT-5.4 Standard | $2.50 | $15.00 |
| GPT-5.4 Pro | $30.00 | $180.00 |
| Batch/Flex | 50% 할인 적용 | 50% 할인 적용 |
화면을 읽고 행동하는 GUI 에이전트
기존 방식은 Claude 3.5 Sonnet computer-use 같은 별도 전문 모델과 오케스트레이션 레이어를 조합했다. GPT-5.4는 시각 인식, 행동 계획, 실행을 단일 모델 가중치 안에서 end-to-end로 처리한다.
GUI 조작 API는 Base64로 인코딩한 스크린샷을 vision 컨텍스트로 받아들인다. 행동 명령으로는 click, type, scroll, keypress, drag, screenshot을 지원한다. 웹 UI에서는 Playwright와 연동해 브라우저 조작 코드를 생성할 수 있으며, 현재 화면에서 목표 화면까지의 행동 시퀀스를 상태 기계 패턴으로 추론한다.
OSWorld는 데스크톱 환경에서 파일 시스템 탐색, 폼 입력, 브라우저와 애플리케이션 조작을 평가한다. 이 벤치마크에서 75%를 기록했다는 것은 인간 전문가의 72.4%를 넘어 AI 에이전트가 실질적인 업무 대체 가능 수준에 들어섰다는 의미다.
긴 컨텍스트를 실제 작업 범위로 바꾸는 방법
GPT-5.4 API의 최대 컨텍스트는 실험적으로 1,000,000 토큰이다. Codex Cloud는 비용과 처리량의 균형을 위해 기본적으로 약 400,000 토큰을 사용하며, compaction 마진을 고려한 Codex Desktop의 보고값은 약 258,400 토큰이다.
이 규모의 컨텍스트를 다루기 위해 반복되는 시스템 프롬프트와 코드베이스 공통 부분은 Prefix caching으로 보존한다. 초장문 입력에서는 Sliding window attention으로 중요 토큰을 선택적으로 유지하고, 한도에 가까워지면 이전 대화를 compaction 알고리즘으로 요약·압축한다. 1M 토큰은 청크로 나눠 병렬 인코딩한 뒤 어텐션을 통합한다.
1M 토큰은 약 750만 단어에 해당하며, Linux 커널 수준의 대형 오픈소스 프로젝트 전체 소스를 참조할 수 있는 범위다. 이를 이용하면 단일 세션에서 전체 코드베이스 리팩터링, 파일 간 의존성 분석, 프로젝트 전반의 버그 탐색을 수행할 수 있다.
코드베이스가 한도 안에 들어오면 전체 로드 방식으로 단일 컨텍스트에 적재한다. 한도를 넘는 경우에는 모듈과 패키지 단위의 계층적 요약으로 대체하고, 현재 작업 중인 파일을 높은 우선순위로 앞쪽에 배치한다. 관련성이 낮은 파일은 뒤로 보내 압축하는 식으로 컨텍스트를 동적으로 관리한다.
GPT-5.1-Codex-Max의 장기 실행 사례에서는 25시간 동안 약 1,300만 토큰을 소비하고 약 3만 줄의 코드를 생성했다. 여러 컨텍스트 윈도우를 compaction으로 연결해 프로젝트 규모의 리팩터링을 마쳤다.
앱·CLI·IDE·클라우드를 잇는 Codex 구조
Codex의 각 인터페이스는 같은 에이전트 코어를 공유하면서 작업 환경에 맞는 실행 방식을 제공한다.
Codex 앱은 에이전트 실행 과정을 시각적으로 모니터링하고 작업 이력을 관리하며 GUI 자동화를 실시간으로 미리 보여준다. Codex CLI는 터미널과 셸 스크립트, 파이프라인에 직접 연결되고 --context-limit 플래그로 토큰 제한을 조정한다. IDE 확장은 열린 파일을 자동으로 컨텍스트에 넣고, 인라인 제안과 파일 시스템 읽기·쓰기를 에디터 안에서 처리한다.
Tool Search는 수백 개의 MCP 도구와 API 커넥터 가운데 작업에 맞는 도구를 찾는다. 도구 카탈로그를 벡터 인덱스로 관리하고 의미적 유사도로 검색해 불필요한 호출을 줄이는 구조다.
GUI 자동화는 반복 작업부터 좁게 시작한다
컴퓨터 사용 에이전트의 초기 적용 대상으로는 API 변경이 없는 레거시 웹 UI 작업이 적합하다. 인간 전문가의 작업 화면을 녹화해 GPT-5.4에 few-shot 예시로 제공하고, 팝업이나 오류 메시지 같은 예외 화면의 처리 분기를 프롬프트에 명시한다. 모든 GUI 조작은 감사 로그로 남겨 규정 준수와 디버깅에 활용한다.
원본에서 제시한 자동화 대상과 예상 효과는 다음과 같다.
| 유즈케이스 | 자동화 전 소요 시간 | 예상 절감 | 난이도 |
|---|---|---|---|
| 레거시 시스템 데이터 추출 | 8h/일 | 90% | 중 |
| 크로스 플랫폼 E2E 테스트 | 4h/스프린트 | 80% | 하 |
| 보고서 자동 생성·배포 | 2h/주 | 95% | 하 |
| ERP/CRM 반복 입력 작업 | 3h/일 | 85% | 중 |
| 소프트웨어 설치·설정 자동화 | 1h/이슈 | 75% | 중 |
전체 코드베이스를 한 번에 참조하는 작업
긴 컨텍스트는 파일 하나의 수정이 아니라 프로젝트 전체로 영향이 퍼지는 작업에서 가치가 크다. 모든 SQL 쿼리를 따라가며 인젝션 취약점을 찾거나, 인터페이스 변경의 영향을 받는 구현체를 일괄 수정할 수 있다. 전체 소스를 토대로 클래스 다이어그램과 의존성 그래프를 만들고, 중복 코드·사용되지 않는 함수·순환 의존성을 프로젝트 단위로 스캔하는 용도로도 쓸 수 있다.
Codex CLI에서 실험적 1M 컨텍스트 모드를 사용하는 예시는 다음과 같다.
# 실험적 1M 컨텍스트 모드 (API 직접 호출)
codex --model gpt-5.4 \
--context-limit 1000000 \
--project-root ./src \
"전체 코드베이스에서 메모리 누수 패턴 찾아 수정 제안해줘"
Standard 기준으로 입력 1M 토큰은 $2.50을 소비한다. 다만 compaction 경계를 고려하면 실제 효과적인 컨텍스트는 약 258K 수준이다. 컨텍스트가 커질수록 응답 지연도 증가하므로 대규모 작업에는 비동기 Codex Cloud를 함께 검토해야 한다.
컨텍스트 비용은 작업 크기에 맞춰 나눈다
컨텍스트 길이가 늘면 더 넓은 범위를 참조할 수 있지만 비용과 지연도 함께 커진다.
단순한 파일 수정은 GPT-5.4 mini로 보내고, 전체 코드베이스 분석만 1M 풀 컨텍스트로 라우팅하는 방식이 비용을 통제하기 쉽다. 시스템 프롬프트와 공통 코드 prefix는 Prefix caching으로 재사용해 반복 호출의 입력 비용을 50% 줄일 수 있다. 실시간 응답이 필요 없는 작업은 50% 할인이 적용되는 Batch API로 넘기고, 각 에이전트 태스크에는 최대 토큰 예산을 미리 지정해 비용 폭증을 막는다.
장기 작업은 비동기 실행과 복구 설계가 필요하다
Codex Cloud는 로컬 CLI 세션과 분리된 환경에서 태스크를 비동기로 실행한다. 사용자가 오프라인이어도 수 시간에서 수십 시간까지 작업을 이어가며, 우선순위와 의존성에 따라 병렬 서브에이전트를 조율한다.
오래 실행되는 작업은 중간 결과를 Git 커밋이나 파일로 주기적으로 저장해야 한다. 거대한 목표는 독립적으로 검증할 수 있는 서브태스크로 나누고, 각 단계에서 유닛 테스트 실행·결과 평가·수정을 반복한다. 중요한 의사결정 지점에는 human_approval_required 플래그를 둬 사람이 개입할 수 있게 한다.
Codex Cloud 메인 에이전트
├── 서브에이전트 A: 테스트 스위트 실행 (독립 샌드박스)
├── 서브에이전트 B: 문서 diff 기반 업데이트 (독립 샌드박스)
└── 서브에이전트 C: 코드 리팩터링 제안 (독립 샌드박스)
→ 메인 에이전트가 결과 병합·충돌 해결
경쟁 도구와 비교할 때 볼 지점
2026년 3월 기준 GPT-5.4, Claude Code Auto, Google Antigravity 2.0의 차이는 컴퓨터 사용 방식과 컨텍스트 범위, 가격, 실행 환경에서 드러난다.
| 항목 | GPT-5.4 | Claude Code Auto | Google Antigravity 2.0 |
|---|---|---|---|
| 컴퓨터 사용 방식 | 네이티브 내장 | tool-call 기반 | 네이티브 내장 |
| OSWorld 점수 | 75.0% | ~68% (추정) | ~71% (추정) |
| 최대 컨텍스트 (API) | 1M 토큰 | 1M 토큰 | 2M 토큰 |
| 코딩 전용 컨텍스트 | 258K~400K | 200K | 500K |
| API 입력 가격 | $2.50/1M | $15.00/1M | $미공개 |
| IDE 통합 | Codex CLI + VS Code | Claude Code CLI | Cursor 파트너십 |
| 비동기 클라우드 실행 | Codex Cloud | Claude Code (제한적) | Antigravity Cloud |
| 토큰 효율 | GPT-5.2 대비 대폭 개선 | 양호 | 양호 |
GPT-5.4는 코딩·컴퓨터 조작·추론을 단일 모델로 처리해 오케스트레이션 복잡도를 낮춘다. API 입력 가격은 $2.50/1M으로 Claude Opus 4.6의 $15보다 6배 저렴하며, OSWorld에서는 인간 전문가를 넘어 GUI 자동화 신뢰도에서 우위를 보였다.
Claude Code Auto는 Shopify Liquid와 보안 민감 코드 같은 대규모 코드베이스 리팩터링에서 정확도 우위를 보이며, 터미널 중심 워크플로우가 정교하다. Sonnet 4.6과 GPT-5.4의 벤치마크 차이는 1.3점 이내여서 사실상 동급으로 평가된다.
약 50K 토큰 규모의 소규모 프로젝트에서는 GPT-5.4 Standard와 Claude Sonnet 4.6을 동등하게 선택할 수 있다. 약 200K 규모의 중형 코드베이스에서는 GPT-5.4 Codex Cloud가 비용 효율에서 앞선다. 200K~1M 규모의 대형 모노레포라면 GPT-5.4 API의 실험적 1M 컨텍스트나 Antigravity 2.0을 검토할 수 있다. GUI 자동화가 포함된 복합 작업에서는 GPT-5.4의 네이티브 computer-use가 우선 선택지다.
기존 아키텍처 원칙으로 해석하기
GPT-5.4의 에이전트 구조는 새로운 기능의 묶음이면서 기존 소프트웨어 아키텍처 개념의 연장선이기도 하다.
| 기술사 토픽 | GPT-5.4 적용 포인트 |
|---|---|
| 소프트웨어 아키텍처 패턴 | 에이전트 루프(Sense→Plan→Act) = Reactive Agent 패턴 |
| 분산 시스템 | Codex Cloud 비동기 병렬 에이전트 = 분산 태스크 오케스트레이션 |
| 성능 최적화 | KV 캐시·Prefix caching = 메모이제이션 전략 |
| 보안 설계 | 샌드박스 격리·human gate = 최소 권한 원칙 |
| UI/UX 자동화 | OSWorld 기반 GUI 에이전트 = RPA(Robotic Process Automation) 진화 |
| 인공지능 | 멀티모달 에이전트 = 지식 표현·추론 시스템 |
컴퓨터 사용 모듈과 코드 에이전트, 도구 검색은 관심사 분리 원칙에 따라 독립 컴포넌트로 볼 수 있다. Tool Search는 기존 에이전트를 바꾸지 않고 새 도구를 추가하는 개방-폐쇄 원칙과 연결된다. Codex Cloud의 비동기 태스크는 이벤트 소싱 패턴이 적용된 이벤트 기반 아키텍처로 해석할 수 있다.
확장 전망과 국내 운영 조건
2026년 하반기에는 GPT-5.5 기반 Codex가 1M 컨텍스트를 Codex Cloud까지 공식 확장해 현재의 400K 제한을 해소할 예정이다. 단일 태스크를 수십 개의 서브에이전트가 동시에 처리하는 병렬 아키텍처도 고도화되고, Financial plugins인 Excel과 Google Sheets를 비롯한 수직 도메인 도구 생태계가 계속 확장될 전망이다.
2027년에는 Codex Cloud의 온프레미스 배포 옵션이 엔터프라이즈 데이터 보안 요구를 지원할 것으로 예상된다. 컴퓨터 사용 정확도는 OSWorld 90% 이상을 목표로 하며, 모델 크기 최적화와 전용 하드웨어를 통해 현재보다 50% 이상 비용을 줄일 전망이다.
국내에서 컴퓨터 사용 에이전트를 도입하려면 화면 캡처와 전송 데이터가 개인정보보호법에 부합하는지 검토해야 한다. 금융·의료 업무에서는 자율 에이전트의 처리 범위를 규제 샌드박스 안으로 제한하고, Codex Cloud의 데이터 레지던시 정책도 확인해야 한다. 현재 리전은 미국이다.
GPT-5.4가 제시하는 범용 에이전트는 코드 완성에 그치지 않고 GUI 조작, 대형 코드베이스 분석, 장기 비동기 태스크를 하나의 실행 구조로 연결한다. 엔터프라이즈 환경에서는 컨텍스트 계층 라우팅으로 비용을 통제하고, 샌드박스 격리와 최소 권한, 인간 승인 지점을 운영 설계에 포함해야 한다.
Sources
- Introducing GPT-5.4 | OpenAI
- GPT-5.4 (March 2026): 75% Computer Use, 1M Context, $2.50/MTok | NxCode
- GPT 5.4 Complete Guide 2026: Features, Pricing, Benchmarks & How to Use | NxCode
- OpenAI launches GPT-5.4 with native computer use mode | VentureBeat
- The OpenAI Codex 1M Context Window: 1M Is Really 258K | youcanbuildthings.com
- Changelog – Codex | OpenAI Developers
- Run long horizon tasks with Codex | OpenAI Developers
- Claude Sonnet 4.6 vs GPT-5.4: Which AI Model for Coding? (2026) | NxCode
- GPT-5.4 vs Claude Opus 4.6: In-depth comparison | Apiyi.com Blog
- Codex CLI Model Routing in May 2026 | Codex Knowledge Base