GPT-5.4, 데스크톱 조작과 105만 토큰 컨텍스트를 하나로 묶다
2026년 3월 5일 공개된 GPT-5.4의 네이티브 컴퓨터 사용, 1M 토큰 컨텍스트, Tool Search 기능과 OSWorld·GDPval 벤치마크, 경쟁 모델 비교, 가격 정책을 정리한다.
2026-08-14 · 최초 발행 2026-03-13
2026년 3월 5일, OpenAI는 GPT-5.4를 공개했다. 이전까지 나뉘어 있던 추론 특화 라인(GPT-5)과 코딩 특화 라인(GPT-5.3-Codex)을 하나로 묶은 첫 범용 프런티어 모델이자, 네이티브 컴퓨터 사용(Native Computer Use)과 최대 105만 토큰 컨텍스트를 함께 탑재한 최초의 모델이다.
여러 모델을 하나로 묶은 이유
OpenAI는 GPT-5 계열 모델을 출시한 이후 전문 용도별로 여러 변형 모델을 운영해왔다. 코딩에는 GPT-5.3-Codex, 빠른 응답에는 GPT-5.3-Instant 등이 쓰였지만, 이는 개발자가 용도에 따라 모델을 선택해야 하는 복잡성을 낳았다. GPT-5.4는 이런 분절된 모델 생태계를 하나로 묶는 통합 모델(Unified Model)로 설계됐다.
GPT-5.4는 ChatGPT, OpenAI API, Codex 세 플랫폼에 동시 배포된 최초의 사례이며, OpenAI는 이를 "전문 업무를 위한 가장 유능하고 효율적인 프런티어 모델"이라고 소개했다.
코드로 조작할 것인가, 화면을 직접 조작할 것인가
GPT-5.4의 가장 주목할 만한 특징은 별도의 도구 없이 모델 자체에 내장된 컴퓨터 사용 능력이다. API와 Codex를 통해 제공되며 두 가지 상호작용 모드를 지원한다.
Code Mode는 Playwright 등 자동화 라이브러리를 활용한 Python 코드를 생성해 UI 조작을 수행한다. Screenshot Mode는 화면을 직접 보면서 마우스와 키보드 명령을 원시 신호(raw signal) 수준에서 실행하는 방식으로, 코드 중간 단계 없이 더 직접적인 제어가 가능하다.
이 능력으로 애플리케이션 간 폼 자동 작성, 스프레드시트와 프레젠테이션 간 데이터 이동, 여러 소프트웨어 시스템에 걸친 작업 체이닝, 브라우저 자동화 워크플로우 실행, 에디터에서의 코드 수정 직접 적용이 가능해졌다.
데스크톱 컴퓨터 사용 능력을 측정하는 OSWorld-Verified 벤치마크에서 GPT-5.4는 75.0%를 기록해 인간 기준선(72.4%)을 넘어섰다. 범용 AI 모델이 데스크톱 내비게이션에서 인간 수준을 넘어선 첫 사례다.
| 모델 | OSWorld-Verified 점수 |
|---|---|
| GPT-5.4 | 75.0% |
| 인간 기준 | 72.4% |
| Claude Opus 4.6 | 72.7% |
105만 토큰이 여는 것
GPT-5.4는 최대 105만 토큰(1.05M tokens)의 컨텍스트를 지원하는, OpenAI 역사상 최대 규모의 컨텍스트 창을 탑재했다. 전작인 GPT-5.3의 40만 토큰 대비 2.6배 이상 확장된 규모다.
표준 컨텍스트는 272K 토큰까지 일반 요금이 적용되고, 이를 초과하면 2배 요금이 붙는다. ChatGPT 인터페이스에서는 전체 1M 창이 노출되지 않으며, API·Codex 전용 기능이다.
GPT-5.4는 장기 에이전트 작업을 위한 컨텍스트 압축(Compaction) 메커니즘을 처음으로 지원한다. 긴 에이전트 궤적(agent trajectory)을 요약·정리하면서 작업 계속에 필요한 핵심 컨텍스트를 보존하는 기술로, 수백 단계에 걸친 멀티스텝 워크플로우를 효율적으로 처리할 수 있다.
통합 아키텍처와 Tool Search
GPT-5.4는 GPT-5 계열의 추론·전문 업무 능력과 GPT-5.3-Codex의 엘리트 코딩 능력, 두 모델 라인을 통합했다. 이 통합으로 단일 세션에서 코드 작성→화면 조작→슬라이드 제작→계약서 분석을 연속으로 수행할 수 있게 됐다.
새로 도입된 Tool Search API 기능은 모든 도구 스키마를 사전에 로드하는 대신, 경량 도구 목록을 받은 뒤 필요할 때 전체 정의를 조회하는 방식이다. 36개 MCP 서버가 활성화된 환경에서 250개 MCP Atlas 작업을 수행할 때, 동일한 정확도를 유지하면서 총 토큰 사용량을 47% 절감했다.
ChatGPT에서 제공되는 GPT-5.4 Thinking 변형은 실행 전 계획을 먼저 보여주는 업프런트 씽킹 플랜(Upfront Thinking Plan) 방식을 쓴다. 사용자가 응답 생성 중간에 방향을 조정할 수 있어 반복적인 수정 작업을 줄여준다.
벤치마크가 말하는 것
전문 지식 업무를 측정하는 GDPval(44개 직종 대상)에서 GPT-5.4는 83.0%를 기록하며 전작 GPT-5.2(70.9%) 대비 12.1%p 향상을 보였다.
| 벤치마크 | GPT-5.4 | GPT-5.2 |
|---|---|---|
| OSWorld-Verified (데스크톱 사용) | 75.0% | - |
| GDPval (전문 지식 업무) | 83.0% | 70.9% |
| SWE-bench Verified (코딩) | ~80% | - |
| Terminal-Bench 2.0 | 75.1% | - |
품질도 함께 개선됐다. 개별 사실 오류는 33% 감소했고, 전체 응답 오류는 18% 감소했다. 컴퓨터 사용 작업 완료 속도는 3배 향상됐고, 스프레드시트 모델링 점수는 68.4%에서 87.3%로 올랐다.
재무 분석부터 대형 코드베이스까지
전문 업무 자동화 영역에서 GPT-5.4는 기업 재무 분석, 회계 및 데이터 분석, 법률 문서 검토, 시장 분석, 프레젠테이션 제작 등 44개 직종에 걸친 업무에서 높은 성과를 보인다. Microsoft Excel(Google Sheets 예정) 직접 통합을 통해 스프레드시트 안에서 세밀한 분석과 자동화된 작업 완수가 가능하다.
코딩 및 소프트웨어 개발에서는 Codex의 기본 모델로 탑재되어 GitHub Copilot에도 단계적으로 도입된다. 최대 1.05M 토큰 컨텍스트로 대형 코드베이스 전체를 분석하고, 에디터에서 코드 수정을 제안이 아닌 직접 적용 방식으로 처리한다.
장기 에이전트 워크플로우에서는 계획 수립부터 실행, 검증, 압축까지 하나의 루프로 돈다.
경쟁 모델과 나란히 놓으면
GPT-5.4는 컴퓨터 사용 및 전문 업무에서 경쟁 모델을 앞서지만, 영역별로 차이가 있다. Claude Opus 4.6과 비교하면 OSWorld(75.0% vs 72.7%)와 GDPval에서 우위다. Gemini 3.1 Pro는 2M 토큰 컨텍스트와 GPQA Diamond(94.3%) 과학 추론에서 강점을 보이는 반면, GPT-5.4는 전문 업무·컴퓨터 사용에서 우위다. GPT-5.3-Codex와 비교하면 터미널 집중 작업(77.3% vs 75.1%)과 처리 속도에서는 Codex가 여전히 앞서지만, 범용성은 GPT-5.4가 압도한다.
가격은 어떻게 매겨지나
| 티어 | 입력 (1M 토큰당) | 출력 (1M 토큰당) |
|---|---|---|
| GPT-5.4 (표준) | $2.50 | $15.00 |
| GPT-5.4 Pro | $30.00 | $180.00 |
| 확장 컨텍스트 (272K 초과) | 2배 요금 | 2배 요금 |
GPT-5.2 대비 입력 토큰 단가는 높아졌지만($1.75 → $2.50), Tool Search로 복잡한 작업에서 토큰 사용량을 최대 47% 절감할 수 있어 실질 비용은 유사하거나 낮을 수 있다.
GPT-5.4는 추론, 코딩, 컴퓨터 사용을 하나로 통합한 OpenAI의 첫 범용 에이전트 모델이다. OSWorld 벤치마크에서 인간 수준을 넘어선 컴퓨터 사용 능력과 1.05M 토큰의 컨텍스트 창은 장기 자율 에이전트 워크플로우의 현실화를 앞당겼고, Tool Search를 통한 토큰 효율화와 컨텍스트 압축 기술은 실제 비용 부담도 완화한다.
Sources
- Introducing GPT-5.4 - OpenAI
- GPT-5.4: Computer Use, Tool Search, Benchmarks, Pricing - Digital Applied
- GPT-5.4: Native Computer Use, 1M Context, Tool Search - DataCamp
- OpenAI launches GPT-5.4 - VentureBeat
- GPT-5.4 vs GPT-5.3-Codex comparison - NxCode
- GPT-5.4 Intelligence & Performance Analysis - Artificial Analysis
- GPT-5.4 Benchmarks - Office Chai
- GPT-5.4 Computer Use - Awesome Agents
- GPT-5.4 vs GPT-5.3 vs Gemini 3.1 - YingTu
- 1M Token Context Window - Trending Topics EU