GPT-5.4, 코딩·추론·컴퓨터 사용을 한 몸에 담다

OpenAI GPT-5.4의 Unified Model Architecture, 추론 노력 제어, 할루시네이션 33% 감소 기법, SWE-bench Pro·GDPval 벤치마크와 가격 구조를 정리한다.

2026-08-14 · 최초 발행 2026-04-17

2026년 3월 5일, OpenAI는 GPT-5.4를 공식 출시하며 AI 모델 개발의 새로운 전환점을 제시했다. 기존에 분리 운영되던 코딩 전문 모델(GPT-5.3-Codex)과 추론 모델을 단일 아키텍처로 통합하고, 할루시네이션 발생률을 GPT-5.2 대비 33% 줄인 이 모델은 지식 업무 자동화 벤치마크 GDPval에서 83%를 달성하며 범용 AI 에이전트 시대의 본격적인 시작을 알렸다.

따로 놀던 모델들이 만든 불편

OpenAI는 GPT 계열을 발전시키며 코드 생성·디버깅에 특화된 GPT-5.3-Codex, 수학·논리 추론에 특화된 o-시리즈(o3, o4), 일반 언어 작업용 범용 모델인 GPT-5.x Flagship을 용도별로 병렬 운영해왔다. 이 분산 구조는 작업 유형에 따라 수동으로 모델을 전환해야 하는 불편, 코딩 맥락과 추론 맥락이 단절돼 복합 작업 처리가 어려운 문제, 모델마다 다른 토큰 요금으로 인한 비용 예측 복잡성, API 통합 시 다중 엔드포인트를 관리해야 하는 부담을 낳았다. GPT-5.4는 이런 모델 분화의 한계를 해소하려 설계된 Unified Model Architecture를 채택했다.

코딩·추론·컴퓨터 사용을 한 가중치에 담은 방식

GPT-5.4의 통합 아키텍처는 세 기술 영역을 단일 모델 가중치 안에 융합한다.

GPT-5.4 Unified Model코딩 엔진(GPT-5.3-Codex 역량 흡수)추론 엔진(Chain-of-Thought 내장)컴퓨터 사용(Computer Use API)SWE-bench Pro57.7% 달성GDPval 지식 업무83% 달성OSWorld75% 달성 (인간 전문가 72.4%초과)

개발자는 API 호출 시 reasoning_effort 파라미터로 연산 비용과 품질을 직접 제어할 수 있다. 이는 GPT-5.4가 추론을 별도 모델로 분리하지 않고 내장(built-in) 추론 엔진으로 구현했다는 뜻이다.

추론 강도를 다이얼처럼 조절하기

GPT-5.4는 추론 깊이를 5단계로 조절할 수 있다.

단계 레벨 적합한 작업 유형 상대적 비용
(1) none 추론 없음 단순 분류·번역 최저
(2) low 낮은 추론 FAQ 응답·요약 낮음
(3) medium 중간 추론 일반 코딩·분석 중간
(4) high 높은 추론 복잡한 디버깅·설계 높음
(5) xhigh 최고 추론 수학 증명·심층 연구 최고

1M 토큰 컨텍스트가 여는 것

입력 922,000 토큰, 출력 128,000 토큰을 지원해(비교 벤치마크 표 기준 합산 컨텍스트 윈도우 1,050K) 전체 코드베이스를 단일 요청으로 분석하거나, 대용량 문서 컬렉션의 전체 맥락을 유지한 채 작업할 수 있다.

허위 클레임을 33% 줄인 방법

OpenAI가 공개한 할루시네이션 관련 수치는 클레임 수준과 응답 수준 두 지표로 나뉜다.

할루시네이션 감소 지표개별 클레임 단위(Claim-Level)응답 전체 단위(Response-Level)GPT-5.2 대비33% 허위 클레임 감소GPT-5.2 대비18% 오류 포함 응답 감소Vectara 리더보드nano 변형: 3.1%할루시네이션율

GPT-5.4의 개별 사실 주장이 허위일 확률은 GPT-5.2 대비 33% 낮고, 전체 응답이 하나 이상의 오류를 포함할 확률은 18% 낮다. 2026년 3월 20일 기준 Vectara 할루시네이션 리더보드에서 GPT-5.4-nano 변형이 3.1% 할루시네이션율, 96.9% 사실 일관성을 달성했다. 이런 감소는 응답 생성 전 사실 주장의 근거를 내부적으로 검토하는 검증 우선 추론 체계, 시스템 프롬프트 지침을 더 일관되게 따르고 JSON·XML 같은 구조화 출력 포맷의 오류율을 낮춘 구조화 출력 형식 준수율 개선, 1M 토큰 컨텍스트를 활용한 RAG 패턴에서 특히 효과적인 컨텍스트 기반 사실 접지(Grounding)라는 세 기법이 뒷받침한다.

코덱스 없이도 나오는 코딩 실력

SWE-bench Pro는 실제 GitHub 이슈를 기반으로 소프트웨어 엔지니어링 능력을 평가하는 벤치마크다.

성공 (57.7%)실패 (42.3%)SWE-bench Pro 평가 흐름GitHub 실제 이슈 입력GPT-5.4 코드 분석패치 생성성공 여부?자동 패치 적용테스트 통과부분 해결 또는미해결 반환실무 개발자 수준자동 버그 수정 가능

별도의 Codex 모델 없이도 동일 수준의 코드 생성 품질을 내고, 코드 분석·추론·수정을 단일 요청에서 처리한다. 필요할 때만 도구 정의를 로드하는 지연 로딩 방식의 도구 검색(Tool Search)으로 토큰 사용량을 47% 절감했다. GPT-5.4는 최초의 범용 모델로서 네이티브 컴퓨터 사용 기능도 내장해, 화면 인식·커서 조작·데스크톱 애플리케이션 클릭타이핑 자동화·복잡한 워크플로우의 크로스앱 실행이 가능하다. OSWorld에서 75%를 달성해 인간 전문가 기준(72.4%)을 넘어섰는데, 이는 단순 코드 생성을 넘어 코드 실행 환경을 직접 조작하는 에이전트 능력을 의미한다.

GDPval, 지식노동의 값어치를 재는 법

GDPval(Knowledge Work GDP Valuation)은 AI 모델이 지식 집약적 업무에서 창출하는 경제적 가치를 정량화하는 벤치마크다. 프로그래밍·문서 작성·데이터 분석·법률 검토·의료 기록 처리 등을 전문가 수준 인간 수행 결과와 비교해 백분율로 점수를 매기며, GPT-5.4는 83%를 달성했다.

GDPval 83% 달성코딩 작업(전문가 수준 패치 생성)문서 분석(1M 컨텍스트 활용)데이터 처리(구조화 출력 정확도)복합 추론(xhigh 레벨 활성화)실무 적용 가능자동화 영역 확장

전체 지식 업무의 83%를 전문가 수준으로 자동 처리할 수 있고, 이는 모델 전환 없이 단일 모델로 달성한 수치다. 나머지 17%는 인간-AI 협업이나 고도 전문성이 요구되는 영역으로 남는다.

채널별 출시와 가격, 그리고 변형 모델

GPT-5.4는 2026년 3월 5일 ChatGPT("GPT-5.4 Thinking" 이름), OpenAI API(gpt-5.4 모델 ID), Codex(코드 특화 인터페이스) 세 채널에 동시 출시됐다. 입력 토큰은 $2.50/1M(GPT-5.2 대비 약 20% 저렴)이고 출력 토큰은 입력 대비 4배 요금이며, reasoning_effort 수준에 따라 실질 비용을 조정할 수 있다.

모델명 특징 주요 용도
gpt-5.4 기본 플래그십 범용 API 통합
gpt-5.4-thinking 확장 추론 활성화 복잡한 분석·연구
gpt-5.4-nano 경량·저비용 배치 처리·실시간 서비스
gpt-5.4-pro 최고 성능 엔터프라이즈 고급 워크플로우

기존 모델과 나란히 놓은 벤치마크

벤치마크 GPT-5.2 GPT-5.3-Codex GPT-5.4
SWE-bench Pro ~45% ~55% 57.7%
OSWorld ~60% N/A 75%
GDPval ~70% ~65% 83%
할루시네이션율 기준 N/A -33%
컨텍스트 윈도우 256K 256K 1,050K

모델 통합은 코딩 맥락에서 바로 고급 추론으로 전환하는 데 모델 전환이 필요 없어졌다는 점, 코드 리뷰·아키텍처 설계·보안 분석을 단일 세션에서 처리할 수 있다는 점, 에이전트 파이프라인이 단일 엔드포인트로 단순해졌다는 점에서 실용적 이점을 낸다.

GPT-5.4가 가진 한계도 명확하다. 33% 감소에도 불구하고 할루시네이션이 특정 시나리오에서는 여전히 발생하고, 학습 데이터 이후의 실시간 정보에는 접근할 수 없으며(Tool Search로 부분 보완), xhigh 추론 레벨을 쓰면 비용이 늘어 배치 처리 워크로드에는 제약이 있다. 자율 화면 조작 기능은 오남용 위험이 있어 엔터프라이즈 정책 검토가 필요하고, 오픈소스 대비 아키텍처 세부사항이 공개되지 않아 독립 검증도 어렵다.

Sources

GPT5.4UnifiedModelArchitecture할루시네이션감소SWEbenchProGDPval