GPT-5.5가 바꾼 에이전틱 코딩과 Computer Use 워크플로우
GPT-5.5의 장문 컨텍스트 처리 구조와 Computer Use 실행 루프, 주요 모델의 에이전틱 코딩 성능과 API 비용을 비교한다.
2026-08-14 · 최초 발행 2026-05-06
긴 코드베이스를 한 컨텍스트에서 다루는 방법
OpenAI는 2026년 4월 23일 GPT-5.5를 공개했다. Codex 통합과 Computer Use 에이전트, Codex 기준 최대 400K 토큰의 컨텍스트 윈도우가 이 모델의 중심이다. Terminal-Bench 2.0 점수는 82.7%로, Claude Opus 4.7의 69.4%와 Gemini 3.1 Pro의 68.5%를 앞섰다.
GPT-5.5는 Codex 환경에서 400K 토큰, API에서는 1M 토큰 컨텍스트를 지원한다. 이처럼 긴 입력을 처리하려면 어텐션 연산과 KV 캐시가 차지하는 메모리를 함께 줄여야 한다. 트랜스포머의 어텐션 연산은 시퀀스 길이의 제곱에 비례해 메모리를 소비하므로, 400K 토큰을 나이브하게 처리하면 수십 TB의 GPU 메모리가 필요하다.
2026년 프로덕션 추론에서 중요한 비용 절감 수단은 KV 캐시 최적화다. Paged Attention과 Prefix Caching, Multi-Query Attention(MQA), Grouped-Query Attention(GQA), DeepSeek의 MLA(Multi-head Latent Attention) 같은 기법이 함께 사용된다. 2026년 엔지니어링 리포트들은 이 조합으로 장문 컨텍스트 추론 비용을 4~40배 줄일 수 있다고 설명한다.
Sparse Attention은 전체 토큰에 같은 비중으로 접근하지 않고 필요한 부분을 선별한다. RocketKV는 먼저 코스-그레인(coarse-grain) 영구 KV 캐시를 제거하고, 이어 하이브리드 Sparse Attention으로 파인-그레인(fine-grain) top-k 희소 어텐션을 적용한다. 이 방식은 최대 400× 압축비와 3.7× 종단간 속도 향상을 달성한다.
2026년 5월 Evermind·Shanda Group·Peking University 공동 연구팀이 발표한 Memory Sparse Attention(MSA)은 최대 1억 토큰까지 컨텍스트를 확장할 가능성을 시연했다. 문서를 세그먼트로 나눠 어텐션 값을 계산한 다음, 압축된 "Routing Key"와 표준 KV 행렬에 저장하는 구조다. 추론 단계에서는 라우팅 키를 인덱스 카드처럼 사용해 관련 문서 청크만 동적으로 불러온다.
또 다른 흐름은 잠재 공간과 추론 과정 자체를 압축하는 것이다. Attention Matching은 50× 압축, TriAttention은 10.7× 메모리 절감을 제시한다. OpenAI는 GPT-5.5가 이러한 기술을 내재화해 같은 Codex 작업에서도 이전 세대 모델보다 적은 토큰으로 더 높은 품질의 출력을 생성한다고 밝혔다.
화면을 읽고 다음 행동을 결정하는 Computer Use
GPT-5.5는 OSWorld-Verified에서 78.7%를 기록해 Claude Opus 4.7의 78.0%를 소폭 앞섰다. 이 기능은 화면 인식, UI 요소 탐지와 그라운딩, 액션 실행 루프가 이어지는 구조로 볼 수 있다.
먼저 에이전트가 현재 화면을 이해해야 한다. GPT-5.5는 스크린샷을 직접 입력받아 멀티모달 비전 인코더로 처리한다. 이 인코더는 픽셀 수준의 특징에 머무르지 않고 버튼, 입력 필드, 메뉴, 텍스트 레이블 같은 UI의 구조적 의미를 파악하도록 학습됐다. Accessibility Tree와 DOM을 함께 사용할 수 있는 환경에서는 해당 정보를 추가 컨텍스트로 활용해 비주얼 파싱의 불확실성을 줄인다.
화면을 읽은 뒤에는 지시가 가리키는 요소의 위치를 찾아야 한다. 예를 들어 "Submit 버튼을 클릭하라"는 요청을 실행하려면 화면 안에서 해당 버튼의 좌표를 특정해야 한다. UI 그라운딩이라 부르는 이 과정에서 GPT-5.5는 SoM(Set-of-Marks)과 유사하게 번호 마커를 오버레이한 이미지를 내부적으로 생성하거나, 요소의 텍스트 속성과 공간적 위치를 결합해 클릭 좌표를 추론한다. OSWorld 같은 벤치마크의 성능 차이는 대부분 이 그라운딩 정확도에서 갈린다.
Computer Use의 실질적인 가치는 한 번의 클릭이 아니라 멀티스텝 태스크를 끝내는 데 있다. 에이전트는 다음 과정을 반복한다.
- 스크린샷을 캡처해 현재 화면 상태를 관찰한다.
- 목표와 현재 상태 사이의 차이를 내부적으로 추론한다.
- 클릭, 타이핑, 스크롤, 단축키, 파일 조작 중 필요한 액션을 고른다.
- 액션을 실행한 뒤 결과를 확인한다.
- 오류가 발생하면 복구 방법을 세우고 다시 시도한다.
GPT-5.5는 이전 모델보다 같은 태스크를 더 적은 스텝으로 처리하도록 효율이 개선됐다. 토큰 소비량과 재시도 횟수도 줄었으며, 이 변화는 코딩 작업의 비용 절감으로 이어진다.
벤치마크만으로 모델을 고를 수 없는 이유
에이전틱 코딩 시스템에서는 자율 작업 성능과 API 비용을 분리해 보기 어렵다. 2026년 4월 기준 주요 모델의 벤치마크 결과는 다음과 같다.
| 벤치마크 | GPT-5.5 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|
| Terminal-Bench 2.0 (복잡 CLI 작업) | 82.7% | 69.4% | 68.5% |
| OSWorld-Verified (컴퓨터 조작) | 78.7% | 78.0% | 미발표 |
| GDPval (지식 업무 44개 직종) | 84.9% | 미발표 | 미발표 |
| SWE-bench Pro (실제 PR 해결) | 경쟁적 | 우위 | 경쟁적 |
Terminal-Bench 2.0은 계획과 반복, 도구 조율이 필요한 복잡한 커맨드라인 워크플로우를 평가한다. GPT-5.5는 이 벤치마크에서 Claude Opus 4.7보다 13포인트 이상의 격차를 보였다.
반면 실제 Pull Request 해결 능력을 평가하는 SWE-bench Pro에는 Claude Opus 4.7이 여전히 강세를 보이는 영역이 있다. GPT-5.5가 자율적이고 반복적인 태스크 완수에 강하다면, Claude는 코드 이해와 PR 리뷰에서 경쟁력을 보인다는 차이다.
가격도 선택에 직접 영향을 준다.
| 모델 | 입력 ($/1M 토큰) | 출력 ($/1M 토큰) |
|---|---|---|
| GPT-5.5 Standard | $5.00 | $30.00 |
| GPT-5.5 Pro | $30.00 | $180.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Gemini 3.1 Pro | $2.00 | $12.00 |
OpenAI는 GPT-5.5 출시와 함께 토큰당 가격을 이전 버전의 두 배로 올렸다. 입력 가격은 $2.50에서 $5.00으로, 출력 가격은 $15.00에서 $30.00으로 변경됐다. 월 1천만 출력 토큰을 사용하면 GPT-5.5 Standard는 $300, Claude Opus 4.7은 $250으로 약 20%의 비용 차이가 난다. OpenAI는 토큰 효율성 개선까지 고려한 실질 비용 상승 폭을 약 20% 수준으로 설명한다.
워크로드에 따라 선택지는 달라진다. 단순 자동화와 CLI 작업, 컴퓨터 조작에는 GPT-5.5 Standard가 적합하다. 법률 검토나 재무 모델링처럼 고부가가치 단일 태스크에는 GPT-5.5 Pro를 고려할 수 있다. 대량 처리에서 비용 민감도가 높다면 Gemini 3.1 Pro가 선택지가 되고, 복잡한 코드베이스 이해와 PR 해결이 중심이라면 Claude Opus 4.7도 여전히 경쟁력이 있다.
GPT-5.5가 기록한 Terminal-Bench 2.0 82.7%와 OSWorld-Verified 78.7%는 에이전틱 코딩과 Computer Use에서의 강점을 보여준다. 그 기반에는 400K 토큰 컨텍스트를 처리하는 Sparse Attention, KV 캐시 분산, Latent-Space Compaction이 있다. 대규모 코드베이스를 하나의 컨텍스트에서 다룰 수 있다는 점은 에이전틱 워크플로우에 유리하지만, 이전 세대보다 두 배 오른 API 가격과 SWE-bench Pro에서 Claude Opus 4.7이 보이는 강세까지 함께 판단해야 한다.
Sources
- https://openai.com/index/introducing-gpt-5-5/
- https://llm-stats.com/models/gpt-5.5
- https://www.coderabbit.ai/blog/gpt-5-5-benchmark-results
- https://www.vellum.ai/blog/everything-you-need-to-know-about-gpt-5-5
- https://www.buildfastwithai.com/blogs/gpt-5-5-review-2026
- https://interestingengineering.com/ai-robotics/opanai-gpt-5-5-agentic-coding-gains
- https://blogs.nvidia.com/blog/openai-codex-gpt-5-5-ai-agents/
- https://www.marktechpost.com/2026/04/23/openai-releases-gpt-5-5-a-fully-retrained-agentic-model-that-scores-82-7-on-terminal-bench-2-0-and-84-9-on-gdpval/
- https://bdtechtalks.com/2026/05/04/memory-sparse-attention/
- https://www.marktechpost.com/2026/04/29/top-10-kv-cache-compression-techniques-for-llm-inference-reducing-memory-overhead-across-eviction-quantization-and-low-rank-methods/
- https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
- https://arxiv.org/html/2502.14051v3
- https://apidog.com/blog/gpt-5-5-pricing/
- https://www.tldl.io/resources/llm-api-pricing-2026
- https://jangwook.net/en/blog/en/llm-api-pricing-comparison-2026-gpt5-claude-gemini-deepseek/