Gemini 3.1 Ultra의 200만 토큰 컨텍스트, RingAttention은 어떻게 이걸 가능하게 했나
Google Gemini 3.1 Ultra의 200만 토큰 컨텍스트를 지탱하는 RingAttention·GQA·위치 인코딩 확장 아키텍처와 OSWorld·SWE-Bench 등 에이전틱 벤치마크, Ultra·Pro·Flash 계층 전략을 정리한다.
2026-08-14 · 최초 발행 2026-05-02
Gemini 3.1 Ultra의 주요 특징과 릴리스 맥락
Google이 2026년 4월 공개한 Gemini 3.1 Ultra는 현재 공개된 모델 중 가장 큰 200만 토큰 컨텍스트 창을 제공한다. Gemini 3.1 Pro(2026년 2월 출시)의 뒤를 잇는 최상위 모델로, SWE-bench Verified에서 Pro가 80.6%를 기록한 데 이어 Ultra는 특히 장기 계획과 에이전틱 작업에서 전 세대 대비 45%~80% 이상의 상대적 성능 향상을 달성했다. APEX-Agents, BrowseComp, ARC-AGI-3, GPQA Diamond 등 다양한 추론 벤치마크에서 동급 최고 수준을 기록했다.
Flash-Lite 변형은 Ultra와 같은 날 출시됐다. 낮은 지연 시간과 높은 처리량이 필요한 서비스에 최적화됐으며, 동일한 멀티모달 아키텍처를 유지하면서 추론 비용을 대폭 낮추는 것을 목표로 한다.
200만 토큰 컨텍스트 창은 단순한 수치 이상의 의미를 지닌다. 영문 기준 약 150만 단어, 즉 두꺼운 소설 15권 분량을 단일 호출에서 처리할 수 있다. 전체 코드베이스 분석, 수천 페이지 법률 문서 검토, 장기 대화 기록 전체 참조 등 기존 모델로는 불가능했던 작업을 단일 컨텍스트 안에서 완결할 수 있게 한다.
RingAttention과 메모리 효율 어텐션 아키텍처
200만 토큰 컨텍스트를 처리하는 가장 큰 기술적 장벽은 어텐션 메커니즘의 계산 복잡도다. 표준 셀프 어텐션은 시퀀스 길이의 제곱에 비례하는 메모리를 요구하기 때문에, 200만 토큰에 그대로 적용하면 메모리 요구량이 천문학적으로 증가한다.
Google은 RingAttention을 핵심 해결책으로 채택했다. 시퀀스를 여러 장치에 분산하고 각 장치가 로컬 어텐션을 계산하는 동시에 키-값 블록을 링 형태로 순환시키는 방식이다. 이를 통해 컨텍스트 길이를 장치 수에 비례해 선형 확장할 수 있다.
KV 캐시 최적화도 장문 컨텍스트 처리의 핵심이다. KV 캐시는 이미 처리된 토큰의 키-값 쌍을 저장해 재계산을 방지한다. Gemini 3.1 Ultra는 다중 쿼리 어텐션(MQA) 또는 그룹 쿼리 어텐션(GQA)을 채택해 쿼리 헤드 수는 유지하면서 키-값 헤드 수를 줄여 KV 캐시 메모리를 대폭 감소시켰다.
위치 인코딩 확장도 장문 컨텍스트 지원의 필수 요소다. 표준 RoPE(Rotary Positional Encoding)는 학습 시 사용한 최대 길이 이상의 시퀀스에서 성능이 급격히 저하된다. YaRN(Yet Another RoPE extensioN), LongRoPE 등의 기법은 위치 인코딩의 보간 또는 외삽을 통해 학습 시 보지 못한 긴 시퀀스에서도 안정적인 성능을 유지하게 한다.
에이전틱 AI 성능 평가 체계: OSWorld·SWE-Bench·WebArena
Gemini 3.1 Ultra의 에이전틱 성능을 이해하려면 핵심 벤치마크의 설계 원칙을 파악해야 한다.
OSWorld는 실제 운영체제 환경에서 AI 에이전트가 GUI를 조작해 작업을 완료하는 능력을 평가한다. 웹 브라우저, 파일 탐색기, 스프레드시트 애플리케이션 등 다양한 소프트웨어에서 멀티-스텝 작업을 수행하며, 스크린샷 기반 관찰과 마우스·키보드 액션이 결합된다. 2026년 기준 GPT-5.4가 75.0%로 선두를 기록하고 있으며, Gemini 3.1 Ultra는 전 세대 대비 가장 급격한 향상을 보였다.
SWE-Bench는 실제 GitHub 저장소의 이슈를 해결하는 코딩 능력을 평가한다. Gemini 3.1 Pro가 SWE-Bench Verified에서 80.6%를 기록하며 상위권에 위치했다.
WebArena는 실제 웹 애플리케이션 환경에서 복잡한 탐색·입력·검색 작업을 수행하는 능력을 평가하는 벤치마크다. 단순 QA가 아닌 장기적 목표를 향한 순차적 의사결정 능력을 측정한다.
Ultra·Pro·Flash·Flash-Lite 계층별 성능-비용 최적화 전략
Google의 Gemini 3.1 라인업은 명확한 계층 구조를 형성한다. 각 계층은 서로 다른 성능-비용 최적화 포인트를 목표로 한다.
Ultra는 최고 성능을 추구하는 연구·엔터프라이즈 최상위 사용 사례를 대상으로 한다. 200만 토큰 컨텍스트와 최고 수준의 에이전틱 능력을 제공하지만, 추론 비용이 가장 높다.
Pro는 고성능과 합리적 비용의 균형을 목표로 한다. SWE-Bench Verified 80.6%라는 높은 코딩 성능을 갖추면서도 Ultra 대비 낮은 운영 비용으로 광범위한 비즈니스 사용 사례에 적합하다.
Flash는 지연 시간 최소화와 높은 처리량을 우선시하는 변형이다. 실시간 응답이 필요한 서비스나 대규모 배치 처리에 최적화된다.
Flash-Lite는 가장 경량화된 변형으로 비용 효율성이 최우선이다. 간단한 분류, 요약, 추출 등 단순 NLP 작업에서 최소 비용으로 높은 처리량을 달성한다.
이 계층 구조는 단일 모델의 성능을 극대화하는 것이 아니라 다양한 사용 사례에서 TCO(총소유비용)를 최적화하는 포트폴리오 전략의 산물이다. 기업은 작업 복잡도에 따라 적절한 계층의 모델을 선택하는 라우팅 로직을 구현함으로써 전체 AI 운영 비용을 크게 절감할 수 있다.
장문 컨텍스트가 에이전틱 AI에 미치는 영향
200만 토큰 컨텍스트 창은 에이전틱 AI 설계에 근본적인 변화를 가져온다. 전통적인 에이전트 아키텍처는 제한된 컨텍스트 창을 보완하기 위해 복잡한 메모리 관리 로직이 필요했다. 관련 정보를 선택적으로 컨텍스트에 포함시키거나, 장기 메모리를 외부 데이터베이스에 저장하고 검색하는 RAG 파이프라인을 구축해야 했다.
200만 토큰 컨텍스트에서는 이러한 복잡성의 상당 부분이 단순화된다. 전체 프로젝트 파일, 이전 대화 기록, 참조 문서 등을 단일 컨텍스트에 포함시킬 수 있어 에이전트의 정보 접근 패턴이 근본적으로 달라진다. 이는 멀티-홉 추론과 장기 작업 계획 수립에서 특히 유리하다.
Sources
- Gemini 3.1 Ultra: 2M Context, Multimodal, Beats GPT-5 on Code
- Gemini 3.1 Pro: Announcing our latest Gemini AI model - Google
- Gemini 3 Context Window Size: 1–2M Tokens Explained - Thinkpeak AI
- TAI #193: Gemini 3.1 Pro Takes the Benchmarks Crown
- Google Gemini 3.1 Ultra Released: 2M Token Context - SEO HQ
- Gemini 3.1 Pro - Model Card — Google DeepMind