GPT-5.6 Sol·Terra·Luna의 계층형 모델 아키텍처와 라우팅 전략
GPT-5.6 Sol·Terra·Luna의 계층형 네이밍, 1.5M 토큰 컨텍스트, Ultra 추론과 비용 라우팅 전략을 정리한다.
2026-08-14 · 최초 발행 2026-08-02
2026년 6월 26일 OpenAI는 GPT-5.6 시리즈를 공식 프리뷰했다. 이번 발표의 핵심은 성능 수치만이 아니다. Sol·Terra·Luna라는 이름으로 작업 난도와 비용 구조를 구분하고, 1.5M 토큰 컨텍스트와 에이전틱 코딩용 Ultra 모드를 함께 내세웠다.
세대와 능력 계층을 분리한 모델 이름
기존의 GPT-4o, GPT-4o mini 같은 명명 방식은 모델 크기를 접미사로 표현했다. GPT-5.6은 세대 번호와 능력 계층을 분리한다. 숫자 5.6은 세대를 가리키고, Sol·Terra·Luna는 서로 다른 개발 주기로 진화할 수 있는 내구성 있는 능력 계층(Durable Capability Tier)이다. GPT-5.7 Sol이나 GPT-5.8 Luna처럼 계층별 릴리즈가 가능해지는 구조다.
Sol은 라틴어로 태양을 뜻하는 플래그십 계층이다. 복잡한 멀티스텝 코딩, 사이버 보안 연구, 에이전틱 워크플로우, 정량 생물학 분석처럼 난도가 높은 작업을 대상으로 한다. 입력 가격은 $5/1M 토큰, 출력 가격은 $30/1M 토큰이다.
Terra는 범용 균형 계층이다. GPT-5.5급 성능을 유지하면서 Sol의 절반 수준인 $2.50/$15로 책정되었으며, RAG 파이프라인, 고객 대면 챗봇, 표준 프로덕션 API를 겨냥한다.
Luna는 분류, 인텐트 라우팅, 콘텐츠 모더레이션, 단순 요약처럼 처리량이 중요한 요청을 위한 경량 고속 계층이다. 가격은 $1/$6다.
1.5M 토큰으로 길어진 Sol의 작업 문맥
GPT-5.6 Sol의 기술 사양 가운데 눈에 띄는 항목은 1.5M(150만) 토큰 컨텍스트 윈도우다. GPT-5.5의 컨텍스트 창보다 약 43% 확장된 수치이며, 2026년 6월 기준 프런티어 모델 가운데 최대 규모다. Gemini 3.5 Pro는 최대 2M 토큰을 지원하지만, 기본 모드에서는 1M 컨텍스트를 주로 활용한다.
이 범위에서는 약 1,000만~1,500만 자 분량의 텍스트를 하나의 프롬프트에 담을 수 있다. 수십만 줄 규모 코드베이스를 참조하는 에이전틱 코딩 세션, 긴 시뮬레이션 로그, 연구 논문 수십 편, 대화 이력처럼 긴 문맥을 다룰 수 있으며 멀티턴 에이전트 루프에서도 전체 이력을 유지할 수 있다.
OpenAI는 이번 확장이 KV 캐시(Key-Value Cache) 용량 확대에만 머물지 않는다고 밝혔다. 보상 해킹(Reward Hacking) 수정 파이프라인을 포함해, 에이전트 루프가 길어질 때 발생하던 장기 컨텍스트 정렬(Alignment) 문제를 다루는 설계를 적용했다. 학습 전 단계에서 교차 페르소나 보상 신호 누출(Cross-Persona Reward Signal Leakage)을 감사하는 재설계된 파이프라인도 포함된다.
프롬프트 캐싱(Prompt Caching)에서는 명시적 캐시 브레이크포인트(Cache Breakpoint)를 설정할 수 있고, 최소 30분의 캐시 수명이 보장된다. 초기 캐시 쓰기는 표준 입력 요금의 1.25배지만 이후 캐시 읽기에는 90% 할인이 적용된다. 1.5M 토큰 규모의 시스템 프롬프트를 반복하는 워크플로우라면 이 조건이 비용 구조에 직접 영향을 준다.
Max의 단일 체인과 Ultra의 병렬 작업 분해
Sol에는 Max와 Ultra라는 새 추론 모드가 있다.
Max 모드는 하나의 모델 인스턴스가 더 길고 깊은 사고 과정을 거치는 확장 단일 체인(Single-Chain) 추론 방식이다. 복잡한 수학 문제나 논리 추론처럼 단계적 사고의 깊이가 필요한 요청에 맞는다.
Ultra 모드는 작업을 더 작은 단위로 분해(Decompose)하고, 병렬 서브에이전트(Parallel Sub-Agents)를 스폰(Spawn)한 뒤 각 결과를 통합한다. 하나의 모델이 오래 추론하는 방식과 달리, 여러 에이전트가 동시에 맡은 작업을 처리하는 아키텍처다.
TerminalBench 2.1에서 Ultra 모드는 91.9%를 기록했다. 기본 Sol 모드의 88.8%보다 약 3.1%p 높은 수치이며, 멀티스텝 리서치와 장기 코딩 프로젝트에서 특히 향상이 두드러졌다고 서술된다. Ultra는 OpenAI의 Codex 코딩 도구와 통합되어 복잡한 소프트웨어 엔지니어링 태스크를 분산 처리하는 워크플로우를 네이티브로 지원한다.
Luna에서 시작하는 비용 라우팅
세 계층은 단순한 성능 구분보다 비용 대비 성능(Cost-Performance Ratio) 최적화를 위한 지능형 라우팅 설계를 전제로 한다.
기준선은 Luna다. 가장 저렴한 가용 계층을 먼저 사용하고, 충분히 처리할 수 없다고 판단될 때만 상위 계층으로 에스컬레이션(Escalate)한다. 분류기(Classifier) 출력, 신뢰도 임계값(Confidence Threshold), 실패 후 재시도(Retry) 결과처럼 태스크 난도를 나타내는 신호가 있을 때 Terra 또는 Sol로 프로모션하는 방식이다.
반복되는 시스템 프롬프트나 컨텍스트가 큰 요청에는 프롬프트 캐싱 레이어를 붙여 실효 비용을 낮출 수 있다.
| 계층 | 대표 유스케이스 | 비용(입력/출력 per 1M) |
|---|---|---|
| Sol Ultra | 복잡한 멀티파일 코드 리팩터링, 에이전틱 사이버 보안 분석 | $5 / $30 |
| Sol Max | 수학·논리 추론, 장기 컨텍스트 요약 | $5 / $30 |
| Terra | RAG 파이프라인, 고객 대면 챗봇, 표준 API | $2.50 / $15 |
| Luna | 이메일 분류, 인텐트 라우팅, 자동완성, 단순 추출 | $1 / $6 |
Flexera의 분석에 따르면 AI 워크로드 증가로 클라우드 낭비 비율이 29%까지 상승했다. Sol 예산을 일괄 적용하는 대신 Luna를 기준선으로 두는 라우팅 로직은 비용 절감 최적화 수단으로 제시된다.
생성 과정과 세션 전반을 다루는 안전 스택
GPT-5.6의 안전 아키텍처는 네 레이어로 설명된다.
학습 단계에서는 Sol과 Terra가 금지된 요청을 거부하도록 사전 훈련된다. 생성 중에는 활성화 수준 분류기(Activation-Level Classifier)가 출력을 실시간으로 모니터링하며, 안전 위반이 발생하면 응답을 전달하기 전에 생성을 중단할 수 있다.
특정 대화 컨텍스트에서는 실시간 스캔이 활성화된다. 이는 레이어 2 분류기가 감지하지 못한 출력이라도 안전 경계를 넘는 경우 차단하는 역할을 맡는다. 마지막으로 교차 세션 계정 수준 모니터링은 단일 대화에서는 드러나지 않지만 여러 세션에 걸쳐 나타나는 안전 위반 패턴을 탐지한다.
OpenAI는 이 안전 스택 검증을 위해 A100 GPU 환산 70만 시간 이상을 자동화 레드 티밍(Red Teaming)에 투자했다. 다양한 프롬프트와 컨텍스트에서 작동하는 범용 탈옥(Universal Jailbreak) 공격 탐지에 집중했다.
엔터프라이즈 프라이버시와 안전성 사이의 균형을 위해 프라이버시 보존 감지(Privacy-Preserving Detection), 고객 운영 안전 통제(Customer-Operated Safety Controls), 고객·사용자·워크로드 위험에 따른 접근 수준 조정이라는 장기 접근법도 병행 개발 중이다.
벤치마크와 컨텍스트에서 갈리는 경쟁 구도
2026년 6월 말 프런티어 AI 코딩 시장에서는 OpenAI GPT-5.6 Sol, Anthropic Claude Fable 5, Google Gemini 3.5 Pro가 경쟁하고 있다.
TerminalBench 2.1의 에이전틱 터미널 코딩 순위는 Sol Ultra(91.9%) > Sol(88.8%) > Claude Mythos 5(88.0%) > GPT-5.5(83.4%) > Fable 5로 정리된다. SWE-Bench Pro 소프트웨어 엔지니어링 벤치마크에서는 Claude Fable 5가 80.3%로 선두를 달리고 있다.
장기 컨텍스트 경쟁에서는 Gemini 3.5 Pro가 최대 2M 토큰 컨텍스트와 Deep Think 기능으로 차별화한다. GPT-5.5는 MRCR v2에서 74% 정확도로 장기 컨텍스트 처리 역량을 제시했다.
GPT-5.6 Sol은 에이전틱 코딩 벤치마크와 Ultra의 병렬 처리, Fable 5 대비 절반 가격을 강점으로 둔다. Claude Fable 5는 SWE-Bench Pro 선두와 에이전트 UX, 1M 컨텍스트 일반 공개가 차별점이다. Gemini 3.5 Pro는 최대 2M 컨텍스트, $1.25 입력의 가격, 광범위한 가용성을 앞세운다.
프리뷰 단계에서 준비할 운영 경로
GPT-5.6 Sol은 출시 직후 미국 정부 요청에 따라 제한 공개 상태를 유지하고 있다. 정부 승인을 받은 약 20개 신뢰 파트너 기업만 API와 Codex 도구를 통해 접근할 수 있으며, OpenAI는 수 주 내 일반 공개를 예정하고 있다.
이 시점에는 Terra와 Luna를 사용해 현재 프로덕션 파이프라인의 비용 구조를 먼저 조정할 수 있다. Luna를 기본 라우팅 계층으로 두고, 실패 또는 복잡도 신호에 따른 Sol 에스컬레이션 로직을 설계하는 방식이다.
Sol Ultra는 Codex와 통합된 멀티파일 코드 리팩터링, 보안 취약점 분석, 장기 리서치 태스크를 대상으로 한다. 복잡한 소프트웨어 엔지니어링 파이프라인에서는 Ultra 모드를 기본값으로 설정하는 방안이 권장된다.
대규모 시스템 프롬프트와 반복 컨텍스트를 사용하는 워크플로우에서는 캐시 브레이크포인트를 명시하고 30분 보장 캐시 수명을 활용할 수 있다. 초기 비용은 1.25배지만 이후 90% 할인이 적용되므로 반복 사용 시 실효 비용이 감소한다.
계정 수준의 교차 세션 모니터링은 엔터프라이즈 내부 가이드라인과 충돌할 수 있다. 프라이버시 보존 감지 옵션과 고객 운영 안전 통제는 사전에 OpenAI 측과 협의해야 하는 항목으로 남는다.
Sol·Terra·Luna의 구조는 세대별 모델 업데이트와 능력 계층의 진화를 분리한다. 접근이 제한된 상태이지만, 일반 공개 이후 Sol Ultra의 에이전틱 코딩 역량이 개발자 생태계에 미칠 영향은 상당할 것으로 예상된다. Terra와 Luna 중심의 비용 최적화 구조는 그 전환을 준비하는 운영 단위가 된다.
Sources
- https://openai.com/index/previewing-gpt-5-6-sol/
- https://www.datacamp.com/blog/gpt-5-6-sol-luna-terra
- https://www.latent.space/p/ainews-openai-gpt-56-sol-terra-luna
- https://lushbinary.com/blog/gpt-5-6-sol-terra-luna-developer-guide-benchmarks-pricing/
- https://www.finout.io/blog/gpt-5.6-pricing-2026-sol-terra-and-luna-tiers-explained
- https://www.eesel.ai/blog/gpt-5-6
- https://thehackernews.com/2026/06/openai-limits-gpt-56-rollout-as-sol.html
- https://techcrunch.com/2026/06/26/openai-limits-gpt-5-6-rollout-after-government-request-says-restrictions-shouldnt-be-the-norm/
- https://www.marktechpost.com/2026/06/26/openai-previews-gpt-5-6-with-sol-terra-and-luna-tiered-models-new-reasoning-modes-limited-access/
- https://apidog.com/blog/gpt-5-6-ultra-mode/
- https://explainx.ai/blog/gpt-5-6-vs-claude-fable-5-comparison-2026
- https://lushbinary.com/blog/gpt-5-6-sol-benchmarks-terminalbench-agentic-deep-dive/
- https://venturebeat.com/technology/openai-unveils-gpt-5-6-sol-terra-and-luna-models-but-only-accessible-to-limited-preview-partners-for-now-per-us-gov
- https://wowhow.cloud/blogs/gpt-5-6-release-date-features-developer-guide-june-2026
- https://lushbinary.com/blog/gpt-5-6-pricing-cost-optimization-sol-terra-luna/