GPT-5.6 Sol·Terra·Luna 모델 티어링과 라우팅 설계
GPT-5.6 Sol·Terra·Luna의 모델 티어링 구조, 요금과 라우팅·폴백 전략, Programmatic Tool Calling 기반 운영 설계를 정리한다.
2026-08-30 · 최초 발행 2026-07-25
2026년 7월 9일 OpenAI가 GPT-5.6 제품군을 General Availability로 전환하면서, 상용 LLM을 단일 모델로 채택하는 방식은 티어 기반 제품군을 선택하는 방식으로 바뀌기 시작했다. Sol, Terra, Luna는 성능·비용·지연의 균형점을 다르게 잡는다. AI 서비스를 설계할 때는 모델 자체보다 워크로드를 어느 티어에 배정하고, 실패 시 어디로 넘길지를 먼저 정해야 한다.
세대 번호와 능력 티어를 분리한 제품군
GPT-5.6은 2026년 6월 26일 제한적 프리뷰를 거쳐 7월 9일 정식 GA에 도달했다. 제품명에서 GPT-5.6은 세대를, Sol·Terra·Luna는 각각 독립된 발전 주기(cadence)를 지닌 지속형 능력 티어를 뜻한다.
Sol은 난도가 높은 문제와 장기 자율 실행(long-running agentic task)을 위한 플래그십이다. Terra는 구(舊) GPT-5.5급 성능을 절반 수준 비용으로 제공하는 균형형이며, Luna는 분류·인텐트 라우팅·콘텐츠 모더레이션·단순 요약처럼 처리량이 중요한 태스크에 맞춘 비용 최적화 티어다.
ChatGPT 유료 플랜에서는 추론 설정(reasoning settings)을 통해 Sol에 접근할 수 있다. 다만 일상 대화의 기본 모델은 여전히 GPT-5.5 Instant다. 같은 시점에 업무 자동화 에이전트 ChatGPT Work와 Codex의 슈퍼앱화도 함께 공개됐다.
공통 인터페이스 위에서 달라지는 실행 비용
세 티어는 모두 1,050,000 토큰(약 1.05M)의 컨텍스트 창과 128,000 토큰의 최대 출력을 제공한다. 지식 컷오프는 2026년 2월 16일이며, 이미지 입력·구조화 출력(structured outputs)·함수 호출(function calling)·스트리밍·Responses API를 지원한다.
API에서 접미사 없이 gpt-5.6을 호출하면 Sol로 라우팅된다. Terra와 Luna는 Work·Codex·API에서 명시적으로 선택할 수 있지만, 표준 ChatGPT 대화창에서는 선택 대상이 아니다.
세바스찬 라슈카(Sebastian Raschka)의 분석에서는 추론과 verbosity 조합으로 72개 구성 조합이 가능하다. 따라서 모델 선택뿐 아니라 어떤 구성을 기본값(default)으로 둘지도 별도 설계 과제가 된다.
Programmatic Tool Calling은 Responses API에 추가된 기능이다. 매 턴 툴 결과를 원시 텍스트로 반환하는 대신, 모델이 메모리 내 경량 프로그램을 작성하고 실행해 여러 툴을 조율한다. 파일시스템·셸·브라우저·커스텀 함수 툴을 다룰 때 왕복(round-trip)을 줄여 에이전트의 지연과 토큰 소비를 함께 낮추는 구조다.
Sol은 2026년 7월 select 고객을 대상으로 Cerebras 인프라에서 최대 750 토큰/초로 서빙되며, 용량 확대가 예정돼 있다. Sam Altman 발언 기준으로 Sol은 에이전틱 코딩(agentic coding)에서 토큰 효율을 54% 개선했다. Ultra 멀티 에이전트(multi-agent)는 4-에이전트 기본 구성에서 1-에이전트 대비 BrowseComp·SEC-Bench Pro·Terminal-Bench 2.1의 점수-지연 프론티어를 좌상향 이동시킨다.
캐시 쓰기(cache write) 비용은 미캐시 입력 요율의 1.25배이고 최소 캐시 수명은 30분이다. Batch API의 비동기 처리에는 티어별 50% 할인이 적용된다.
워크로드 SLA에서 시작하는 티어 배정
Sol은 자율 코딩 에이전트, 복잡한 리서치, 다단계 계획 수립처럼 품질이 추가 비용을 정당화하는 업무에 배정한다. Terra는 RAG(Retrieval-Augmented Generation) 파이프라인, 고객 대면 챗봇, 표준 프로덕션 API에 적합하다. 프론티어 가격 없이 프로덕션 품질을 확보하려는 경우의 선택지다.
Luna는 분류·인텐트 라우팅·모더레이션·대량 요약처럼 깊은 추론보다 처리량이 우선되는 태스크에 둔다. 이 배정은 품질(quality)·비용(cost)·지연(latency) 요구사항을 태스크별 SLA로 명문화한 뒤 결정해야 한다.
Sol과 Luna의 출력 요율 차이는 5배(30/6)다. 프로파일링 없이 상위 티어를 고정하면 비용이 빠르게 늘어날 수 있다. 입력·출력 토큰 분포를 실측해 티어별 요율을 대입하고, 캐시 히트율과 Batch 적용률까지 반영한 월간 비용 모델을 마련할 필요가 있다. 반복 프롬프트에는 캐시 30분 수명과 1.25배 쓰기 비용을 함께 고려해 캐시 이득을 계산한다.
라우터 계층은 프론트에 두고 태스크 메타데이터를 기준으로 티어를 자동 선택할 수 있다. Sol이 과부하 또는 실패 상태이면 Terra로, Terra도 실패하면 Luna로 강등(degrade)하는 다단 폴백 구성이 권장된다. 과부하·타임아웃·품질 미달에 대한 상위→하위 전환 또는 재시도 정책은 코드로 명시하는 편이 운영 중의 판단 편차를 줄인다.
티어별 가격과 역할의 차이
| 구분 | Sol (Flagship) | Terra (Balanced) | Luna (Cost) |
|---|---|---|---|
| 입력 요율(1M 토큰) | $5.00 | $2.50 | $1.00 |
| 출력 요율(1M 토큰) | $30.00 | $15.00 | $6.00 |
| 컨텍스트 창 | 1.05M | 1.05M | 1.05M |
| 최대 출력 | 128K | 128K | 128K |
| 대표 워크로드 | 고난도 추론·자율 코딩 | RAG·프로덕션 챗봇 | 분류·라우팅·요약 |
| 성능 포지션 | 최상위 프론티어 | 구 GPT-5.5급 | 처리량 우선 |
| ChatGPT 노출 | 유료 추론 설정 | 미노출(Work·API) | 미노출(Work·API) |
단일 플래그십만 사용하는 구성과 달리, 티어를 혼용하면 저위험·고빈도 태스크를 Luna로 흡수해 총비용을 크게 낮출 수 있다. 대신 라우팅과 평가의 복잡도는 늘어난다.
DeepSeek·Qwen·GLM 같은 오픈웨이트(open-weight)는 플래그십 대비 60~90% 저렴하다. 고빈도·저위험 업무는 오픈웨이트로 보내고, 품질과 신뢰성이 필수인 워크로드는 GPT-5.6 프론티어 티어로 배분하는 하이브리드 구성이 성능 패리티(parity) 시대의 최적해로 제시된다. 모델 성능이 상향 평준화될수록 병목은 모델 선택에서 비용·라우팅·평가·아키텍처로 이동한다.
운영 거버넌스에 포함할 항목
모델은 단일 컴포넌트가 아니라 티어 카탈로그(catalog)로 관리해야 한다. 태스크-티어 매핑 정책은 아키텍처 산출물로 문서화하고, 라우터와 폴백은 서킷 브레이커·재시도·강등 같은 회복성(resilience) 패턴에 포함해 SLA를 뒷받침한다.
비용 관리에서는 FinOps 관점으로 토큰 단가·캐시·Batch 최적화를 운영 KPI에 편입한다. 티어별 단가 5배 격차를 비용 통제의 지렛대로 쓰고, 사용량을 팀·프로젝트 단위로 태깅해 모니터링한다. 초과 시 경보(alert)를 두며, 쇼백(showback)·차지백(chargeback)으로 부서별 AI 지출 책임성을 확보할 수 있다.
데이터 등급에 따라 허용 모델과 호스팅 경로를 통제하고, 민감정보의 외부 API 전송 정책을 명문화해야 한다. 특정 벤더의 티어 체계에 종속되는 락인(lock-in) 위험은 오픈웨이트 병행과 추상화 계층으로 완화할 수 있다.
제품군 경쟁이 바꾸는 설계 기준
상용 LLM의 다층 제품군화는 업계 표준으로 정착하고, 경쟁사도 유사한 티어 체계 채택을 가속할 전망이다. 모델 라우터와 게이트웨이는 독립 미들웨어 시장으로 성장하며, 멀티벤더 라우팅은 기본값화될 가능성이 있다.
Programmatic Tool Calling과 멀티 에이전트는 에이전틱 워크로드 비중을 확대하고, Cerebras 등을 중심으로 한 서빙 인프라의 고속화 경쟁도 심화될 것이다. 상용 프론티어와 오픈웨이트의 혼용은 비용과 거버넌스의 균형점으로 주류화되며, 성능 패리티 환경에서는 아키텍처와 운영 경제성이 경쟁의 기준이 된다.
Sources
- GPT-5.6: Frontier intelligence that scales with your ambition | OpenAI
- The new GPT-5.6 family: Luna, Terra, Sol — Simon Willison
- OpenAI Releases GPT-5.6 (Sol, Terra, Luna): A Three-Tier Model Family With Programmatic Tool Calling in the Responses API — MarkTechPost
- GPT-5.6 Pricing 2026: Sol, Terra and Luna Tiers Explained — Finout
- GPT-5.6 pricing: Sol, Terra, and Luna costs — CloudZero
- GPT 5.6 Has 72 Possible Configurations. What's A Good Default? — Sebastian Raschka
- How to choose the right OpenAI GPT-5.6 model — Axios
- 3 Chinese open models cutting enterprise AI bills 60-90% in 2026 — EcorpIT
- OpenAI GPT-5.6 Introduces a New Enterprise AI Model Strategy — The National CIO Review