GPT-5.6 티어 라우팅과 추론 예산 운영

GPT-5.6 Sol·Terra·Luna의 티어드 가격 구조와 추론 예산, 라우팅 정책, API 통합 및 도입 리스크를 정리한다.

2026-08-14 · 최초 발행 2026-08-02

2026년 7월 공개된 GPT-5.6의 운영 구조

OpenAI는 2026년 7월 9일 GPT-5.6을 ChatGPT, Codex, API에 정식 배포했다. 2026-06-26 제한적 프리뷰 이후의 GA이며, 프리뷰 시점 대비 가격은 동결됐다.

이번 라인업은 단일 플래그십 모델이 아니다. Sol은 최고 난도 작업, Terra는 일반적인 프로덕션 트래픽, Luna는 분류와 라우팅처럼 대량 처리에 맞춰 역할을 나눈다. 세 모델은 API에서 계정 제한 없이 셀프서브로 제공된다.

릴리스에는 Responses API의 Programmatic Tool Calling, Ultra 멀티에이전트 모드, 명시적 캐시 브레이크포인트와 최소 30분 캐시 수명을 포함한 예측 가능한 프롬프트 캐싱도 포함됐다. 일반 배포 전에는 CAISI(Center for AI Standards and Innovation)가 12일간 레드팀, 데이터셋 공유, 안전 시스템 우회 테스트를 포함한 사전 검토를 진행했다.

모델 티어와 추론 노력을 분리하는 방식

GPT-5.6은 모델을 작업 경로로, 추론 노력을 실행 예산으로 다룬다. 먼저 티어로 기본 역량과 단가를 고른 뒤, 같은 티어 안에서 추론 예산을 조절해 품질과 비용을 맞춘다.

Sol(gpt-5.6-sol)은 복잡한 에이전트, 과학 추론, 높은 오류 비용을 가진 작업을 맡는다. Terra(gpt-5.6-terra)는 품질과 비용의 균형을 겨냥한 프로덕션 표준 티어다. Luna(gpt-5.6-luna)는 분류, 라우팅, 고volume 처리에 맞춘 경량 고처리량 티어다.

이 구분이 있어도 라우팅 규칙은 숨기지 않는 편이 낫다. 엔지니어, PM, 보안 검토자가 모두 읽고 판단할 수 있을 정도로 명시해야 암묵적 자동 라우팅이 만드는 비용과 품질 문제를 추적할 수 있다.

추론 노력은 none, low, medium, high, xhigh, max로 제공된다. Sol에서도 max를 선택하면 태스크당 비용이 급증하며, Intelligence Index 기준 태스크당 약 $1.04가 든다. 티어와 노력, 멀티에이전트 실행 조합별로 토큰·지연·비용을 계측해야 예산 초과를 막을 수 있다.

CAISI 검토를 거친 배포 경로

통과 (12일 소요)보류GPT-5.6 학습 완료CAISI 사전 배포 제출레드팀 안전 우회 테스트데이터셋·워크플로우 공유 검토게이팅 통과?프리뷰 배포티어 라우팅 파이프라인 구성Sol · Terra · Luna 셀프서브GAAPI 호환 인터페이스 통합

Responses API에서 티어를 바꾸는 방법

세 티어는 Responses API 하나에서 model 파라미터만 교체해 호출한다. 모델 교체에 따른 마이그레이션 비용을 낮추는 인터페이스다.

Programmatic Tool Calling에서는 모델이 JavaScript를 작성해 도구 호출을 루프, 조건, 집계로 구성한다. 중간 데이터는 필터링하고 필요한 데이터만 보존하는 방식이다. 생성된 코드는 네트워크가 없는 격리 V8 샌드박스에서 실행된다.

캐시 과금도 운영 예산에 포함해야 한다. GPT-5.6부터 캐시 쓰기 비용은 미캐싱 입력단가의 1.25배이고, 캐시 읽기는 90% 할인 체계를 유지한다.

워크로드별 티어 선택

오류가 큰 자율 에이전트, 복잡한 리팩터링, 과학 계산에는 Sol이 맞는다. 일반 RAG, 문서 생성, 중간 난도 코딩처럼 품질과 단가를 함께 봐야 하는 서비스에는 Terra를 기본값으로 둘 수 있다. 의도 분류, 라우팅, 대량 태깅은 Luna에 적합하다.

구분 기준 권장 티어 추론 노력
자율 에이전트 오류 비용 최고 Sol high~max
프로덕션 API 품질-비용 균형 Terra medium
대량 분류 처리량 우선 Luna none~low
프리필터·라우팅 지연 최소화 Luna none

모든 요청을 플래그십으로 처리하면 저난도 작업에도 과잉 비용이 생긴다. Luna로 프리필터링한 뒤 필요한 요청만 Sol로 승격하는 캐스케이딩은 총소유비용을 낮추는 선택지가 된다. 여기에 명시적 캐시 브레이크포인트와 30분 캐시 수명을 결합하면 반복 컨텍스트 비용도 줄일 수 있다.

운영 정책에 포함할 리스크

티어와 추론 노력별 토큰·비용 대시보드를 두고, 임계치 초과 시 Sol에서 Terra로 자동 다운시프트하는 정책을 설계할 수 있다. 다만 다운시프트는 품질에 영향을 줄 수 있으므로 골든셋 기반 회귀 테스트와 연결해야 한다.

기존 GPT-5.5나 다른 모델에서 GPT-5.6으로 옮길 때는 품질 저하(regression)를 검증한 뒤 트래픽을 단계적으로 이관한다. 특정 벤더에 묶이지 않도록 프롬프트와 평가셋을 벤더 중립 계층으로 추상화하는 일도 필요하다. CAISI 게이팅이나 행정명령 변화가 릴리스 일정에 영향을 줄 수 있으므로 신모델 도입 로드맵에는 검토 지연 버퍼를 반영한다.

경쟁 모델과 비용·품질의 위치

항목 GPT-5.6 Sol Claude Fable 5 Gemini 3.5 Pro/Flash
입력/출력 단가(per 1M) $5 / $30 $10 / $50 Flash 약 $1.50 / $9
Intelligence Index(max) 59 60 추격 국면
Terminal-Bench 2.1(코딩) 88.8%(Ultra 91.9%) Mythos 5 기준 88.0% 에이전트 벤치 경쟁적
SWE-Bench Pro 강세 80.3%(1위) 중위권
태스크당 비용(max) 약 $1.04 약 3배 수준 저가 지향
강점 효율·에이전트·가격 품질·실제 코딩 저비용·멀티모달

Claude Fable 5는 실제 GitHub 이슈 해결인 SWE-Bench Pro 80.3%와 코딩 품질에서 우위로 제시된다. GPT-5.6 Sol은 유사 지능을 Fable 5의 약 1/3 비용으로 제공하며 에이전트 작업 효율에서 강점이 있다. Gemini는 추격 국면이고, 중국 오픈웨이트 모델군은 “충분히 좋은” 구간의 단가를 낮추는 흐름에 있다.

모델 선택은 성능 지표만으로 끝나지 않는다. 워크로드 난도 분포에 맞춰 티어 조합을 정하는 경제성, 멀티벤더 추상화로 확보하는 사업 연속성(BCP), Programmatic Tool Calling의 샌드박스 격리와 CAISI 검토 이력을 활용하는 보안·거버넌스를 함께 봐야 한다. 2026년에는 단일 초거대 모델의 경쟁보다 티어, 추론 예산, 라우팅 거버넌스를 어떻게 운영하는지가 더 큰 차이를 만든다.

Sources

GPT-5.6AI 에이전트모델 라우팅추론 예산LLM 운영