요청 등급별 모델 라우팅으로 LLM 원가와 품질을 함께 관리하는 법

요청 난도와 품질 기준에 따라 모델을 배분하고, 승격·캐시·지연 예산·원가 귀속으로 LLM 운영 비용을 관리하는 아키텍처

2026-09-04 · 최초 발행 2026-09-03

모델 하나로는 원가와 신뢰를 동시에 맞추기 어렵다

Gemini 3.8 Flash는 입력 100만 토큰당 $0.75, 출력은 $3.75 수준의 단가로 Terminal-Bench 2.1에서 90.8%를 기록했다. 반면 Fable 5.1의 입력 단가는 100만 토큰당 $10이다. 입력 비용만 놓고도 열 배 이상 벌어진다.

그렇다고 저가 모델이 모든 유형의 요청에서 같은 결과를 내는 것은 아니다. 3.8 Flash는 Terminal-Bench 2.1에서는 앞서지만 4.0에서는 19.1%로 크게 뒤진다. 단일 벤치마크 순위만으로 모델을 고르면, 실제 요청 유형에 따라 판단이 뒤집힐 수 있다.

이제 핵심은 최고 성능 모델을 고정하는 일이 아니라 요청의 성격에 맞춰 단가와 품질을 배치하는 일이다. 모든 요청을 상위 모델로 보내면 트래픽 증가가 곧 원가 압박으로 이어진다. 반대로 저가 모델만 쓰면 난도가 높은 요청에서 품질 문제가 누적된다.

출력 단가는 입력의 다섯 배 안팎이다. 응답 길이는 모델 선택만큼 직접적인 원가 변수다. 여기에 Fable 캐시 읽기 비용이 75% 인하되면서, 반복 입력이 많은 경로에서는 캐시 여부까지 라우팅 손익에 포함해야 한다. 저가 모델이 실패해 상위 모델로 승격되는 경우에는 두 호출의 비용이 모두 남는다.

라우터는 모델 선택보다 운영 규칙을 먼저 가진다

요청을 받으면 먼저 입력 길이, 도구 사용 여부, 다단계 추론 필요성, 도메인 특수성을 기준으로 난도를 분류한다. 이 분류를 무거운 모델에 맡기면 분류 비용이 절감액을 넘어 라우팅 자체가 무의미해질 수 있다.

규칙의 적용 순서도 고정해야 한다. 명시 지정, 사용자 등급, 난도 분류, 기본값 순으로 처리하고, 충돌할 때 어떤 규칙이 우선하는지 문서화한다. 암묵적인 우선순위는 원가 이상 징후를 추적하기 어렵게 만든다.

저가 모델을 선택한 뒤에는 품질 판정과 승격 경로가 이어진다. 형식 준수, 필수 항목 포함, 근거 인용 여부처럼 기계적으로 확인할 수 있는 조건을 먼저 검사한다. 판정에 LLM을 사용하는 비중이 커지면 평가 호출 자체가 절감 구조를 훼손할 수 있다.

품질 판정 실패, 형식 오류, 도구 호출의 반복 실패가 발생하면 상위 모델로 재시도한다. 단, 승격 횟수에는 상한이 필요하다. 상한이 없으면 어려운 요청 하나가 여러 모델을 순회하며 원가를 늘릴 수 있다. 모델별 응답 시간 상한도 정해 두고, 초과하면 승격 또는 대체 응답으로 넘긴다. 이때 승격이 추가 지연을 만든다는 점까지 포함해 총 시간을 관리해야 한다.

반복되는 시스템 프롬프트와 고정 참조 자료는 캐시 대상으로 분리한다. 캐시 읽기 단가가 낮은 모델에서는 고정 맥락을 크게 두는 선택이 손익 측면에서 유리해질 수 있다. 다만 가격은 고정값이 아니다. 프로모션 종료와 가격 개정을 감시하고, 라우팅의 단가 파라미터를 설정값으로 갱신해야 한다.

요청 식별자에는 사용 모델, 입력·출력·캐시 토큰, 승격 횟수를 함께 남긴다. 특히 승격으로 인한 중복 비용은 별도 항목으로 집계해야 한다. 이 값이 라우팅 임계와 모델 배분을 조정하는 근거가 된다.

⤢✕예아니오통과실패초과이내요청 수신난도 분류 (길이 · 도구 · 추론단계 · 도메인)라우팅 규칙 적용 (명시 · 등급 ·난도 · 기본값)캐시 적용 대상?고정 맥락 캐시 읽기전체 입력 구성저가 모델 호출품질 자동 판정 통과?응답 반환승격 횟수 상한 이내?대체 응답 · 실패 기록상위 모델 승격 재시도요청별 원가 귀속 (모델 · 토큰 ·승격 횟수)승격 임계 · 라우팅 규칙 조정단가 변동 감시 (프로모션 종료· 가격 개정)

실제 트래픽을 기준으로 라우팅 기준을 잡는다

등급 체계는 추정이 아니라 실제 요청 표본에서 시작한다. 유형별 비중과 난도 분포를 측정하면, 예상보다 저난도 요청 비중이 큰 구간과 절감 여지가 있는 경로를 확인할 수 있다.

등급 수는 소수로 두고, 각 등급의 대표 사례를 문서화한다. 등급이 지나치게 많아지면 규칙 유지 비용이 절감 효과를 잠식한다. 등급별 품질 하한도 먼저 합의한다. 허용 가능한 최저 품질을 수치로 정하고, 하한 아래에서는 승격을 강제해야 원가 목표가 품질을 밀어내지 않는다.

승격 임계는 고정된 값으로 두지 않는다. 임계를 바꾸며 승격률, 총원가, 평균 지연의 변화를 측정한다. 승격률이 일정 수준을 넘으면 저가 모델을 먼저 거치는 방식이 상위 모델 단독 처리보다 손해가 될 수 있다.

원가 관리는 총액보다 요청당 목표 원가를 중심에 둔다. 요청 유형별 허용 범위를 나눠야 트래픽 증가와 비효율을 구별할 수 있다. 라우팅 규칙의 배포 역시 애플리케이션 코드 배포와 분리하고, 변경 이력과 되돌림 경로를 남긴다. 규칙 변경은 원가와 품질에 즉시 영향을 주므로 승인 대상이어야 한다.

운영 보고에는 요청당 원가, 승격률, 등급별 품질을 포함한다. 단가 변동과 모델 교체가 라우팅 규칙에 반영됐는지도 점검 주기에 넣는다.

선택 방식에 따라 감수할 문제가 달라진다

구분 난도 기반 자동 라우팅 단일 모델 일괄 처리
원가 절감 큼 없음
품질 편차 발생 균일
구현 복잡도 높음 낮음
장애 영향 범위 분산 집중
지연 예측성 낮음 높음
운영 지표 해석 복잡 단순

난도 기반 자동 라우팅은 저난도 요청을 열 배 저렴한 모델로 처리해 총원가를 낮추고, 상위 모델 용량을 어려운 요청에 집중시킬 수 있다. 한 모델의 장애가 전체 서비스로 번지는 범위도 줄어든다. 대신 분류가 틀린 요청에서는 품질이 급격히 내려갈 수 있고, 같은 질문도 시점에 따라 다른 모델로 이동해 응답 성격이 흔들린다. 모델별로 나뉜 지표는 원인 분석을 늦출 수 있다.

단일 모델 일괄 처리는 응답 성격이 일정하고, 프롬프트 최적화와 지표 해석을 한곳에 집중하기 쉽다. 반면 단순 요청에도 상위 모델 단가를 그대로 지불하므로 트래픽이 늘수록 원가가 서비스 성립을 위협한다. 저난도 요청 비중이 큰 서비스라면, 분류 오류가 큰 손해로 이어지는 일부 경로만 명시 지정으로 고정하는 방식이 현실적이다.

저가 모델 우선 후 승격하는 방식은 쉬운 요청을 낮은 단가로 끝내 평균 원가와 상위 모델 호출량을 낮춘다. 그러나 승격된 요청은 호출 비용과 지연을 모두 두 번 부담한다. 승격률이 높아지면 총비용은 상위 모델 단독 처리보다 커질 수 있다. 해당 유형을 상위 모델 직행으로 바꿀 기준은 승격률의 손익분기로 관리해야 한다.

캐시도 같은 선택이다. 동일하거나 유사한 요청에 캐시를 적용하면 호출 자체를 줄여 원가와 지연을 함께 낮출 수 있고, 상위 모델의 용량도 아낀다. 반면 자료가 갱신된 뒤에도 이전 응답이 반환될 수 있으며, 개인화 요청에서는 다른 사용자의 맥락이 섞일 위험이 있다. 시스템 프롬프트와 고정 참조 자료는 프롬프트 캐시로, 완전히 동일한 질의는 응답 캐시로 나누고, 개인화 구간은 캐시 대상에서 제외하는 구성이 필요하다.

비용·성능·용량 지표를 한 화면에서 본다

요청당 목표 원가와 유형별 배분은 원가 기획 및 예산 통제 절차에 대응한다. 승격 때문에 발생한 중복 비용을 별도로 집계하면 어떤 요청이 원가를 밀어 올리는지 분석할 수 있다.

모델별 지연 예산과 승격 시의 총 지연 관리는 응답 시간 목표를 설계하는 문제다. 형식 준수, 필수 항목 포함, 근거 인용 여부를 자동 판정 기준으로 두면 서비스 품질을 측정 가능한 대리 지표로 다룰 수 있다.

저가 모델로 요청을 분산하는 것은 상위 모델 한도를 보전하는 수요 관리 조치이기도 하다. 반복 수요를 캐시로 흡수하는 전략까지 결합하면, 모델 호출량과 용량 압박을 함께 줄일 수 있다.

단가 변화가 라우팅 규칙을 다시 움직인다

모델 간 단가 격차가 열 배 이상 벌어지면서 라우팅 계층은 애플리케이션의 기본 구성요소로 편입되는 방향이다. 프로모션 종료와 가격 개정이 잦아질수록 단가는 코드 상수가 아니라 설정값으로 관리하는 관행이 필요해진다.

캐시 읽기 단가 인하가 이어지면 고정 맥락을 크게 두는 프롬프트 설계가 원가 측면에서 유리해지는 흐름도 강해진다. 요청당 원가와 승격률은 품질 지표와 함께 서비스 운영 지표로 정착하게 된다.

Gemini 3.8 Flash의 입력 100만 토큰당 $0.75와 Fable 5.1의 $10이라는 격차는 요청 배분이 곧 손익 설계라는 점을 보여준다. 특히 3.8 Flash의 단가는 2026년 12월 31일까지 적용되는 프로모션 조건이다. 난도 분류를 가볍게 유지하고, 승격 횟수에 상한을 두며, 승격 비용까지 요청별로 귀속하는 구성이 필요하다. 가격 파라미터를 코드에 고정하면 프로모션 종료일에 손익 계산이 조용히 뒤집힐 수 있다.

Sources

모델 라우팅LLM 원가프롬프트 캐시AI 에이전트지연 예산