Claude Fable 5로 설계하는 엔터프라이즈 코딩 에이전트

Claude Fable 5의 추론 구조, SWE-bench 성능, 가격과 운영 제약을 바탕으로 엔터프라이즈 코딩 에이전트 도입 기준을 분석한다.

2026-08-14 · 최초 발행 2026-08-02

2026년 6월 9일 GA로 공개된 Claude Fable 5는 짧은 대화보다 오래 이어지는 자율 작업에 초점을 맞춘 모델이다. Anthropic은 이를 Opus보다 상위인 최초의 일반 출시 “Mythos-class” 모델로 배치했다. 대규모 코드 마이그레이션, 다일(multi-day) 에이전틱 세션, 심층 리서치처럼 컨텍스트와 작업 상태를 장시간 유지해야 하는 워크로드가 주된 대상이다.

장기 작업에 맞춘 모델 포지셔닝

일반 API에서 사용하는 모델 ID는 claude-fable-5다. 동급의 claude-mythos-5는 Project Glasswing 전용으로 구분된다. 입력 컨텍스트는 기본값이자 최댓값인 1,000,000 토큰이며, 최대 출력은 128K 토큰이다. 텍스트뿐 아니라 이미지와 파일도 입력할 수 있다.

가격은 백만 토큰당 입력 $10, 출력 $50으로 Opus 대비 약 2배다. 프롬프트 캐싱을 적용하면 입력 비용을 최대 90% 할인할 수 있고, 배치 처리 단가는 입력 $5, 출력 $25로 절반이 된다. 따라서 모델의 성능만으로 전면 교체를 결정하기보다, 높은 단가를 감수할 가치가 있는 작업을 먼저 가려내야 한다.

상시 추론과 컨텍스트 유지 방식

Claude Fable 5는 Opus 4.7/4.8과 같은 Messages API 표면을 사용하지만 추론 제어와 안전성 동작은 다르다. 코딩에 필요한 다단계 추론 체인을 내부에 학습하고, 원시 추론 과정은 노출하지 않은 채 장기 에이전틱 워크플로우의 일관성을 유지하도록 설계됐다. 단일 요청이 수 분에서 수십 분 동안 이어지는 비동기 자율 실행을 전제로 하므로, 짧은 응답을 반복하는 대화형 모델과는 운영 방식도 달라진다.

thinking 파라미터를 생략하면 adaptive thinking이 자동 적용된다. {type: "disabled"} 또는 budget_tokens를 지정하면 400 오류로 거부되며, 추론 깊이는 output_config.effort의 low~xhigh, max 범위에서 조절한다.

원시 chain-of-thought는 반환되지 않는다. display: "summarized"를 지정하면 추론 요약만 받을 수 있고, 기본값인 omitted에서는 thinking 블록이 빈 문자열로 전달된다.

장기 실행은 1M 토큰 컨텍스트와 서버사이드 compaction(beta), context editing의 조합으로 유지된다. 도구 호출을 반복하는 자율 루프에서도 필요한 작업 맥락을 이어가기 위한 구조다. 비전 처리에서는 Opus 4.7부터 도입된 장변 최대 2576px의 고해상도 입력을 계승해 스크린샷, 다이어그램, 문서를 코드 맥락과 함께 다룬다.

토크나이저는 Opus 4.8과 같아 Opus 4.7/4.8 대비 토큰 카운트가 거의 동일하고 단가만 달라진다.

거부통과아니오사용자 요청1M 토큰 컨텍스트안전 분류기 통과?stop_reason: refusal폴백 모델 재실행adaptive thinking상시 추론effort 기반 다단계 추론 체인에이전틱 도구 호출?도구 실행 + context editingsummarized thinking + 최종응답

안전 분류기는 사이버·생물 등 고위험 도메인의 요청을 검사한다. 거부되는 요청도 HTTP 200으로 응답하며 stop_reason: "refusal"을 포함한다. 30일 데이터 보존 조건을 충족하지 않는 ZDR 조직에서는 모든 요청이 400으로 반환된다.

실제 저장소를 다루는 코딩 성능

Claude Fable 5는 SWE-bench Verified에서 95.0%를 기록해 102개 평가 모델 가운데 리더보드 1위인 0.950에 올랐다. 더 어려운 실제 리포지토리 기반 평가인 SWE-bench Pro 점수는 80.3%다. 다만 일부 독립 분석에서는 이 점수의 산정 방식을 두고 이견이 제기됐다.

최고난도 코드 추론 벤치마크인 FrontierCode Diamond에서는 29.3%를 기록했다. 높은 effort를 사용할 때는 자체 검증 하네스를 구성하고 실행하는 self-verification 행동도 나타난다. 패치를 생성하고 테스트를 실행한 뒤 결과를 검증하는 SWE-bench 평가 루프와 맞닿아 있는 특성이다.

장기 자율 코딩 사례로는 Stripe의 Ruby 코드베이스 마이그레이션이 제시됐다. 5,000만 라인 규모의 전면 마이그레이션을 하루 만에 완료했으며, 팀 단위로는 2개월이 걸릴 것으로 추정된 작업이었다. 이는 코드 완성보다 버그 재현, 원인 분석, 패치 작성, 테스트 검증을 연속해서 수행하는 능력에 모델의 가치가 있음을 보여준다.

벤치마크 우위가 곧바로 안정적인 사용 가능성을 뜻하지는 않는다. 2026년 6월 12일 미국 수출 통제 지침에 따라 접근이 일시적으로 제한된 사례처럼, 규제와 가용성은 성능과 별개의 도입 변수다.

전면 교체보다 복잡도 기반 라우팅

Fable 5의 단가는 Opus 4.8의 약 2배이므로 모든 요청을 같은 모델로 처리하면 비용 구조가 빠르게 무거워진다. 하나의 게이트웨이에서 태스크 복잡도를 판별하고 모델을 나누는 방식이 현실적이다.

대규모 마이그레이션, 실사·due diligence, 장기 자율 에이전트처럼 어렵고 긴 고가치 작업은 Fable 5로 보낸다. 성능과 처리량의 균형이 필요한 요청은 Sonnet 4.6, 저비용 실시간 처리는 Haiku 4.5로 분배할 수 있다.

기존 Sonnet 워크플로우를 옮길 때는 thinking 설정과 assistant prefill을 제거하고 output_config.effort를 다시 조정해야 한다. 1M 토큰 컨텍스트와 최대 128K 토큰 출력을 고려한 토큰 헤드룸 재산정도 필요하다. API 변경을 흡수하는 마이그레이션과 실제 성능·비용을 확인하는 프리뷰를 분리하면 전환 위험을 줄일 수 있다.

거부 응답에 대비하려면 server-side-fallback-2026-06-01 베타 헤더와 fallbacks: [{"model": "claude-opus-4-8"}]를 적용해 Opus 4.8로 자동 재실행할 수 있다. 안전 분류기의 양성 오탐이 업무 흐름을 중단시키는 상황에 대비한 구성이다. GA 직후 도입하는 조직은 30일 데이터 보존 정책 충족 여부와 가용량을 결정하는 usage credit 제약도 사전에 확인해야 한다.

프롬프트는 이전 모델에 사용하던 과도한 step-by-step 스캐폴딩을 걷어내고 목표와 제약 중심으로 다시 작성하는 편이 맞다. Fable 5에서는 과도한 지시가 오히려 품질을 떨어뜨릴 수 있다.

토큰 단가보다 작업 완수 비용을 본다

ROI를 판단할 때 백만 토큰당 $10/$50만 비교하면 장기 작업의 경제성을 놓칠 수 있다. 출력 비용은 높지만 어려운 작업을 더 적은 재시도와 인간 개입으로 끝낸다면, 전체 작업비는 낮아질 수 있다. 2개월→1일 사례처럼 작업 기간 차이가 큰 영역에서는 이 관점이 더욱 중요하다. 배치 처리와 프롬프트 캐싱도 비용 조정 수단으로 함께 고려할 수 있다.

내부 평가에서는 정답률과 토큰 사용량 외에 평균 재시도율, 인간 검토 시간, 컨텍스트 재처리 비용을 같은 워크로드에서 측정해야 한다. 이 값을 토대로 작업별 손익분기점을 구해야 Fable 5를 투입할 구간과 기존 모델을 유지할 구간을 나눌 수 있다.

Gemini 3.5 Flash·Grok 4.3와의 선택 기준

Claude Fable 5는 코딩과 장기 에이전틱 추론에, Gemini 3.5 Flash는 속도와 가격 효율에, Grok 4.3은 범용 추론의 가성비에 무게를 둔다. 세 모델은 약 한 달 간격으로 공개돼 2026년 상반기 프런티어 모델 경쟁을 보여준다.

항목 Claude Fable 5 Gemini 3.5 Flash Grok 4.3
공개 시점 2026-06-09 (GA) 2026-05-19 (I/O) 2026-04-30 (API)
SWE-bench Verified 95.0% (SOTA) 78% 미공개(Opus 4.7 하회 인정)
SWE-bench Pro 80.3% 미공개 미공개
입력 단가(/1M) $10.00 $1.50 $1.25
출력 단가(/1M) $50.00 $9.00 $2.50
컨텍스트 윈도우 1M 토큰 대용량 대용량(200K 초과 시 2배 과금)
핵심 강점 장기 에이전틱 코딩·추론 SOTA Pro급 추론·Flash급 지연속도 범용 추론 가성비·네이티브 비디오 입력

SWE-bench Verified에서는 Fable 5의 95%가 Flash의 78%를 17%p 앞선다. Grok 4.3은 Opus 4.7보다 낮은 성능임을 자체적으로 인정했으며 관련 점수는 공개하지 않았다.

비용은 다른 방향을 가리킨다. Flash와 Grok은 Fable 5보다 약 58배 저렴해 대량 요청이나 실시간 워크로드에서 유리하다. Grok 4.3은 프리미엄 모델 대비 510배 저렴한 단가와 네이티브 비디오 입력을 내세운다. Gemini 3.5 Flash는 Pro급 추론을 Flash급 지연속도로 제공한다는 포지셔닝으로 중간 티어가 코딩·에이전틱 작업을 흡수하는 흐름을 대표한다.

모델 선정표에는 벤치마크 점수만 넣어서는 부족하다. TCO는 단가×토큰량×재시도율로 보고, 데이터 거버넌스에는 30일 보존과 ZDR 조건을, 가용성에는 export-control과 usage credit 제약을 반영해야 한다.

프런티어 모델의 실행이 단일 응답의 수 분대로 길어지는 2026년의 흐름에서는 평가 기준도 달라진다. 정답률뿐 아니라 결과를 검증하고 재현할 수 있는지, 장기 자율 실행을 조직의 거버넌스 안에서 통제할 수 있는지가 실제 도입 범위를 결정한다.

Sources

Claude Fable 5코딩 에이전트SWE-bench에이전틱 AILLM 운영