Claude Fable 5·Mythos 5 이중화 배포와 프런티어 LLM 경쟁 구도

Claude Fable 5와 Mythos 5의 안전 분류기, 이중화 배포 구조, 코딩·비전 벤치마크, 가격과 접근 계층을 실무 관점에서 비교하고 프런티어 LLM 선택 기준을 짚는다.

2026-08-14 · 최초 발행 2026-08-02

같은 기반 모델을 서로 다르게 공개한 이유

Anthropic은 2026년 6월 9일, 그동안 내부 연구용으로 운용하던 Mythos-class 역량을 처음으로 일반 대중에게 공개했다. 공개 모델인 Claude Fable 5에는 사이버보안·생물학·화학처럼 위험도가 높은 영역을 다루는 안전 가드레일이 적용됐다. 소프트웨어 엔지니어링과 지식 작업, 비전, 과학 연구를 포함한 거의 모든 벤치마크에서 SOTA를 달성하면서도 위험 요청을 별도로 통제하는 구조다.

동시에 공개된 Claude Mythos 5는 같은 기반 모델에서 가드레일을 해제한 형태다. 일반 API가 아니라 승인된 파트너에게만 제공된다. Anthropic은 안전성과 성능 사이의 충돌을 하나의 모델 안에서 타협하는 대신, 접근 계층을 나누는 이중화 출시 전략을 택했다.

Fable은 라틴어 fabula(이야기되는 것)에서 유래하며 그리스어 mythos와 어원을 공유한다. 이름에서도 두 모델의 관계가 드러난다. Mythos 5가 원형이라면 Fable 5는 일반 사용자에게 전달할 수 있도록 안전 계층을 더한 버전이다.

항목 Claude Fable 5 Claude Mythos 5
기반 모델 Mythos-class Mythos-class
안전 가드레일 적용 (3개 분류기) 해제 (승인 파트너 한정)
컨텍스트 윈도우 1M 토큰 1M 토큰
최대 출력 128k 토큰 128k 토큰
입력 가격 $10 / 1M 토큰 $10 / 1M 토큰
출력 가격 $50 / 1M 토큰 $50 / 1M 토큰
일반 API 접근 가능 불가 (Glasswing 파트너)
지원 플랫폼 claude.ai, AWS Bedrock, Google Vertex AI, Microsoft Foundry 제한적 파트너

위험 요청은 더 제한된 모델로 우회한다

Fable 5의 안전 계층은 모델이 직접 모든 요청을 처리하도록 두지 않는다. 분류기가 요청의 위험 유형을 판별하고, 해당 요청을 더 제한된 Claude Opus 4.8로 라우팅한다. 모델 능력과 안전 제약을 함께 최적화하되 특정 영역은 처리 경로 자체를 분리한 설계다.

아니오아니오아니오사용자 요청사이버보안관련?Opus 4.8 라우팅생물학·화학위험?Opus 4.8 라우팅모델 디스틸레이션시도?Opus 4.8 라우팅Fable 5 정상 처리응답 반환

병렬로 작동하는 분류기는 서로 다른 위험을 맡는다. 사이버보안 분류기는 공격적 사이버 작업과 익스플로잇 시도를 탐지한다. 1,000시간 이상의 외부 레드팀 테스트에서는 범용 탈옥 사례가 0건으로 보고됐다.

생물학·화학 분류기는 위험 바이러스 설계처럼 이중 용도 능력이 악용될 수 있는 요청을 차단한다. 디스틸레이션 분류기는 모델의 능력을 추출하려는 시도를 감지해 방어한다.

Anthropic에 따르면 이 분류기들은 전체 세션의 95% 이상에서 트리거되지 않는다. 따라서 대부분의 사용자는 Mythos 5와 사실상 같은 경험을 하게 된다.

문제는 분류기가 위험한 요청과 정상적인 보안 업무를 항상 정확히 구분하지 못한다는 점이다. 사이버보안 전문가 Matt Suiche는 "보안 코드 작성을 요청하면 사이버보안 관련 작업으로 분류돼 소프트웨어 엔지니어링 모범 사례 대신 다운그레이드된 응답이 반환된다"고 비판했다. 공격 목적이 아닌 보안 개발 워크플로우까지 과도하게 제한한다는 지적이다.

이는 안전 분류기의 정밀도(Precision)와 재현율(Recall)이 충돌하는 실제 사례다. 위험 요청을 놓치지 않도록 민감도를 높이면 정상 요청까지 제한할 수 있다. Anthropic은 이 피드백을 받아 분류기 임계값을 조정 중이라고 밝혔다.

코딩 벤치마크에서 벌어진 격차

Fable 5의 두드러진 영역은 소프트웨어 엔지니어링이다. SWE-Bench Pro와 실제 프로덕션 코드베이스를 기반으로 복잡한 멀티-스텝 엔지니어링 작업을 평가하는 Cognition의 FrontierCode에서 경쟁 모델보다 높은 점수를 기록했다.

모델 SWE-Bench Pro FrontierCode Diamond
Claude Fable 5 80.3% 29.3%
Claude Opus 4.8 69.2% 13.4%
GPT-5.5 58.6% 5.7%
Gemini 3.1 Pro 54.2% -

FrontierCode Diamond에서는 GPT-5.5와 5배 이상의 격차가 났다. 단순한 코드 완성보다 계획 수립과 탐색, 수정, 검증을 이어 가는 에이전틱 코딩에 맞춰 역량이 확장된 결과다.

Claude Code 같은 에이전트 하네스에서는 며칠 단위의 장기 자율 세션을 수행할 수 있다. 단계별 계획을 세우고 서브에이전트에 작업을 위임하며 자기 검증을 반복한다. 파일 기반 영구 메모리를 사용해 세션이 달라져도 컨텍스트를 유지한다.

대규모 코드베이스를 다루는 사례도 나왔다. Stripe는 5,000만 줄 규모 코드베이스의 마이그레이션에서 수개월치 엔지니어링 작업을 수일로 압축했다고 보고했다. 코드를 만든 뒤 자체 테스트를 실행하고 오류를 수정하는 루프도 자율적으로 수행한다.

터미널 환경을 평가하는 Terminal-Bench 2.1에서는 88.0%를 기록했다. 스프레드시트 작업은 이전 세대인 Opus 4.8과 같은 결과를 내면서도 필요한 턴(Turn)이 25-30% 적었다.

비전 입력을 연구와 코드 작업에 연결한다

Fable 5의 비전 모듈은 이미지를 인식하는 데 그치지 않고 그 안의 구조와 수치를 후속 작업에 활용한다. 논문 그래프와 수치에서 정밀한 숫자 값을 추출하고, 웹 앱 스크린샷만 보고 소스 코드를 재구성한다. 최소한의 스캐폴딩만 제공한 상태에서 비전 입력만 사용해 포켓몬 파이어레드를 완주한 사례도 있다. PDF와 다이어그램, 차트, 조밀한 테이블이 섞인 문서 역시 통합해 추론한다.

과학 연구에서는 비전과 모델 추론을 결합한 결과가 제시됐다. 바이러스 외피 단백질 어셈블리 예측 태스크에서 전문 단백질 언어 모델을 능가했다. 약물 설계 속도는 약 10배 빨라졌고, 14개 단백질 타깃 가운데 9개에서 강력한 후보 물질을 생성했다.

138개 동물 종을 대상으로 한 유전체학 자율 연구도 수행했다. 이 과정에서 사이언스(Science) 저널에 게재된 모델보다 100배 작은 커스텀 ML 모델을 구축하고 그 성능을 능가했다.

일반 API와 승인 파트너를 가르는 접근 계층

Fable 5와 Mythos 5의 차이는 모델 사양보다 누가 어떤 경로로 접근할 수 있는지에서 선명하게 드러난다.

Mythos 기반 모델Fable 5(안전 가드레일 적용)Mythos 5(가드레일 해제)일반 APIclaude.ai 구독AWS/GCP/AzureProject Glasswing(정부 사이버방어)선별 생물의학연구기관

Fable 5는 Anthropic API와 claude.ai의 Pro/Max/Team/Enterprise 요금제에서 사용할 수 있다. 클라우드 경로로는 AWS Bedrock, Google Vertex AI, Microsoft Foundry가 지원된다.

가드레일이 해제된 Mythos 5는 일반 API에 공개되지 않는다. 미국 정부 사이버방어 조직인 Project Glasswing 파트너와 선별된 생물의학 연구기관으로 접근 범위가 제한된다.

가격은 두 모델 모두 입력 $10/1M 토큰, 출력 $50/1M 토큰이다. 프롬프트 캐싱을 사용하면 입력에 최대 90% 할인이 적용된다. 미국 전용 추론은 입출력 모두 1.1배 멀티플라이어가 붙는다. Fable 5는 2026년 6월 22일까지 Pro/Max/Team/Enterprise에 추가 비용 없이 포함되며, 6월 23일부터 사용 크레딧이 차감된다.

이 구조는 제품 이름만 나눈 것이 아니다. 동일한 기반 모델의 안전 계층을 가변적으로 구성하고, 규제 기관과 기업, 연구자, 일반 사용자에게 서로 다른 위험 프로파일을 제공한다. 향후 AI 배포 표준화 논의에서 참조 아키텍처로 기능할 가능성이 높다.

프런티어 LLM은 작업별로 선택해야 한다

2026년 상반기의 프런티어 LLM 시장은 단일 모델이 모든 영역을 지배하는 구조가 아니다. 코딩, 멀티모달 처리, 구조화된 출력, 비용과 처리량 등 작업 성격에 따라 적합한 모델이 달라진다.

벤치마크 Claude Fable 5 GPT-5.5 Gemini 3.1 Pro
SWE-Bench Pro 80.3% 58.6% 54.2%
FrontierCode Diamond 29.3% 5.7% -
Terminal-Bench 2.1 88.0% - -
에이전틱 작업 평균 85.2 - 77.2
멀티모달 평균 92.4 - 83.8
환각(Hallucination) 비율 36.18% 85.53% 49.87%

Claude Fable 5는 에이전틱 코딩과 장기 자율 작업, 낮은 환각률에 강점이 있다. 복잡한 코드베이스 마이그레이션과 과학 연구 자동화, 멀티모달 문서 분석에서 현존 최고 성능을 보인다.

GPT-5.5는 범용 추론과 구조화된 출력에서 경쟁력을 유지한다. 복잡한 수학·논리 추론이나 JSON/XML 형식을 요구하는 워크플로우가 대표적이다.

Gemini 3.1 Pro와 3.5 Flash는 가격 대비 성능과 고볼륨 에이전트 루프 처리에서 우위를 보인다. 멀티모달 그라운딩 태스크에서도 경쟁력 있는 성능을 유지한다.

이런 차이 때문에 엔터프라이즈 환경에서는 단일 모델에 의존하기보다 작업별 모델 라우팅을 적용하는 방식이 보편화되고 있다. Fable 5와 Mythos 5의 이중화 배포 역시 안전 제약과 성능 상한을 명시적으로 분리해 서로 다른 사용자 집단을 수용하려는 시도다.

다만 안전 계층을 나눴다고 문제가 사라지는 것은 아니다. 정상적인 보안 개발까지 제한할 수 있는 분류기 정밀도, 가드레일이 해제된 모델에 대한 접근 통제의 공정성, 파트너 선정 기준의 투명성은 계속 검토해야 할 영역이다.

2026년 하반기에는 Gemini 4.0과 GPT-6의 출시가 예고돼 있다. 모델 경쟁이 가속화될수록 벤치마크 점수만으로 제품을 고르기는 어려워진다. 실제 프로덕션 환경에서의 신뢰성, 안전성, 비용 효율성을 함께 평가하는 기준이 엔터프라이즈 채택에서 더 큰 비중을 차지하게 될 전망이다.

Sources

Claude프런티어 모델에이전틱 코딩모델 라우팅AI 안전