Claude Fable 5·Mythos 5 탈옥과 LLM 안전 가드레일 설계
Claude Fable 5·Mythos 5 탈옥 사례를 바탕으로 프롬프트 인젝션, Constitutional AI, 다층 필터링과 기업 모니터링 설계를 정리한다.
2026-08-14 · 최초 발행 2026-08-02
Claude Fable 5 사건이 드러낸 방어의 빈틈
2026년 상반기 Amazon 연구자들은 특정 프롬프트 패턴으로 Claude Fable 5가 취약점 악용 코드를 출력하게 만드는 jailbreak 기법을 발견했다. 미국 상무부는 국가안보를 이유로 외국인의 모델 접근을 일시 차단했고, 2026년 6월 30일 수출 통제를 해제했다.
이 사건은 성능이 높은 LLM도 완전한 안전 가드레일을 구현하기 어렵다는 점을 보여줬다. 기업이 AI를 배포할 때 Constitutional AI와 모델 자체의 거부 정책만 믿을 수 없는 이유이기도 하다. 모델 안팎에 방어선을 배치하고, 배포 후에도 공격 패턴을 관찰하는 운영 구조가 필요하다.
탈옥은 컨텍스트와 요청 구조를 함께 파고든다
Jailbreak는 LLM의 안전 정책을 우회해 유해하거나 금지된 콘텐츠를 생성하도록 유도하는 기법이다. Claude Fable 5 사례에는 단순한 역할극보다 모델의 컨텍스트 추론을 정교하게 조작하는 고급 패턴이 쓰인 것으로 알려졌다.
프롬프트 인젝션(Prompt Injection)은 사용자 입력에 시스템 지시처럼 보이는 문장을 넣어 기존 지시를 덮어쓰려 한다. "이전 지시를 무시하고..." 같은 표현이 전형적이다. RAG 파이프라인에서는 검색한 문서에 악성 지시가 들어 있는 간접 인젝션으로 이어질 수 있다.
페르소나 조작(Persona Manipulation)은 안전 정책이 없는 다른 AI처럼 행동하라고 모델을 유도한다. DAN(Do Anything Now) 형태의 역할극이 대표적이다. 최신 모델은 이런 패턴을 탐지하도록 훈련됐지만, 여러 단계로 세분화한 페르소나에는 여전히 취약할 수 있다.
컨텍스트 오염(Context Poisoning)은 무해한 요청에서 출발해 대화 히스토리를 점진적으로 바꾸면서 판단 경계를 흐린다. Claude Fable 5 사례에서 활용된 기법과 유사한 것으로 분석된다. 다단계 분할 요청(Multi-turn Fragmentation)도 개별 요청은 무해하게 보이게 하면서, 여러 응답을 조합하면 안전 정책을 위반하는 콘텐츠가 완성되도록 만든다.
인코딩 우회(Encoding Bypass)는 Base64, ROT13, 유니코드 변환 같은 중간 표현을 끼워 안전 필터를 피한다. 모델이 내용을 디코딩한 뒤에도 유해성을 제대로 판별하지 못하게 만드는 방식이다.
Constitutional AI가 모델 안에 심는 판단 기준
Anthropic의 Constitutional AI(CAI)는 응답 바깥에서 콘텐츠를 거르는 데 그치지 않고, 모델이 헌법적 원칙에 맞춰 자신의 행동을 조정하도록 훈련하는 아키텍처다.
첫 단계인 Supervised Learning CAI(SL-CAI)에서는 Constitution이라 부르는 원칙 목록을 기준으로 모델이 자신의 답변을 비판하고 수정한다. 이 피드백 루프에서 파인튜닝 데이터가 만들어진다. 이어지는 Reinforcement Learning CAI(RL-CAI)는 인간 피드백 대신 AI 피드백을 사용하는 RLAIF로 강화학습을 수행하며, 무해성과 유용성 사이의 균형을 최적화한다.
Anthropic이 공개한 헌법 원칙은 세 범주로 나뉜다. UN 인권선언과 국제법에 기반한 보편적 윤리 원칙, 해킹 도구·생화학 무기·아동 착취 콘텐츠 같은 절대적 금지 항목, 정치적 편향·사회적 해악·개인정보 침해처럼 맥락 판단이 필요한 회색 지대 원칙이다. Claude Fable 5와 Mythos 5에서는 이 원칙이 더 세분화되고 계층화됐으며, 사이버보안 영역의 이중사용(dual-use) 정보 판별 기준도 강화됐다.
모델 앞뒤에 방어선을 겹쳐 놓는 구조
프로덕션의 LLM 안전성은 모델 내부 가드레일 하나로 해결되지 않는다. 입력부터 응답 전달 이후의 관찰까지 시스템 전체에 심층 방어(Defense in Depth)를 적용해야 한다.
이 구조에서는 하나의 방어선이 우회돼도 다음 레이어가 유해 콘텐츠를 다시 검사한다. 각 레이어는 독립적으로 동작하면서도 서로 신호를 공유해 누적 판단에 활용한다.
입력 전처리에서는 프롬프트 인젝션 탐지기를 먼저 통과시킨다. 정규식과 키워드 블랙리스트를 사용하는 규칙 기반 패턴 매칭에 소형 분류 모델을 결합한 하이브리드 방식이 효과적이다. 토큰 수 제한, 메타데이터 검증, Base64·유니코드 디코딩 후 재검사하는 인코딩 정규화도 이곳에서 처리한다.
대화 하나만 검사해서는 컨텍스트 오염을 잡기 어렵다. 세션별 위험도 점수를 누적하고, 임계값을 넘으면 세션을 재설정하거나 에스컬레이션하는 관리 장치가 필요하다.
모델이 응답을 만든 뒤에는 별도의 분류 모델로 결과를 검토한다. OpenAI Moderation API, Google Perspective API, 자체 개발 분류기를 앙상블로 운용하면 단일 모델의 맹점을 보완할 수 있다. 판정 결과는 (1) 즉시 통과, (2) 수정 후 전달, (3) 차단 및 경고, (4) 에스컬레이션의 4단계 액션으로 연결한다.
Fable 5·Mythos 5 세대 모델은 텍스트와 함께 이미지, 코드, 구조화된 데이터를 처리한다. 따라서 이미지에 숨긴 텍스트 지시를 이용하는 스테가노그래피 기반 인젝션, 코드 실행 환경의 탈출 시도, JSON/XML 구조를 이용한 구조적 인젝션을 각각 검사할 레이어가 필요하다.
레드팀은 출시 전 평가와 배포 후 검증을 잇는다
레드팀 평가는 출시 전에 취약점을 체계적으로 찾아 수정하는 프로세스다. Anthropic, Google DeepMind, OpenAI는 모두 외부 레드팀 참여를 표준화하고 있다. Claude Fable 5 사태는 취약점이 출시 후 발견됐을 때의 위험을 다시 확인시켰다.
자동화 레드팀(Automated Red-Teaming)은 공격 LLM이 방어 LLM을 공략하도록 구성해 수천 개의 adversarial 프롬프트를 자동으로 생성하고 평가한다. Anthropic의 Constitutional AI 논문에서 처음 제안된 뒤 업계 표준으로 자리 잡은 방식이다.
자동화만으로 특수 영역의 허점을 모두 찾기는 어렵다. 전문가 레드팀(Expert Red-Teaming)은 사이버보안, 바이오, 화학무기 분야의 전문 지식을 갖춘 인력이 평가에 참여한다. Claude Fable 5 사태와 같은 특수 도메인 취약점을 찾는 데 필요한 방식이다.
크라우드소스 레드팀(Crowdsourced Red-Teaming)은 버그 바운티와 비슷하게 외부 보안 연구자가 취약점을 발견하면 보상한다. Amazon 연구자들이 Claude Fable 5의 취약점을 발견한 사례도 이 범주에 속한다.
평가 결과는 공격 성공률(Attack Success Rate, ASR), 탈출까지 필요한 평균 시도 횟수(Mean Attempts to Jailbreak, MATJ), 카테고리별 취약점 분포, 패치 후 회귀 테스트 통과율로 정량화한다. Anthropic은 모델 카드에 일부 지표를 공개하지만, 경쟁사가 벤치마크로 활용할 위험 때문에 구체적인 수치는 제한적으로 공개하는 추세다.
기업 통제는 정책과 파이프라인에서 완성된다
기업이 LLM을 도입할 때는 모델 제공사의 안전 기능에 조직 차원의 정책과 기술적 통제를 더해야 한다.
정책은 세 축으로 구성한다. 사용 정책(Acceptable Use Policy)은 금지, 허용, 조건부 허용 사례를 구분한다. 기술적 통제에는 입출력 필터링, 감사 로그, 접근 제어, 사용량 한도를 포함한다. 거버넌스 프로세스에는 정기 위험 평가, 인시던트 대응 절차, 취약점 공시 정책을 둔다.
실시간 탐지 파이프라인은 프롬프트 로그 수집과 스트리밍 처리, 실시간 분류 모델 추론 서버, 이상 패턴 탐지 알고리즘, 알림 및 에스컬레이션 워크플로우, 포렌식 분석용 장기 로그 보존 스토리지를 연결한다. 스트리밍 처리에는 Apache Kafka, AWS Kinesis 등을 사용할 수 있으며, 이상 탐지는 통계적 이상치 탐지와 ML 기반 분류를 활용한다.
대시보드에는 카테고리별 차단 건수, 시간대별 공격 패턴, 신규 공격 유형 자동 클러스터링, 사용자별 위험도 점수를 표시한다. 프롬프트 로그를 다루는 만큼 익명화와 최소 보존 기간 정책도 함께 정해야 한다.
출력 검증은 API 게이트웨이에서 모델 응답을 가로채 처리한다. 유해 콘텐츠 분류, PII와 기밀 코드 같은 민감 정보 마스킹, 응답 일관성 검사, 사실 확인(Fact-checking)이 검증 대상이다. 실패하면 자동 재생성 요청, 사용자 통보, 운영팀 알림으로 단계적으로 대응한다.
내재화와 외부 필터를 함께 보는 법
Anthropic Constitutional AI, OpenAI Moderation API, Google Safety Filters는 안전성을 적용하는 위치와 설계 철학이 서로 다르다.
| 구분 | Anthropic Constitutional AI | OpenAI Moderation API | Google Safety Filters |
|---|---|---|---|
| 핵심 철학 | 모델 내재화 (훈련 단계 통합) | 외부 API 분류 (사후 검증) | 다층 자동화 필터 |
| 투명성 | 헌법 원칙 일부 공개 | 분류 카테고리 공개 | Safety Settings 파라미터 공개 |
| 커스터마이징 | 시스템 프롬프트 제한적 조정 | 임계값 조정 가능 | HarmCategory별 임계값 조정 |
| 멀티모달 지원 | 텍스트·이미지·코드 통합 | 텍스트 중심, 이미지 베타 | 텍스트·이미지·비디오 통합 |
| 레이턴시 영향 | 낮음 (모델 내장) | 추가 API 호출 (10-50ms) | 중간 (필터 복잡도에 따라 상이) |
| 한계 | 최신 공격 패턴 적응 지연 | 분류기 자체가 우회 대상 | False Positive 비율 높음 |
2026년 NIST AI Security Benchmark에서는 세 시스템 모두 일반적인 jailbreak 시도를 90% 이상 차단한다. 전문가 레드팀의 고급 공격에서는 차단율이 60-75% 수준으로 내려간다. Claude Fable 5 사례처럼 특수 도메인 지식을 이용한 정교한 공격에는 세 시스템 모두 취약점이 있다. 어느 한 솔루션에 방어를 맡기기보다 서로 다른 레이어를 조합해야 하는 근거다.
안전성 감사는 최소 분기별 정기 감사와 새 공격 패턴이 발견됐을 때 수행하는 임시 감사로 나눈다. 모델 버전 업데이트에 따른 회귀 테스트, 새로운 jailbreak 기법의 취약점 검증, 시스템 변경이 안전성에 미치는 영향 평가를 감사 범위에 포함한다. 결과는 취약점 공시 정책(Responsible Disclosure)에 따라 모델 제공사에 먼저 알리고, 패치를 적용한 뒤 공개한다.
Claude Fable 5·Mythos 5 jailbreak 사태가 남긴 핵심은 안전성이 개발 단계에서 끝나는 일이 아니라는 점이다. Constitutional AI와 멀티레이어 가드레일은 방어의 출발점이다. 배포 뒤에도 레드팀 평가와 모니터링 파이프라인을 계속 운영하고, 모델 제공사의 가드레일과 조직의 기술적 통제·거버넌스를 병행해야 한다.
Sources
- Anthropic, "Constitutional AI: Harmlessness from AI Feedback", https://arxiv.org/abs/2212.08073
- NIST, "AI Risk Management Framework (AI RMF 1.0)", https://www.nist.gov/system/files/documents/2023/01/26/AI%20RMF%201.0.pdf
- Anthropic, "Claude's Model Card — Fable 5 / Mythos 5", https://www.anthropic.com/model-card
- OpenAI, "GPT-4o System Card and Moderation API", https://openai.com/index/gpt-4o-system-card
- Google DeepMind, "Gemini Safety and Responsibility Report", https://storage.googleapis.com/deepmind-media/gemini/gemini_1_report.pdf
- US Department of Commerce, "Export Control Updates for AI Models — June 2026", https://www.bis.doc.gov/
- MIT Technology Review, "Inside the Claude Fable 5 Jailbreak That Alarmed the US Government", https://www.technologyreview.com/