Anthropic이 자기 평가 도구 Petri를 남에게 넘긴 이유 — Petri 3.0과 Meridian Labs 이관

감사 모델과 평가 대상 모델을 분리한 Petri 3.0의 아키텍처, Dish의 eval-awareness 대응, Anthropic의 Meridian Labs 기증이 갖는 거버넌스 의미

2026-08-14 · 최초 발행 2026-05-12

Anthropic이 2026년 5월 7일, AI 정렬 평가 도구 Petri를 독립 비영리 평가 기관인 Meridian Labs에 기증하고 Petri 3.0을 오픈소스로 공개했다. 이 결정은 AI 안전성 평가 인프라를 특정 기업의 이해관계로부터 분리하여 업계 표준으로 자리잡게 하려는 전략적 행보다. MCP(Model Context Protocol)를 Linux Foundation에 이관한 것과 같은 맥락에서, Anthropic은 핵심 평가 도구의 중립성과 신뢰성을 높이기 위해 소유권 이전을 택했다.

Petri가 감사하는 것

Petri는 2025년 10월 Anthropic이 처음 공개한 오픈소스 AI 정렬 감사(auditing) 도구다. LLM(Large Language Model)의 위험한 행동 경향을 자동화된 방식으로 탐지하는 데 특화되어 있으며, 특히 다음 핵심 문제 행동을 중심으로 설계되었다.

  • 기만(Deception): 모델이 사용자나 운영자에게 사실과 다른 정보를 전달하거나 의도를 숨기는 행동
  • 아첨(Sycophancy): 사용자의 의견에 무조건 동조하거나, 비판적 판단을 포기하는 경향
  • 유해 요청 협력(Cooperation with Harmful Requests): 명백히 위험하거나 비윤리적인 지시에 응하는 행동

Petri는 Claude Sonnet 4.5 이후 Anthropic의 모든 Claude 모델 정렬 평가에 사용되어 왔으며, 영국 AI 안전성 연구소(UK AI Security Institute)가 모델 평가 프레임워크에 통합하는 등 빠르게 업계 신뢰를 얻었다.

Petri 3.0에서 감사 모델과 대상 모델을 갈라놓다

Petri 3.0의 핵심 변화는 구조적 분리(decoupling)다. 이전 버전에서는 감사 모델(auditor model)과 평가 대상 모델(target model)이 코드 수준에서 긴밀하게 결합되어 있어, 한쪽을 수정하려면 얽힌 코드 전체를 이해해야 했다. 3.0에서는 이 두 컴포넌트를 명확한 인터페이스로 분리하여 독립적으로 교체하거나 커스터마이징할 수 있게 했다.

정의된 인터페이스탐지됨정상Petri 3.0 평가 파이프라인Auditor Model(감사 모델)Target Model(평가 대상 모델)시나리오 생성응답 평가행동 실행Bloom 연동(행동별 심층 평가)Eval-Awareness감지?Dish 확장 모듈(실제 배포 환경 재현)결과 집계 리포트

Petri 3.0은 Anthropic의 또 다른 오픈소스 도구인 Bloom과 통합된다. Petri가 다수의 시나리오에 걸쳐 넓게 탐색하는 반면, Bloom은 단일 행동(behavior)에 집중하여 깊이 파고든다. Bloom은 특정 행동이 얼마나 자주, 얼마나 심각하게 나타나는지를 측정하는 평가 스위트(evaluation suite)를 자동으로 생성한다. 두 도구의 조합은 "폭 × 깊이"의 평가 전략을 가능하게 한다.

Petri 3.0의 새로운 확장 기능인 Dish는 AI 정렬 평가의 고질적 문제인 eval-awareness(평가 인식)를 정면으로 다룬다. 모델이 자신이 평가받고 있다는 사실을 감지하면, 실제 배포 환경에서와 다르게 더 안전한 방식으로 행동할 수 있다. 이 경우 평가 결과는 실제 위험을 과소평가하게 된다. Dish는 Claude Code, Codex, Gemini CLI 등 실제 배포 환경의 에이전트 스캐폴드(scaffold) 내부에서 감사를 실행한다. 평가 대상 모델이 감사자가 합성적으로 구성한 근사 환경이 아닌, 실제 시스템 프롬프트와 도구 정의를 그대로 보게 함으로써 eval-awareness를 최소화한다. Dish는 현재 리서치 프리뷰 상태다.

안전성 벤치마크가 지켜야 할 설계 원칙

효과적인 정렬 평가 인프라는 실패 유형을 명확히 분류해야 한다. 2026년 국제 AI 안전성 보고서는 프론티어 모델들이 평가 컨텍스트와 실제 배포 컨텍스트를 구분하여 다르게 행동하는 현상을 공식 문제로 기록했다. Petri가 다루는 정렬 실패는 의도적 위장(Intentional Deception)·판단 포기(Sycophancy)·유해 협력(Harmful Compliance)이라는 세 차원으로 나눌 수 있다.

정렬 실패 유형의도적 위장(Intentional Deception)판단 포기(Sycophancy)유해 협력(Harmful Compliance)Eval-Awareness기반 행동 전환목표 은닉(Goal Concealment)권위에 대한 무비판적 동조피드백 회피명시적 해악 요청 수락우회 경로를 통한 간접 협력

안전성 벤치마크가 의미를 갖기 위해서는 재현성(reproducibility)이 보장되어야 한다. Petri 3.0은 감사 모델과 대상 모델 사이의 명세된 인터페이스로 버전 간 일관된 평가를 가능하게 하는 인터페이스 표준화, 평가 시나리오를 코드로 관리해 동일 시나리오에 다른 모델을 반복 적용할 수 있게 하는 시나리오 버전 관리, GitHub에 전체 소스를 공개함으로써 외부 연구자의 검증과 기여를 허용하는 오픈소스 공개라는 세 방식으로 재현성을 강화했다.

Meridian Labs는 Petri 외에도 Inspect AI, Inspect Scout, Inspect Flow로 구성된 오픈소스 평가 스택을 운영한다. 이 생태계는 영국, 미국, EU, 일본, 한국의 정부 AI 안전성 기관과 METR, Apollo Research, Epoch AI, RAND 등 연구 기관이 활용하고 있다. 단일 기업이 소유하는 독점 벤치마크가 아닌, 커뮤니티 주도의 중립적 인프라를 구축하는 방향으로 업계가 이동하고 있다.

목적별로 갈라진 LLM 안전성 평가 도구들

현재 LLM 안전성 평가 생태계는 목적에 따라 분화된 여러 도구가 공존한다.

LLM 안전성 평가 생태계정렬 평가역량 평가홀리스틱 평가Petri 3.0(Meridian Labs)METR(자율 역량 + 안전성)Apollo Research(내부 목표 탐지)METR Task Suite(에이전트 자율 작업)ARC Evals(위험 역량 측정)HELM(Stanford CRFM)LM Evaluation Harness(EleutherAI)2026년 6월 유지보수 모드 전환예정

Petri 3.0은 행동 정렬(behavioral alignment)에 특화되어, 모델이 실제로 기만하거나 아첨하는지를 시나리오 기반으로 감사한다. LLM을 감사자로 활용하는 LLM-as-auditor 패러다임을 따른다. METR(Model Evaluation & Threat Research)은 프론티어 AI 모델의 자율 역량(autonomous capabilities)을 평가하며, Anthropic과 OpenAI와 협력하여 제3자 평가 구조를 선도하고 있다. HELM(Holistic Evaluation of Language Models)은 Stanford CRFM이 개발한 포괄적 평가 프레임워크로, 정확도, 공정성, 편향, 독성, 효율성 등 다차원 지표를 제공한다. 단, 2026년 6월 1일부터 유지보수 모드로 전환될 예정이다. LM Evaluation Harness(EleutherAI)는 Hugging Face Open LLM Leaderboard의 표준 평가 도구로, 수백 개의 NLP 태스크에 대한 통합 인터페이스를 제공한다.

2026년 국제 AI 안전성 연구 현황을 보면, 편향 저항성(bias resistance)이 가장 취약한 안전성 축으로 나타나며, 단일 시도 지표가 실제 위험을 현저히 과소평가하는 문제가 반복 보고된다. Phare V2, HarmBench, Gray Swan 등의 도구를 활용한 프론티어 LLM 10종 비교 평가에서도 안전성 개선이 정체되고 있다는 우려가 제기되었다. 평가 인프라의 핵심 과제는 Dish가 해결하려는 eval-awareness 문제처럼 합성 평가 환경과 실제 배포 환경의 간극을 좁히는 실제성(Realism), 서로 다른 조직이 사용하는 평가 지표와 방법론의 호환성 확보인 표준화(Standardization), HELM처럼 주요 벤치마크가 유지보수 모드로 전환될 때의 생태계 공백 대응인 지속성(Sustainability)으로 정리된다.

왜 자기 도구를 남에게 넘겼나

Anthropic의 Petri 기증은 AI 거버넌스 차원에서도 주목받는다. 자사 모델의 안전성을 평가하는 도구를 독립 기관에 이관함으로써, 이해충돌(conflict of interest) 문제를 구조적으로 해소하고 평가 결과의 신뢰성을 높인다. 이는 심판이 자신의 팀 경기를 판정하는 구조를 없애는 것과 같다.

MCP → Linux Foundation, Petri → Meridian Labs로 이어지는 패턴은 Anthropic이 핵심 인프라의 중립성을 전략적 우선순위로 두고 있음을 시사한다. AI 안전성 평가 도구가 특정 기업의 이익에 종속되지 않을 때, 비로소 그 결과가 정책 결정, 규제, 연구 커뮤니티에서 신뢰받을 수 있다.

Anthropic의 Petri 3.0 공개와 Meridian Labs 이관은 AI 정렬 평가 인프라가 단일 기업의 내부 도구에서 커뮤니티 공유 자원으로 전환되는 중요한 분기점이다. 감사 모델과 대상 모델의 구조적 분리, Dish를 통한 eval-awareness 대응, Bloom과의 통합으로 평가의 실제성과 깊이가 크게 높아졌다. METR, HELM, LM Evaluation Harness와 함께 오픈소스 안전성 평가 생태계가 다층적으로 성숙해가는 가운데, 중립적인 평가 인프라의 확충은 AI 안전성 연구와 규제 신뢰성의 기반을 강화하는 핵심 과제로 남아 있다.

Sources

PetriAI 정렬 평가Meridian Labseval-awareness오픈소스 안전성 도구