Anthropic J-Lens로 읽는 언어 모델 내부 개념 표현

Anthropic J-Lens의 평균 야코비안 투사 방식과 J-Space 개념을 중심으로 모델 해석성, 안전성 점검, 감사 거버넌스 적용 방안을 정리한다.

2026-08-31 · 최초 발행 2026-07-26

출력 직전의 내부 표현을 어휘로 읽는 방법

Anthropic이 2026년 7월 초 공개한 Jacobian Lens(J-Lens)는 언어 모델이 출력을 만들기 직전 어떤 개념을 활성화하고 있는지 분석하는 오픈소스 해석성 도구다. 코드 저장소 anthropics/jacobian-lens는 7월 2일, 연구 발표는 7월 6일 공개됐다. 연구 논문은 “Verbalizable Representations Form a Global Workspace in Language Models”이며, Transformer Circuits 기고문과 공식 연구 공지가 함께 나왔다.

J-Lens의 핵심은 중간 레이어 활성값을 평균 야코비안(averaged Jacobian)으로 출력 공간에 투사하는 데 있다. 이 결과를 어휘 토큰 순위로 풀어내면, 모델 내부 활동이 앞으로 어떤 단어의 생성 확률에 기여하는지를 볼 수 있다.

Apache-2.0 라이선스의 Python 구현으로 제공되며, 오픈 웨이트 모델을 대상으로 한 Neuronpedia 인터랙티브 데모도 마련돼 있다. 분석 과정에서는 J-Space라는 내부 구조가 발견됐다. 이는 모델 활동의 10분의 1 미만 규모에서 수십 개 개념을 동시에 담는 소수의 내부 패턴 집합이다. 연구는 이 공간을 모델이 보고·통제·추론에 사용할 수 있는 ‘언어화 가능한(verbalizable)’ 표현이 모이는 글로벌 워크스페이스로 설명하며, 그 아래의 자동적 처리와 구분한다.

활성값에서 토큰 순위까지 이어지는 분석 경로

분석은 특정 레이어와 토큰 위치의 잔차 스트림(residual stream) 활성 벡터에서 시작한다. 관심사는 단순하다. 이 내부 활성값이 이후 생성될 토큰 확률에 어느 방향으로 작용하는가다.

활성값에서 출력 로짓까지 이어지는 비선형 변환은 국소적으로 선형화된다. 여러 입력에서 얻은 야코비안을 평균하면 특정 문맥에 덜 묶인 일반적 사상(mapping)을 얻을 수 있다. 이를 바탕으로 어휘 전체의 각 단어에 대해 해당 내부 활동이 미래 생성 확률에 미치는 평균 선형 효과를 계산한다.

투사된 벡터는 어휘 차원에서 순위 목록(ranked token list)으로 제시된다. 상위 토큰은 모델이 말하려는 경향이 있는 개념군으로 해석할 수 있다. 많은 활성값의 투사 결과를 모으면 반복적으로 나타나는 저차원 부분공간이 보이며, 이것이 J-Space 탐색으로 이어진다.

디버깅안전성연구입력 프롬프트순전파 (Forward Pass)중간 레이어 활성값 추출평균 야코비안 산출 (국소 선형근사)출력 공간 투사어휘 토큰 순위 목록J-Space 부분공간 식별 (수십 개념 동시 보유)활용 목적오류·환각 발생 지점 추정위험 개념 활성 점검개념 표현 구조 분석

Neuronpedia 데모에서는 레이어와 토큰 위치별 투사 결과를 대화형으로 살필 수 있다. 특정 응답이 산출되기 직전 무엇이 활성화됐는지 확인하면, 오류나 환각이 발생한 지점을 추정하는 단서가 된다.

자체 모델 분석에 맞춘 적용 범위

J-Lens는 내부 활성값에 접근해야 하므로 상용 API 모델에는 적용할 수 없다. 적용 대상은 가중치 접근이 가능한 오픈 웨이트 모델이나 자체 모델로 한정된다.

도입은 오픈 웨이트 모델 파일럿에서 시작해 팀의 판독 역량을 확보하는 방식이 적절하다. 이후 사내 파인튜닝 모델에 적용해 도메인별 오류 패턴을 분석하고, 안전성 점검 파이프라인의 정기 검사 항목으로 편입할 수 있다.

환각 응답을 분석할 때는 응답 직전의 활성값을 투사해 잘못된 개념이 어느 레이어에서 부상하는지 추적한다. 프롬프트 변형 실험을 함께 수행하면, 특정 지시가 개념 활성에 미치는 영향을 비교할 수 있다.

안전성 점검에서는 공격 기법·개인정보·규제 대상 주제처럼 위험한 개념의 활성 여부를 배포 전 표본 검사로 확인할 수 있다. 출력 필터가 차단한 사례와 내부 활성 신호를 함께 보면 필터의 오탐과 미탐 원인을 분석하는 데 도움이 된다.

야코비안 산출에는 다수의 순전파와 행렬 연산이 필요하다. GPU 시간과 저장소를 고려하면 전수 검사는 부담이 크므로 표본 검사로 설계해야 한다. 모델 내부 구조를 이해하고 결과를 판독할 역할도 명시적으로 배정할 필요가 있다. 모델 버전, 레이어, 프롬프트, 분석 결과는 재현 가능한 형태로 보관하고, 해석 결과를 근거로 한 수정·차단 결정에는 승인 절차와 책임 소재를 남겨야 한다.

Logit Lens와 블랙박스 평가가 다른 지점

구분 J-Lens (야코비안 투사) Logit Lens 계열 출력 기반 블랙박스 평가
접근 정보 중간 레이어 활성값 중간 레이어 활성값 최종 출력만
투사 방식 평균 야코비안(국소 선형화) 언임베딩 행렬 직접 적용 해당 없음
문맥 의존성 평균화로 완화 레이어 정합성에 민감 프롬프트 설계에 종속
산출물 어휘 토큰 순위 + 개념 부분공간 어휘 토큰 순위 정답률·품질 점수
가중치 접근 필수 필수 불필요
연산 비용 높음 중간 낮음
적용 대상 오픈 웨이트·자체 모델 오픈 웨이트·자체 모델 모든 모델(API 포함)

Logit Lens 계열은 중간 활성값에 언임베딩 행렬을 직접 적용한다. 방식은 단순하지만 레이어별 표현 정합성이 깨지는 구간에서는 해석이 왜곡될 수 있다. J-Lens는 다수 입력의 야코비안을 평균해 국소 선형 사상을 추정하므로 문맥 종속 왜곡을 완화하며, J-Space라는 구조적 발견까지 도출했다.

출력 기반 블랙박스 평가는 비용이 낮고 API를 포함한 모든 모델에 적용할 수 있다. 반면 실패 원인을 설명하지는 못한다. 내부 활성 기반 해석은 원인 규명 능력을 제공하지만 가중치 접근과 연산 비용을 요구한다. 따라서 두 방식은 경쟁 관계가 아니라 서로의 한계를 메우는 조합으로 보는 편이 맞다.

야코비안 계산을 상시 운영에 넣는 것은 부담이 크다. 배포 전 게이트와 사고 조사 시점에 한정한 표본 분석이 비용 대비 실익이 큰 적용 방식이다.

설명가능성과 감사 추적성에 주는 의미

내부 표현을 관측하는 방식은 XAI(eXplainable AI)의 사후 설명(post-hoc explanation)을 모델 내부 증거로 보강한다. 출력 근거를 모델이 스스로 서술한 설명에만 의존하지 않게 된다는 점에 의미가 있다.

J-Space가 언어화 가능한 표현의 집합이라는 발견은 모델의 자기보고와 실제 내부 상태가 얼마나 정합적인지 검증할 실마리도 제공한다. AI 사고 조사에서 재현 가능한 내부 증거를 확보할 수 있다는 점은 감사 추적성 요건과도 연결된다.

다만 상용 API 의존 조직은 가중치에 접근할 수 없다는 제약을 안고 있다. 감사 가능성을 조달 요건으로 명시하거나, 오픈 웨이트 모델의 병행 운영을 검토할 수 있다. 해석 결과는 오독될 위험이 있으므로 판독 기준과 검증 절차를 문서화하고, 단일 분석 결과만으로 수정이나 차단을 결정하지 않는 원칙이 필요하다.

J-Space 연구가 향하는 방향

Apache-2.0 오픈소스 공개를 계기로 오픈 웨이트 모델 생태계에서 J-Lens 기반 분석 도구와 플러그인이 확산될 전망이다. J-Space 구조를 활용한 개념 단위 제어(concept steering) 연구도 안전성과 정렬(alignment) 분야의 주요 축으로 부상할 수 있다.

해석성 분석은 연구 영역을 넘어 모델 배포 전 점검 항목으로 편입되고, AI 거버넌스 프레임워크에도 내부 관측 요건이 반영되는 흐름이 예상된다. 상용 API 모델과의 해석성 격차가 커질수록 감사 가능성을 이유로 자체 호스팅 오픈 웨이트 모델을 병행하는 이원 구성도 늘어날 가능성이 있다.

J-Lens는 평균 야코비안으로 중간 활성값을 출력 공간에 투사해, 모델이 말하기 직전의 개념을 어휘 순위로 읽는 도구다. 인터랙티브 데모와 오픈소스 구현으로 진입 장벽은 낮아졌지만, 연산 비용과 판독 전문성은 여전히 제약이다. 조직에서는 배포 전 게이트와 사고 조사에 한정한 표본 분석부터 시작하고, 가중치 접근 가능성을 조달 단계에서 판단하는 것이 현실적인 경로가 된다.

Sources

LLM 해석성Jacobian LensJ-Space설명가능 AIAI 거버넌스