Steerling-8B — 출력 토큰을 학습 데이터까지 역추적하는 해석 가능 LLM

개념 분해 임베딩과 마스크드 디퓨전으로 모든 출력을 학습 데이터 소스까지 역추적하는 Guide Labs Steerling-8B의 아키텍처와 규제 산업 감사 적용

2026-08-14 · 최초 발행 2026-05-01

LLM이 생성한 텍스트가 어디서 비롯되었는지 추적할 수 없다는 한계는 AI 신뢰성 문제의 핵심이었다. Guide Labs가 공개한 오픈소스 Steerling-8B는 모든 출력 토큰을 학습 데이터 소스까지 역추적할 수 있는 해석 가능 아키텍처를 도입하여 이 문제에 정면으로 대응한다.

블랙박스 문제를 아키텍처로 풀기

기존 LLM은 방대한 파라미터 속에 지식을 압축 저장하므로, 특정 출력이 어떤 학습 데이터에서 비롯되었는지 추적하기 어렵다. 모델이 왜 특정 답변을 생성했는지 설명하지 못하는 이른바 블랙박스 문제는 AI 신뢰성과 규제 준수의 최대 장벽이다.

해석 가능 LLM은 이 문제를 해결하기 위해 모델 내부 표현을 인간이 이해 가능한 개념 단위로 분해하고, 각 출력 토큰의 생성 근거를 측정·감사·제어할 수 있도록 설계한다. Steerling-8B는 이 접근의 대표적 구현체로, "해석 가능성을 사후 도구가 아닌 아키텍처의 핵심 속성으로" 내재화한 최초의 80억 파라미터급 언어 모델이다.

임베딩을 개념 경로로 쪼갠 이유

Steerling-8B의 가장 핵심적인 기술 혁신은 모델 임베딩을 세 가지 명시적 경로로 분해하는 것이다.

  • 지도 학습 개념 (Known Concepts): 약 3만 3천 개의 인간 정의 개념. 학습 전 데이터를 추적 가능한 개념 범주로 사전 구조화하여 배정
  • 발견된 개념 (Discovered Concepts): 모델이 학습 과정에서 자율적으로 발견하는 약 10만 개의 잠재 특성
  • 잔차 (Epsilon): 위 두 경로로 설명되지 않는 재구성 보정값

이 분해 구조 덕분에 모든 출력 로짓(logit)은 개념 활성화값과 개념 임베딩의 선형 함수가 되며, 이는 곧 정확한 귀인(attribution)과 직접적 제어를 가능하게 한다.

입력 텍스트블록-인과 어텐션(64토큰 블록 양방향)개념 모듈지도 학습 개념(~33K Known)발견된 개념(~100K Discovered)잔차 Epsilon출력 로짓 계산(선형 함수)마스크드 디퓨전 디코딩(신뢰도 토큰 언마스킹)출력 토큰학습 데이터 역추적(ArXiv / Wikipedia / FLAN등)

Steerling-8B는 표준 자기회귀 LLM과 달리 마스크드 디퓨전(Masked Diffusion) 방식으로 텍스트를 생성한다. 추론 시 모델은 신뢰도 순서대로 마스크된 위치의 토큰을 반복적으로 언마스킹하며, 블록 내에서는 양방향 어텐션을, 블록 간에는 인과적 어텐션을 적용하는 블록-인과 어텐션(block-causal attention)을 사용한다. 블록 크기는 64토큰이다.

학습 효율성 측면에서 Steerling-8B는 1.35조 토큰으로 학습되었으며, 같은 벤치마크에서 2~7배 더 많은 데이터로 학습된 기존 모델들과 동등한 수준의 성능을 달성한다. Guide Labs는 "해석 가능성은 고정 비용처럼 작동한다"고 설명한다. 즉, 스케일링 법칙을 유지하면서 일정한 소규모 오버헤드만 추가된다는 의미다.

어디서 왔는지 보여주는 어트리뷰션

Steerling-8B가 특정 텍스트 청크를 생성할 때 내부적으로 어떤 개념이 활성화되었는지 확인하고, 해당 개념이 어느 학습 데이터 소스(ArXiv, Wikipedia, FLAN 등)에서 기원했는지 분포를 시각화할 수 있다. 이는 기존 LLM에서 사후 방식으로 적용하던 Attribution 기법과 근본적으로 다른 점이다.

기존 해석 가능성 접근법과의 비교를 표로 정리하면 다음과 같다.

기법 방식 정확도 추적 깊이
SHAP 사후 근사 근사적 특성 중요도
Attention 시각화 사후 시각화 제한적 토큰 가중치
Circuit Analysis 내부 순회 높음 서브네트워크
사실 추적 (Fact Tracing) RAG 연계 제한적 문서 단위
Steerling-8B 아키텍처 내재 정확 학습 데이터 소스

게임 이론의 샤플리 값을 기반으로 각 입력 특성이 예측에 기여하는 정도를 계산하는 SHAP(SHapley Additive exPlanations)은 사후 방식이므로 모델 아키텍처와 무관하게 적용할 수 있지만, 고차원 언어 공간에서의 계산이 근사적이며 학습 데이터 소스까지 역추적할 수 없다.

어텐션 헤드가 어느 토큰에 집중하는지 보여주는 Attention 시각화는 직관적이지만, 어텐션 가중치 자체가 중요도와 동일하지 않다는 비판이 있으며 다층 변환 후의 실제 의미 흐름을 포착하지 못한다.

모델 내부에서 특정 행동을 담당하는 서브네트워크(회로)를 역추적하는 Circuit Analysis는 해석 정밀도가 높지만 계산 비용이 크고, 회로가 모델 버전마다 변동하여 감사에 활용하기 어렵다.

앞선 세 기법이 모두 사후 방식인 데 반해, Steerling-8B는 아키텍처 설계 단계에서 해석 가능성을 내재화한다. 개념 모듈의 선형 구조 덕분에 어떤 개념이 출력에 기여했는지 정확하게 측정할 수 있으며, 재학습 없이 특정 개념을 증폭·억제하는 인퍼런스-타임 정렬(inference-time alignment)도 가능하다.

규제 산업에서 감사가 요구하는 것

의료 AI는 미국 FDA의 Software as a Medical Device(SaMD) 가이드라인과 EU AI Act의 고위험 AI 분류 요건에 따라 의사결정 근거 제공이 필수다. Steerling-8B처럼 출력마다 개념 기여도와 학습 데이터 출처를 추적할 수 있는 모델은 임상 의사결정 지원 시스템 감사 시 요구되는 설명 가능성 문서화를 자동화할 수 있다.

신용 평가, 자금 세탁 탐지, 투자 추천 알고리즘은 미국 Equal Credit Opportunity Act(ECOA)와 유럽 GDPR의 설명 요구 조항을 따라야 한다. 해석 가능 모델은 특정 결정에 어떤 개념이 영향을 미쳤는지 감사관에게 즉시 제시할 수 있어, 규제 보고 비용을 절감한다.

법률 AI가 판례 검색이나 계약서 분석 결과를 제시할 때, 해당 결론이 어느 법원 판례·법령 텍스트에서 도출되었는지 역추적할 수 있으면 변호사의 검토 부담이 감소하고 오류 책임 소재를 명확히 할 수 있다.

불투명 모델해석 가능 모델(Steerling-8B)AI 출력 생성규제 요건충족 여부?사후 XAI 도구 적용(SHAP / LIME)근사적 설명감사 불충분개념 기여도 즉시 추출학습 데이터 출처 역추적감사 보고서 자동 생성규제 준수 완료

블랙박스 모델을 바꾸려면

기존 블랙박스 LLM을 즉시 교체하는 것은 운영 위험을 수반한다. 실무적으로는 파일럿 도메인 선정, 벤치마크 대조 검증, 감사 파이프라인 구축, 인간 검토 루프 유지라는 단계적 접근이 권장된다.

규제 부담이 높고 감사 빈도가 잦은 도메인(의료 노트 요약, 계약서 위험 분류 등)부터 해석 가능 모델을 도입하고, 동일 태스크에서 기존 모델과 Steerling-8B의 성능을 비교해 해석 가능성 확보에 따른 성능 저하가 수용 가능한 수준인지 확인한다. 개념 활성화 기록을 로그로 저장하고, 감사 요청 시 해당 로그에서 학습 데이터 출처 리포트를 자동 생성하는 파이프라인을 설계하되, 고위험 결정에서는 모델 설명과 무관하게 전문가의 최종 검토를 유지한다. 해석 가능성은 검토를 대체하는 것이 아니라 검토의 효율을 높이는 도구다.

Steerling-8B는 Hugging Face(guidelabs/steerling-8b)와 GitHub(guidelabs/steerling)을 통해 오픈소스로 공개되어 있다. Guide Labs는 Y Combinator 출신 스타트업으로 2024년 11월 Initialized Capital로부터 900만 달러의 시드 투자를 유치했으며, 모델을 상업적 이용이 가능한 라이선스로 배포하고 있다.

Steerling-8B는 해석 가능성을 사후 보완 도구가 아닌 아키텍처의 핵심 속성으로 내재화한 최초의 8B 파라미터 LLM으로, 모든 출력 토큰을 학습 데이터 소스까지 역추적하는 개념 분해 임베딩 구조를 제시한다. 해석 가능 모델의 성능과 투명성 균형 문제는 여전히 진행 중인 연구 과제이지만, Steerling-8B는 그 실현 가능성을 80억 파라미터 규모에서 입증했다는 점에서 의미가 크다.

Sources

Steerling-8B해석 가능 AI학습 데이터 어트리뷰션AI 투명성Guide Labs