Steerling-8B: 모든 토큰의 출처를 훈련 데이터까지 역추적하는 해석 가능한 LLM
Guide Labs가 오픈소스로 공개한 Steerling-8B의 임베딩 분해 아키텍처, 개념 제어 기능, 기존 해석 가능성 방식과의 차이, 성능 트레이드오프를 정리한다.
2026-08-14 · 최초 발행 2026-03-13
LLM이 왜 그런 답변을 내놨는지 설명할 수 없다는 것은 AI 신뢰성의 근본적인 한계로 지적돼 왔다. Guide Labs는 2026년 2월, 모든 토큰의 생성 근거를 훈련 데이터까지 역추적 가능한 8B 파라미터 LLM Steerling-8B를 오픈소스로 공개하며 이 문제에 정면으로 도전했다. 기존 사후 해석(post-hoc interpretability) 방식이 아닌, 해석 가능성을 모델 아키텍처 자체에 내장한 세계 최초의 고유 해석 가능 언어 모델이다.
Guide Labs와 Steerling-8B
Guide Labs는 샌프란시스코 기반 AI 스타트업으로, CEO Julius Adebayo와 CSO Aya Abdelsalam Ismail이 공동 창업했다. Y Combinator 출신인 이 회사는 2024년 11월 Initialized Capital로부터 900만 달러의 시드 투자를 유치했으며, Steerling-8B는 이 회사의 핵심 기술력을 증명하는 최대 규모 프루프 오브 컨셉 모델이다.
Steerling-8B는 1.35조 토큰으로 훈련됐으며, 기존 동급 모델들이 2~7배 더 많은 데이터를 사용하는 것에 비해 적은 훈련 데이터로 동급 성능의 약 90%를 달성한다. 2026년 2월 23일 오픈소스로 공개됐다.
임베딩을 지도·발견·잔차로 쪼개는 아키텍처
Steerling-8B의 가장 중요한 혁신은 표준 자기회귀(autoregressive) 방식 대신 인과적 이산 확산 모델(causal discrete diffusion model) 백본을 채택하고, 임베딩을 세 개의 명시적 경로로 분해한다는 점이다.
경로 1 — 지도 개념 레이어: 사람이 이해할 수 있는 약 3만 3천 개의 사전 정의된 개념 범주로 데이터를 분류한다. 이 레이어가 모델의 핵심 추론을 담당하며, 전체 토큰 기여도의 84% 이상이 이 경로에서 발생한다.
경로 2 — 발견 개념 레이어: 모델이 훈련 과정에서 스스로 학습한 약 10만 개의 잠재 개념이다. 사전에 정의하지 않은 패턴을 포착하며, 개념 발견(concept discovery) 도구로 시각화하고 명명할 수 있다.
경로 3 — 잔차 레이어: 위 두 경로로 포착되지 않는 나머지 패턴을 저장한다. 이 레이어의 기여 비율을 모니터링함으로써 모델이 예상 외의 경로로 추론하는 시점을 감지할 수 있다.
훈련 데이터 추적부터 개념 제어까지, 해석 가능성 기능
훈련 데이터 출처 추적(Training Data Provenance): 생성된 모든 토큰 또는 텍스트 청크에 대해 어떤 훈련 데이터에서 비롯됐는지 역추적할 수 있다. 모델이 특정 사실을 인용할 때 그 사실의 원본 출처 문서까지 확인 가능하다. 저작권 침해 여부 확인, 허위 정보 원천 파악, 규제 컴플라이언스 감사에 직접 활용할 수 있다.
추론 시 개념 제어(Inference-Time Concept Steering): 재훈련 없이 특정 개념을 추론 시점에 억제하거나 증폭할 수 있다. 예를 들어 대출 심사 모델에서 "인종" 개념의 가중치를 0으로 설정하면, 수천 개의 안전성 훈련 예시 없이도 편향된 출력을 즉시 차단할 수 있다. 이 기능은 기존에 수만 건의 추가 훈련 데이터가 필요했던 정렬(alignment) 작업을 개념 수준 제어로 대체한다.
다중 토큰 스티어링(Multi-Token Steering): 인과적 이산 확산 모델 백본 덕분에 다음 토큰뿐 아니라 여러 토큰에 걸쳐 생성 방향을 조정할 수 있다. 이는 일관된 스타일, 특정 형식, 제약된 출력 범위를 유지하는 장문 생성에서 특히 유용하다.
사후 해석과 무엇이 다른가
현재 AI 업계에서 사용하는 해석 가능성 방법은 크게 두 가지로 나뉜다.
| 방식 | 설명 | 한계 |
|---|---|---|
| 사후 해석 (Post-hoc) | SHAP, LIME 등으로 학습 후 설명 생성 | 근사치이며 실제 모델 동작과 괴리 가능 |
| 프로브 기반 | 내부 표현에 분류기를 학습 | 상관관계이며 인과관계 아님 |
| Steerling-8B 방식 | 아키텍처에 해석 가능성 내장 | 사전 데이터 어노테이션 필요 |
Steerling-8B의 방식은 해석이 근사치나 사후 추론이 아닌 모델의 실제 연산 경로 그 자체라는 점에서 근본적으로 다르다. 단, 지도 개념 레이어 구성을 위해 사전 데이터 어노테이션 비용이 발생한다. Guide Labs는 다른 AI 모델을 활용해 이 어노테이션 작업을 자동화해 이 비용을 완화했다.
어디에 쓰이는가
금융 — 편향 없는 대출 심사: 대출 심사 모델에서 재정 기록은 반영하고 인종·성별 등 보호 특성은 명시적으로 제외할 수 있다. 규제 기관의 감사 시 모델 결정 근거를 문서로 제출 가능하다.
의료 — 진단 근거 설명: AI 진단 시스템이 특정 소견을 제안한 이유를 의사가 이해하고 검증할 수 있다. 환자 안전과 의료 규제 컴플라이언스에 필수적이다.
과학 연구 — 단백질 접힘 해석: 딥러닝이 특정 단백질 구조 조합을 예측한 이유를 연구자가 확인할 수 있어, 결과를 재현하거나 새로운 가설을 수립하는 데 활용한다.
법률 — 계약 분석 추적: 계약서 검토나 규제 해석의 법적 근거가 어떤 판례·조문·훈련 데이터에서 비롯됐는지 변호사와 컴플라이언스 담당자가 직접 확인할 수 있다.
콘텐츠 안전 — 저작권·유해 콘텐츠 제어: 특정 저작권 자료의 사용을 차단하거나, 폭력·약물 관련 개념의 가중치를 실시간으로 조정해 안전한 출력을 보장한다.
90%의 성능과 10%의 대가
Steerling-8B는 기존 동급 모델 성능의 약 90%를 달성하며, 이 10%의 성능 격차가 해석 가능성 확보를 위한 트레이드오프다. Guide Labs는 이를 "규제 산업과 안전 중심 환경에서 충분히 수용 가능한 수준"으로 평가한다.
주요 제약 사항은 다음과 같다.
- 어노테이션 비용: 지도 개념 레이어 구성을 위한 사전 데이터 레이블링 작업 필요
- 모델 규모: 현재 8B 파라미터로 GPT-5, Claude Opus 급 초대형 모델 대비 원시 성능 한계 존재
- 개념 커버리지: 지도 개념이 전체 도메인을 완전히 커버하지 못하는 경우 잔차 레이어 비중 증가
Guide Labs의 다음 계획은 더 큰 파라미터 모델을 구축하고 API 및 에이전틱 접근을 제공하는 것이다.
규제가 해석 가능성을 요구하는 시대
Steerling-8B의 출시는 글로벌 AI 규제 강화 흐름과 맞물린다. EU AI Act는 고위험 AI 시스템에 설명 가능성과 감사 가능성을 의무화했으며, 미국 금융 규제기관들도 AI 기반 신용 평가에서 결정 근거 제시를 요구하고 있다. 해석 가능성이 선택이 아닌 법적 요건이 되는 시대에, 아키텍처 수준의 투명성을 제공하는 Steerling-8B 방식은 규제 대응 비용을 근본적으로 낮추는 접근이다.
Guide Labs의 Steerling-8B는 AI 해석 가능성 연구가 학문적 논의에서 실용적 제품으로 전환되는 중요한 이정표다. 모든 토큰의 출처를 추적하고, 재훈련 없이 추론 시 개념을 제어하며, 아키텍처 수준에서 투명성을 보장하는 이 접근은 규제 산업과 고위험 의사결정 영역에서 AI 도입의 핵심 장벽을 낮출 수 있다. 성능의 10% 트레이드오프를 감수하고 신뢰성과 설명 가능성을 택하는 이 설계 철학은, AI가 단순한 성능 경쟁을 넘어 책임 있는 배포로 진화하는 방향을 가리키고 있다.
Sources
- Guide Labs debuts a new kind of interpretable LLM | TechCrunch
- Steerling-8B: The First Inherently Interpretable Language Model | Guide Labs
- Guide Labs open-sources Steerling-8B to solve the AI "black box" problem | TechBriefly
- Guide Labs Unveils Steerling-8B Interpretable LLM | The Outpost AI
- New Steerling-8B Model Can Trace Every Single Word Back To Its Training Source | Dataconomy
- Steering Interpretable Language Models | Guide Labs Blog
- Discovering human-understandable concepts in Steerling-8B | Guide Labs Blog
- Guide Labs Launches Steerling-8B: Transparent Interpretable LLM | RichlyAI