Fisher Alignment으로 보는 어휘 스케일 LLM 정렬과 학습 이론
ICML 2026 Fisher Alignment과 COLT 2026 반공간 절단 가우시안 학습 연구를 바탕으로 LLM 정렬, 소스 선택, 샘플 복잡도를 정리한다.
2026-08-14 · 최초 발행 2026-08-02
ICML·COLT 연구가 다루는 정렬과 학습의 접점
2026년 6월 arXiv stat.ML에는 560편 이상의 논문이 등재됐다. 이 흐름 속에서 ICML 2026 채택작인 The Geometry of Updates: Fisher Alignment at Vocabulary Scale과 COLT 2026의 반공간 절단 하 가우시안 분포 학습 연구는 각각 LLM 정렬의 소스 선택과 통계적 학습의 계산 문제를 다룬다.
ICML 2026은 서울에서 개최되며 6,500편 이상의 논문을 채택했다. 서울 개최는 아시아 AI 연구 커뮤니티와의 교류를 강화하는 계기가 되었고, 한국 AI 스타트업과 학계의 참여도 두드러졌다. 같은 시기 stat.ML에는 PINN의 손실 경관 제어, 볼록 거리 연산자 전이(CDOT), 오프-폴리시 평가 이론 같은 연구도 포함됐다.
이 시기의 연구는 논문 수의 확대만을 뜻하지 않는다. LLM 확산에 맞춰 실무 적용 가능한 이론적 보장(theoretical guarantees)을 만들려는 움직임이 함께 나타난다.
표현이 같아도 업데이트 방향은 다를 수 있다
John Sweeney의 ICML 2026 채택 논문 The Geometry of Updates: Fisher Alignment at Vocabulary Scale (arXiv:2606.27242)은 공유 어휘를 쓰는 LLM 패밀리에서 훈련 없이 소스를 선택하는 문제를 다룬다. SMILES, 단백질 서열, 유전체 서열처럼 특수 과학 문자열을 다루는 도메인에서는 후보 코퍼스가 토크나이저를 공유해도 예측 목표가 달라질 수 있다.
CKA(centered kernel alignment)를 비롯한 기존 표현 유사성 지표는 표현이 같고 출력 헤드를 공유하는 모델에서, 헤드 업데이트가 직교하는 경우 전이 능력을 신뢰성 있게 가려내지 못할 수 있다. 논문은 이 상태를 활성화-암흑 레짐(activation-dark regime)으로 부른다.
Fisher alignment는 헤드 Fisher alignment가 관절 활성화-오류 공간에서 커널 평균 임베딩 사이의 코사인 유사도와 정확히 같다는 관점에서 출발한다.
Fisher_align(P, Q) = cos(φ_P, φ_Q) in joint activation-error space
이 해석을 사용하면 Fisher 행렬을 명시적으로 구체화하지 않아도 활성화, 오류, 그리고 두 요소의 결합을 나누어 볼 수 있다.
FisherSketch가 소스 선택을 계산하는 방식
FisherSketch는 제품 커널 코사인을 단일 패스로 추정하는 스트리밍 알고리즘이다. 태스크 시그니처는 m=4096 기준 16 KB이고, 태스크별 분할 샘플 스트리밍 상태는 192 KB다. K=128,256 헤드 Fisher alignment 계산을 실용적으로 수행할 수 있다.
이 스케치는 태스크 유사성이 활성화, 오류, 또는 둘의 결합 가운데 무엇으로 결정되는지 진단할 수 있게 한다. 해당 진단 기능은 Llama-3.1-8B 검증기 이동(verbalizer-shift) 실험으로 검증됐다.
반공간에 가려진 가우시안을 학습하는 문제
제39회 연간 학습 이론 컨퍼런스(COLT 2026)에 채택된 Fast algorithms for learning a Gaussian under halfspace truncation with optimal sample complexity (arXiv:2606.27298)는 Haitong Liu, Deepak Narayanan Sridharan, David Steurer, Manuel Wiedmer가 공동 저술한 88페이지 연구다.
반공간 절단(halfspace truncation)은 기하학적 제약 때문에 일부 관측만 남는 상황을 모델링한다. 알 수 없는 반공간 안의 점만 관측될 때 원래 가우시안 분포를 복원하는 것이 문제의 핵심이다.
선택 편향으로 특정 조건의 데이터만 기록되는 경우, 임상 시험에서 특정 결과만 보고되는 검열 데이터, 이상치를 제거한 뒤 학습하는 전처리 환경이 이 설정과 연결된다.
논문은 정보 이론적 하한과 일치하는 최적 샘플 수를 달성하면서 다항 시간에 실행할 수 있는 알고리즘을 제시한다. 추정 오류에 대해서는 비점근적(non-asymptotic) 경계도 제공한다. 계산 복잡도와 통계적 효율성 사이의 균형을 알고리즘 설계로 다룬 연구다.
파인튜닝 이전에 데이터 소스를 가리는 기준
의료, 법률, 금융처럼 특수 도메인 LLM을 파인튜닝할 때 후보 코퍼스의 선택은 결과에 직접 영향을 준다. 기존에는 휴리스틱이나 표현 유사성 지표에 기대는 경우가 많았지만, FisherSketch는 공유 어휘 LLM 패밀리에서 이 선택을 이론적으로 다룬다.
운영 흐름은 후보 도메인 코퍼스를 구성한 뒤, 각 후보의 16 KB 태스크 시그니처를 단일 스트리밍 패스로 계산하고, 소스와 태스크 사이의 Fisher alignment 코사인 유사도를 산출하는 방식이다. 이후 상위 후보 코퍼스를 파인튜닝에 사용한다.
반공간 절단 학습은 편향된 훈련 데이터를 다루는 문제에도 연결된다. 인간 레이터의 평가가 특정 응답 유형에 편향된 RLHF 데이터를 가우시안 분포 가정 아래 보정하거나, 실제 분포를 추정해 결측 영역을 채우는 합성 데이터를 생성하는 경우, 훈련 분포와 배포 분포 사이의 반공간 절단 패턴을 탐지하는 경우가 해당한다.
PAC 학습 이론의 샘플 복잡도와 일반화 오류, VC 차원의 가설 클래스 복잡도, 유한 샘플의 비점근적 경계, 계산-통계 트레이드오프는 이 연구를 읽을 때 함께 연결되는 개념이다.
RLHF와 DPO 사이에서 Fisher Alignment의 위치
Fisher Alignment는 RLHF나 DPO와 경쟁하는 정렬 기법이 아니다. 파인튜닝 이전 단계에서 적합한 소스를 고르는 프레임워크로서, 이후의 선호 정렬 절차를 보완한다.
RLHF(Reinforcement Learning from Human Feedback)는 고품질 데모에 대한 지도학습 파인튜닝(SFT), 인간 선호 쌍으로 보상 모델 훈련, PPO 기반 강화학습 최적화로 구성된다. 이론적 토대가 있지만 구현 복잡도와 하이퍼파라미터 민감성이 단점이다.
DPO(Direct Preference Optimization)는 보상 함수와 최적 정책 간의 매핑을 이용해 명시적 보상 모델 없이 인간 선호 데이터로 언어 모델을 직접 최적화한다. RLHF보다 구현이 단순하고 계산 효율성이 높으며, 2026년 기준 60개 이상의 관련 특허가 출원됐다.
| 기법 | 단계 | 주요 목적 | 이론적 보장 | 계산 비용 |
|---|---|---|---|---|
| Fisher Alignment | 파인튜닝 전 | 소스 선택 | 커널 임베딩 코사인 | 매우 낮음 (16 KB) |
| RLHF | 파인튜닝 | 선호 정렬 | 보상 수렴 | 높음 (PPO) |
| DPO | 파인튜닝 | 선호 정렬 | 정책 최적성 | 중간 |
| SFT | 파인튜닝 전 | 기초 능력 | 경험적 위험 최소화 | 낮음 |
원본의 관점에서 파이프라인은 Fisher Alignment로 코퍼스를 고르고, SFT로 도메인 기초 능력을 주입한 뒤, DPO 또는 RLHF로 인간 선호를 정렬하고, 반공간 절단 보정으로 편향 데이터를 처리하는 흐름으로 구성할 수 있다.
훈련 없는 진단과 계산-통계 균형
FisherSketch는 실제 학습을 수행하지 않고 전이 적합성을 수학적으로 진단하는 도구의 필요성을 보여준다. 대형 모델 훈련 비용이 증가하는 환경에서 Fisher 정보를 활용한 진단 프레임워크가 더 등장할 것으로 예측된다.
반공간 절단 알고리즘이 제시한 최적 샘플 복잡도와 다항 시간 보장의 조합은 학습 이론의 목표를 드러낸다. 이를 혼합 가우시안이나 비모수 분포 같은 더 복잡한 분포 클래스로 확장하는 연구는 2027년 이후 본격화될 전망이다.
SMILES, 단백질, 유전체 서열을 대상으로 한 Fisher Alignment는 과학 AI의 도메인 전용 정렬 이론이 발전하는 출발점으로 볼 수 있다. 의료 AI, 법률 AI, 금융 AI에서도 도메인 특화 정렬 지표와 알고리즘이 개발될 것으로 예상된다.
ALIGNBEAM(arXiv:2606.12342)은 추론 시간(inference-time) 정렬 전이를 다룬다. 어휘 간 로짓 혼합(cross-vocabulary logit mixing)으로 훈련 없이 정렬을 전이하는 접근은 Fisher Alignment와 상호 보완적인 생태계를 형성한다.
Sources
- The Geometry of Updates: Fisher Alignment at Vocabulary Scale (arXiv:2606.27242)
- ICML 2026 Schedule
- COLT 2026 Accepted Papers
- arXiv stat.ML June 2026
- Paper Digest: ICML 2026 Papers & Highlights
- DPO vs RLHF vs SFT: A Practitioner's Benchmark of LLM Alignment Methods in 2026
- Was RLHF a Detour? Rethinking LLM Alignment with DPO
- ALIGNBEAM: Inference-Time Alignment Transfer (arXiv:2606.12342)
- Near-Optimal Bounds for Learning Gaussian Halfspaces with Random Classification Noise
- arXiv cs.LG Machine Learning June 2026