Gemma 4 뜯어보기: MoE 라우팅부터 비전 인코더까지, 40장의 그림이 그려낸 구조
Maarten Grootendorst의 비주얼 가이드를 바탕으로 Gemma 4의 모델 패밀리, MoE 라우팅, 하이브리드 어텐션, Per-Layer Embeddings, 비전 인코더 구조를 정리한다.
2026-08-14 · 최초 발행 2026-04-08
2026년 4월 3일, Google DeepMind가 Gemma 4 모델 패밀리를 Apache 2.0 라이선스로 공개했다. Maarten Grootendorst는 40개에 달하는 커스텀 비주얼 자료를 통해 Gemma 4의 내부 아키텍처를 상세히 해부했다. Mixture of Experts, 비전 인코더, Per-Layer Embeddings, 오디오 인코더에 이르기까지 Gemma 4의 핵심 기술을 시각적으로 살펴본다.
엣지부터 고밀도까지, 나뉜 몸집
Gemma 4는 네 가지 모델로 구성된다. Gemma 4 E2B(유효 파라미터 20억)와 E4B(유효 파라미터 40억)는 엣지 디바이스용 경량 모델이며, 31B Dense는 310억 파라미터의 고밀도 모델이다. 가장 주목받는 26B A4B는 총 260억 파라미터 중 40억만 활성화하는 Mixture of Experts(MoE) 모델로, 효율성과 성능의 균형을 추구한다.
모든 모델이 이미지와 비디오를 네이티브로 처리하며 가변 해상도를 지원한다. 엣지 모델은 128K, 대형 모델은 256K의 컨텍스트 윈도우를 제공한다. 라이선스가 기존 Gemma의 자체 라이선스에서 Apache 2.0으로 바뀌어 상용 제품에 법적 모호성 없이 쓸 수 있게 됐다.
라우터가 고르는 소수의 전문가
Gemma 4 26B A4B의 핵심인 MoE 아키텍처는 하나의 거대한 피드포워드 신경망(FFNN) 대신 여러 개의 작은 FFNN(전문가)을 배치하고, 라우터가 입력에 따라 일부만 활성화하는 구조다. 전체 260억 파라미터 중 추론 시 40억만 쓰므로 연산 비용이 크게 절감된다.
라우터의 동작 원리는 이렇다. 토큰 임베딩이 라우터에 전달되면, 라우터는 각 전문가에 대한 확률 분포를 생성한다. 상위 확률의 전문가들만 선택되어 토큰 임베딩을 처리하며, 확률 가중치에 따라 각 전문가의 출력이 최종 결과에 반영된다. 이 과정에서 선택되지 않은 전문가는 연산을 수행하지 않으므로 전체 파라미터 대비 실제 연산량이 극소화된다.
가까운 것과 먼 것을 함께 본다
Gemma 4의 모든 모델은 로컬 슬라이딩 윈도우 어텐션과 글로벌 풀 컨텍스트 어텐션을 교대로 배치하는 하이브리드 어텐션 구조를 채택했다. 소형 모델에서는 512 토큰, 대형 모델에서는 1,024 토큰의 슬라이딩 윈도우를 쓰며, 마지막 레이어는 항상 글로벌 어텐션이다.
로컬 어텐션 레이어는 인접 토큰 간의 관계를 효율적으로 처리하고, 글로벌 어텐션 레이어는 문서 전체에 걸친 장거리 의존성을 포착한다. 이 교대 배치를 통해 전체 시퀀스에 대한 풀 어텐션을 수행하는 것보다 메모리와 연산을 절약하면서도, 긴 컨텍스트에서의 정보 손실을 최소화한다.
공유 KV 캐시(Shared KV Cache) 기법도 적용돼 키-밸류 쌍을 여러 어텐션 헤드가 공유함으로써 메모리 사용량을 추가로 절감한다. 특히 엣지 디바이스에서의 배포를 고려한 설계 선택이다.
레이어마다 다른 임베딩, 패치로 읽는 이미지
소형 모델인 E2B와 E4B에 적용된 Per-Layer Embeddings(PLE)는 각 트랜스포머 레이어가 고유한 임베딩 테이블을 유지하는 기법이다. 전통적인 아키텍처에서 모든 레이어가 동일한 입력 임베딩을 공유하는 것과 달리, PLE는 레이어별로 특화된 표현을 학습해 적은 파라미터로도 높은 표현력을 달성한다.
비전 인코더는 이미지와 비디오를 가변 해상도로 처리한다. 입력 이미지를 패치 단위로 분할한 후 비전 트랜스포머가 시각 토큰으로 변환하고, 이를 언어 모델의 텍스트 토큰과 동일한 임베딩 공간에 매핑한다. OCR, 차트 분석, 다이어그램 이해 같은 시각 작업에서 우수한 성능을 보이며, 비디오 입력 시에는 프레임 단위 샘플링을 통해 시간축 정보도 처리한다.
| 기술 | 적용 모델 | 핵심 효과 |
|---|---|---|
| MoE 라우팅 | 26B A4B | 파라미터 효율 극대화 |
| 하이브리드 어텐션 | 전 모델 | 메모리 절약 + 장거리 의존성 |
| Per-Layer Embeddings | E2B, E4B | 소형 모델 표현력 향상 |
| 공유 KV 캐시 | 전 모델 | 추론 메모리 절감 |
| 비전 인코더 | 전 모델 | 멀티모달 입력 처리 |
함수를 부르고, 순위표에 오르고
Gemma 4는 함수 호출(function calling), 구조화된 JSON 출력, 네이티브 시스템 인스트럭션을 기본 지원해 자율 에이전트 구축에 적합하다. 외부 도구 및 API와 상호작용하면서 워크플로우를 안정적으로 실행하는 에이전트를 구축할 수 있다.
벤치마크 성능에서 31B Dense 모델은 Arena AI 텍스트 리더보드에서 오픈 모델 중 3위를 기록했고, 26B MoE 모델은 6위를 차지했다. 26B 모델이 실제 활성 파라미터 40억만으로 이 성능을 달성했다는 점은 MoE 아키텍처의 효율성을 입증한다. 엣지 모델인 E2B와 E4B도 동급 규모 모델 대비 경쟁력 있는 성능을 보여 모바일 및 IoT 환경에서의 활용 가능성을 열었다.
그림으로 남긴 지도
Gemma 4는 MoE 아키텍처, 하이브리드 어텐션, Per-Layer Embeddings 등 여러 기법을 결합해 파라미터 효율성과 성능을 동시에 추구하는 구글의 오픈웨이트 모델이다. Apache 2.0 라이선스 전환으로 상용 활용의 법적 장벽이 사라졌으며, 엣지부터 서버급까지 네 가지 규모의 모델이 다양한 배포 환경을 지원한다. Maarten Grootendorst의 비주얼 가이드는 이 복잡한 아키텍처를 직관적으로 이해할 수 있는 참고 자료로 남는다.
Sources
- A Visual Guide to Gemma 4 - Maarten Grootendorst
- Gemma 4: Byte for byte, the most capable open models - Google Blog
- Google Releases Gemma 4 in Four Model Sizes Under Apache 2.0 - gHacks
- Gemma 4 Complete Guide: Architecture, Models, and Deployment - DEV Community
- Google Gemma 4: The Open-Weight Model Bringing Agentic AI to the Edge - Medium
- Gemma 4 Technical Deep Dive - Qubrid AI