Gemma 4 — 20배 큰 모델을 이긴 31B의 아키텍처
Google DeepMind Gemma 4 31B가 Arena AI 리더보드 세계 3위에 오른 이중 어텐션·이중 RoPE·레이어별 임베딩·공유 KV 캐시 구조와 벤치마크 성능, Apache 2.0 전환의 의미를 정리한다.
2026-08-14 · 최초 발행 2026-04-08
Google DeepMind가 2026년 4월 2일 Apache 2.0 라이선스로 공개한 Gemma 4는 오픈웨이트 AI 모델의 새로운 이정표를 세웠다. 31B Dense 모델이 Arena AI 텍스트 리더보드에서 세계 3위를 기록하며 자신보다 20배 이상 큰 모델들을 능가하는 성과를 보였고, 이는 모델 아키텍처 혁신과 효율적 학습 전략의 결과로 평가된다.
크기별 라인업과 라이선스 전환
Gemma 4는 단일 모델이 아닌 네 크기의 모델 패밀리로 출시됐다. Effective 2B(E2B), Effective 4B(E4B), 26B Mixture of Experts(MoE), 그리고 31B Dense 모델이 이에 해당한다. 모든 모델은 Apache 2.0 오픈소스 라이선스로 배포돼 상업적 사용에도 제약이 없으며, Hugging Face, Kaggle, Ollama 등에서 다운로드할 수 있다.
이전 세대인 Gemma 3까지는 Gemma 자체 라이선스를 적용했으나, Gemma 4에서 Apache 2.0으로 전환한 것은 오픈소스 커뮤니티의 참여를 극대화하려는 Google의 전략적 결정이다. 이는 중국의 오픈웨이트 모델들(DeepSeek, Qwen 등)과의 경쟁에서 커뮤니티 생태계를 확보하려는 의도로 해석된다.
수십 배 큰 모델을 이긴 구조
Gemma 4 31B 모델이 자신보다 수십 배 큰 모델을 능가할 수 있었던 배경에는 여러 아키텍처 혁신이 있다.
이중 어텐션 메커니즘은 로컬 슬라이딩 윈도우 어텐션과 글로벌 풀 컨텍스트 어텐션 레이어를 교대로 배치한다. 소형 Dense 모델은 512 토큰, 대형 모델은 1024 토큰의 슬라이딩 윈도우를 사용해 지역적 패턴과 전역적 맥락을 동시에 포착한다.
이중 RoPE 구성은 슬라이딩 레이어에는 표준 RoPE를, 글로벌 레이어에는 비례적 RoPE를 적용해 더 긴 컨텍스트 처리를 가능하게 했다. 이 설계는 긴 문서 이해와 복잡한 추론 작업에서 특히 효과적이다.
레이어별 임베딩(PLE)은 두 번째 임베딩 테이블이 모든 디코더 레이어에 작은 잔차 신호를 제공하는 방식이다. 이를 통해 각 레이어가 입력의 미묘한 차이를 더 세밀하게 인식할 수 있다.
공유 KV 캐시는 모델의 후반부 N개 레이어가 초기 레이어의 키-값 상태를 재사용하는 구조다. 이는 중복 KV 프로젝션을 제거해 추론 시 메모리 사용량을 대폭 절감한다.
20.8%에서 89.2%로
Gemma 4 31B의 벤치마크 성능은 전 세대 대비 극적인 향상을 보여준다.
| 벤치마크 | Gemma 4 31B | Gemma 3 27B | 향상 폭 |
|---|---|---|---|
| AIME 2026 (수학) | 89.2% | 20.8% | +68.4%p |
| MMLU Pro | 85.2% | - | - |
| LiveCodeBench v6 (코딩) | 80.0% | - | - |
| GPQA Diamond (과학) | 84.3% | - | - |
| τ2-bench (에이전틱) | 86.4% | - | - |
Arena AI 리더보드에서 추정 LMArena 점수 1452를 기록하며 오픈 모델 세계 3위를 달성했다. 26B MoE 모델도 6위에 올라 Gemma 4 패밀리 전체의 경쟁력을 입증했다.
특히 AIME 2026 수학 벤치마크에서 Gemma 3 27B의 20.8%에서 89.2%로 도약한 성과는, 단순한 파라미터 증가가 아닌 아키텍처 혁신과 학습 전략 개선의 결과임을 시사한다.
중국 오픈소스 모델과의 정면 경쟁
Gemma 4의 출시는 오픈웨이트 AI 모델 시장에서 Google이 중국 기업들과 본격적으로 경쟁하겠다는 선언으로 읽힌다. DeepSeek과 Qwen 등 중국 오픈소스 모델들이 빠르게 시장을 잠식하는 상황에서, Google은 Apache 2.0 라이선스 전환과 압도적인 성능으로 대응하고 있다.
Gemini 3과 동일한 연구 기술을 기반으로 구축된 Gemma 4는 단순한 챗봇 수준을 넘어 복잡한 논리 처리와 에이전틱 워크플로를 수행할 수 있다. 이는 오픈웨이트 모델이 프로프라이어터리 모델의 영역을 빠르게 잠식하고 있음을 보여주는 사례다.
Google Gemma 4 31B는 30.7B 파라미터로 Arena AI 리더보드 세계 3위를 차지하며, 모델 크기가 아닌 아키텍처 효율이 AI 성능의 핵심임을 입증했다. 이중 어텐션, 공유 KV 캐시, 레이어별 임베딩 등의 혁신과 Apache 2.0 라이선스 전환은 오픈웨이트 모델 생태계에 새로운 활력을 불어넣고 있다. 중국 오픈소스 모델들과의 경쟁이 심화되는 가운데, Gemma 4는 Google이 이 시장에서 주도권을 확보하려는 강력한 의지를 보여준다.
Sources
- Gemma 4: Byte for byte, the most capable open models - Google Blog
- Gemma 4 - Google DeepMind
- Welcome Gemma 4: Frontier multimodal intelligence on device - Hugging Face
- Google Gemma 4 Ranks 3 on Arena AI Leaderboard - AI Unfiltered
- Google battles Chinese open weights models with Gemma 4 - The Register
- Google Releases Gemma 4 Open Models Under Apache 2.0 License - Winbuzzer