Gemma 4가 Apache 2.0을 고른 이유 — 라이선스가 벤치마크만큼 중요한 순간
Gemma 4의 함수 호출 에이전틱 능력, Llama 4 대비 Apache 2.0 라이선스 비교, Google AI Studio부터 Ollama까지 배포 채널을 정리한다.
2026-08-14 · 최초 발행 2026-04-17
Google DeepMind이 Apache 2.0 라이선스로 Gemma 4를 공개했다. 2.3B부터 31B까지 4가지 크기의 모델 패밀리로, 네이티브 비전·오디오·함수 호출을 지원하며 최대 256K 컨텍스트 윈도우와 140개 이상 언어를 처리한다.
E2B부터 31B Dense까지, 엣지에서 서버까지
Gemma 4는 엣지 디바이스부터 서버까지 전 구간을 커버하는 구성이다.
| 모델 | 총 파라미터 | 활성 파라미터 | 컨텍스트 | 타겟 환경 |
|---|---|---|---|---|
| E2B | 5.1B | 2.3B | 128K | 스마트폰, IoT |
| E4B | — | 4.5B | 128K | 노트북, 태블릿 |
| 26B MoE | 26B | 3.8B | 256K | 서버(비용 효율) |
| 31B Dense | 31B | 31B | 256K | 서버(최대 정확도) |
파라미터 효율을 극대화해 26B MoE는 3.8B 활성 파라미터만으로 추론해 토큰당 비용을 최소화하고, E2B·E4B는 스마트폰에서 실시간 추론이 가능한 경량 모델로 엣지 퍼스트 전략을 취하며, 별도 어댑터 없이 텍스트·이미지·비디오·오디오를 단일 아키텍처에서 처리하는 네이티브 멀티모달을 구현했다. 완전 개방 라이선스인 Apache 2.0을 채택해 MAU 제한이나 사용 정책 제약이 없다.
아키텍처는 로컬 슬라이딩 윈도우(소형 모델 512토큰, 대형 모델 1024토큰)와 글로벌 풀 컨텍스트 어텐션을 교대 배치하는 교차 어텐션 레이어, 긴 컨텍스트 처리를 위한 이중 회전 위치 임베딩(Dual RoPE), 임베딩 신호를 모든 디코더 레이어에 주입하는 Per-Layer Embeddings, 후반부 N개 레이어가 이전 레이어의 키-밸류 상태를 재사용해 메모리를 절감하는 Shared KV Cache로 구성된다. 비전 인코더는 원본 이미지의 종횡비를 보존하며 70·140·280·560·1120 다섯 단계의 토큰 예산으로 인코딩하고, E2B·E4B에 탑재된 오디오 인코더는 USM 스타일 Conformer 아키텍처로 이 파라미터 규모의 오픈 모델 중 업계 최초로 네이티브 음성 인식을 지원한다.
벤치마크에서 20배 큰 모델을 이긴다
| 벤치마크 | Gemma 3 27B | Gemma 4 31B | Gemma 4 26B MoE | Llama 4 Scout (109B) |
|---|---|---|---|---|
| Arena AI (Text) | 1365 | 1452 | 1441 | — |
| AIME 2026 (수학) | 20.8% | 89.2% | 88.3% | 88.3% |
| LiveCodeBench v6 (코딩) | 29.1% | 80.0% | 77.1% | 77.1% |
| GPQA Diamond (과학) | 42.4% | 84.3% | 82.3% | 82.3% |
| MMLU Pro (일반지식) | — | 85.2% | — | — |
AIME 수학에서는 Gemma 3 대비 68.4%p 향상으로 세대 간 가장 큰 도약을 보였고, Arena AI 텍스트 리더보드에서는 31B가 오픈 모델 세계 3위, 26B MoE가 6위를 기록했다. Llama 4 대비로는 31B Dense가 활성 파라미터 기준 약 1/5 크기로 수학·코딩·과학 전 영역에서 우위를 보였고, 26B MoE는 3.8B 활성 파라미터로 31B Dense에 근접한 성능을 내며 추론 비용을 대폭 절감했다.
2B 모델도 함수를 호출한다
Gemma 4의 함수 호출은 Google의 FunctionGemma 연구를 기반으로 처음부터 모델에 학습된 네이티브 기능이다. 복수 도구를 순차·병렬로 호출하는 복합 워크플로우를 지원하는 멀티턴 에이전틱 플로우 최적화가 이뤄졌고, E2B 엣지 모델에서도 함수 호출이 가능해 4종 모델 전체가 온디바이스 에이전트 구축의 길을 연다. 에이전틱 벤치마크인 τ2-bench에서는 31B가 86.4%로 Llama 4 Scout(85.5%)를 능가했다.
엣지 디바이스에서 직접 외부 API를 호출하고 결과를 처리하는 온디바이스 AI 에이전트 시나리오가 실질적으로 가능해진 셈이다.
7억 MAU 문턱이 없는 라이선스
Gemma 4의 Apache 2.0 채택은 오픈소스 AI 생태계에서 중요한 분기점이다.
Gemma 4(Apache 2.0)는 상업적 사용·수정·재배포가 완전 자유롭고 MAU 제한이 없으며 사용 정책 준수 의무도 없다. 반면 Llama 4(Community License)는 월간 활성 사용자 7억 미만 기업에는 무료지만 초과 시 Meta와 별도 계약이 필요하고 Acceptable Use Policy 준수 의무가 있다. 스타트업과 대기업 모두에게 법적 리스크 없이 자유롭게 모델을 활용할 수 있다는 점에서, Apache 2.0 라이선스는 벤치마크 점수만큼이나 중요한 경쟁 우위다.
AI Studio에서 LM Studio까지, 배포 채널
Gemma 4는 웹 기반 즉시 테스트·프로토타이핑이 가능한 Google AI Studio, transformers 라이브러리 통합으로 파인튜닝 파이프라인을 즉시 구축할 수 있는 Hugging Face Transformers, 로컬 환경에서 CLI 기반으로 개인 PC·맥에서 E2B·E4B 모델을 구동하는 Ollama, 엔터프라이즈 관리형 서비스로 프로덕션 배포가 가능한 Google Cloud Vertex AI, GUI 기반 로컬 실행과 양자화 모델을 지원하는 LM Studio 등 다양한 플랫폼에서 즉시 사용할 수 있다. 140개 이상 언어를 문화적 맥락까지 고려해 지원하므로, 글로벌 서비스의 다국어 요구사항에도 단일 모델로 대응할 수 있다.
Gemma 4는 단순히 벤치마크 점수가 높은 모델이 아니다. 스마트폰에서 서버까지 전 구간을 커버하는 모델 라인업, 네이티브 멀티모달과 함수 호출의 통합, 그리고 Apache 2.0이라는 완전 개방 라이선스까지 — 오픈소스 AI 모델이 갖춰야 할 조건의 기준선을 다시 그었다. 특히 26B MoE 모델이 3.8B 활성 파라미터만으로 달성하는 성능은 추론 비용이 핵심인 프로덕션 환경에서 게임 체인저가 될 수 있다.
Sources
- Gemma 4: Byte for byte, the most capable open models - Google Blog
- Gemma 4 — Google DeepMind
- Welcome Gemma 4: Frontier multimodal intelligence on device - Hugging Face
- Google releases Gemma 4 under Apache 2.0 — VentureBeat
- Bring state-of-the-art agentic skills to the edge with Gemma 4 - Google Developers Blog
- Gemma 4: How a 31B Model Beats 400B Rivals - Tech Insider
- Gemma 4 vs Llama 4 vs Mistral Small 4: Full Comparison - Digital Applied
- Google's Gemma 4: Is it the Best Open-Source Model of 2026? - Analytics Vidhya