Gemma 4 12B, 인코더를 없앤 멀티모달 모델이 노트북에서 돌아가기까지

Google DeepMind의 Gemma 4 12B가 비전·오디오 인코더 없이 단일 트랜스포머로 멀티모달을 처리하는 구조와 16GB 노트북 구동 방법을 정리한다.

2026-08-12 · 최초 발행 2026-06-10

인코더를 왜 없앴나

전통적인 멀티모달 모델은 입력 형식마다 전담 인코더를 뒀다. CLIP 기반 비전 인코더가 이미지를 임베딩 벡터로 바꾸고 별도 오디오 인코더가 파형을 처리한 뒤, 언어 모델 디코더가 이를 통합하는 구조다. 각 모달리티에 최적화된 표현을 학습할 수 있다는 장점은 있지만 단점도 뚜렷하다. 인코더가 늘어날수록 파라미터 수와 VRAM 요구량이 선형에 가깝게 늘어나는 메모리 오버헤드, 각 인코더가 순차 또는 병렬로 실행된 뒤 디코더로 전달되는 지연시간, 인코더와 디코더가 분리돼 있어 전체 모델을 엔드투엔드로 한 번에 학습시키기 어려운 파인튜닝 복잡도다.

2026년 6월 3일 공개된 Gemma 4 12B는 이 세 문제를 인코더 제거라는 단일 결정으로 정면 돌파한다. 이미지 픽셀 패치와 오디오 파형을 경량 선형 프로젝션 레이어를 통해 LLM 임베딩 공간에 직접 투영한 뒤, 텍스트 토큰과 같은 시퀀스로 합쳐 디코더 전용 트랜스포머에 넣는다.

텍스트 입력토크나이저262K 어휘이미지 패치선형 프로젝션 레이어오디오 파형선형 프로젝션 레이어영상 프레임프레임 샘플링 + 선형 프로젝션통합 임베딩 시퀀스디코더 전용 트랜스포머48 레이어슬라이딩 윈도우 어텐션1024 토큰전역 어텐션 레이어출력 생성

주요 파라미터 구성은 다음과 같다.

항목
총 파라미터 수 11.95B
레이어 수 48
어휘 크기 262,144 토큰
컨텍스트 윈도우 256K 토큰
슬라이딩 윈도우 어텐션 1,024 토큰 단위
지원 입력 텍스트, 이미지, 오디오, 영상
라이선스 Apache 2.0
VRAM 요구사항 16GB (FP16 기준)

슬라이딩 윈도우 어텐션과 전역 어텐션 레이어를 섞은 구조는 긴 컨텍스트를 효율적으로 처리하기 위한 설계다. 256K 토큰 컨텍스트는 약 20만 단어, 3~4시간 분량의 음성 전사 텍스트에 해당한다.

오디오를 그대로 읽는 중형 모델

Gemma 4 12B는 중형(mid-sized) 오픈소스 모델 중 최초로 네이티브 오디오 입력을 지원한다. 오디오 파형이 별도 인코더 없이 선형 프로젝션만 거쳐 모델 내부로 직접 들어가기 때문에, 음성 전사·화자 분석·오디오 내용 이해를 외부 API 없이 단일 모델 추론으로 처리할 수 있다. 회의 녹음 파일을 업로드해 요약과 액션 아이템을 뽑거나, 이미지와 관련 오디오 설명을 동시에 넣어 멀티모달 이해 작업을 수행하는 식이다. 이전까지는 이런 작업에 Whisper 같은 별도 STT 모델을 앞단에 붙이는 파이프라인이 필수였다.

품질 손실 없이 절반으로 — QAT

Google은 학습이 끝난 뒤 압축하는 표준 사후 학습 양자화(PTQ) 대신 양자화 인식 학습(QAT)을 적용했다. PTQ는 학습을 마친 모델을 사후에 압축하기 때문에 정밀도 손실이 생기기 쉽지만, QAT는 학습 과정 자체에 양자화 시뮬레이션을 포함시켜 모델이 정밀도 손실을 보상하는 방향으로 파라미터를 최적화한다. 그 결과 QAT를 적용한 모델은 FP16 기준 모델과 거의 같은 품질을 유지하면서 메모리 요구량을 절반 이하로 줄인다.

Gemma 4 12B 기본 모델FP16, 24GBQAT 적용W4A16 Compressed TensorsGGUF Q4_0UnslothGGUF Q8_0Unsloth클라우드 고동시성 서빙 최적화llama.cpp / LM Studio 호환높은 품질 유지 로컬 실행16GB VRAM 노트북 실행 가능

QAT W4A16 체크포인트(google/gemma-4-12B-it-qat-w4a16-ct)는 클라우드 고동시성 서빙에, GGUF 포맷은 llama.cpp·LM Studio 생태계 호환을 위해 제공된다. Unsloth를 통한 파인튜닝도 공식 지원한다.

노트북에서 돌리는 방법

Hugging Face Transformers로 직접 로드하는 방법이 가장 유연하다.

from transformers import AutoProcessor, Gemma4ForConditionalGeneration
import torch

model_id = "google/gemma-4-12B-it"
processor = AutoProcessor.from_pretrained(model_id)
model = Gemma4ForConditionalGeneration.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

# 멀티모달 입력 예시
messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "url": "https://example.com/image.jpg"},
            {"type": "text", "text": "이 이미지를 설명해 주세요."}
        ]
    }
]

inputs = processor.apply_chat_template(
    messages, tokenize=True, return_tensors="pt"
).to(model.device)

with torch.inference_mode():
    output = model.generate(**inputs, max_new_tokens=512)

print(processor.decode(output[0], skip_special_tokens=True))

GUI를 선호한다면 LM Studio에서 google/gemma-4-12b를 검색해 GGUF Q4 버전을 받으면 된다. 16GB RAM 맥북 M2 이상에서 원활하게 동작한다. 터미널에서는 Ollama로 더 간단하게 시작할 수 있다.

ollama run gemma4:12b

Ollama 0.6.x 이상이 Gemma 4 12B를 지원하며, 이미지 첨부 기능으로 터미널에서 비전 작업도 처리할 수 있다.

Llama 3.2·Phi-4와 나란히 놓으면

2026년 중반 현재 엣지 멀티모달 AI 시장은 Gemma 4 12B, Llama 3.2, Phi-4 계열이 경쟁한다.

경쟁 모델파라미터 규모별 비교멀티모달 + 오디오우위추론 성능 유사멀티모달 추가Gemma 4 E2B2B, 엣지Gemma 4 12B12B, 노트북Gemma 4 27B27B, 워크스테이션Llama 3.2 11B메타, 멀티모달Phi-4 14B마이크로소프트, 텍스트 중심
모델 파라미터 멀티모달 오디오 컨텍스트 라이선스
Gemma 4 12B 11.95B 텍스트·이미지·영상·오디오 네이티브 지원 256K Apache 2.0
Llama 3.2 11B 11B 텍스트·이미지 미지원 128K Llama 3.2 커뮤니티
Phi-4 14B 14B 텍스트 중심 미지원 16K MIT

차별화 포인트는 두 가지로 좁혀진다. 동급 파라미터 규모에서 유일하게 오디오를 네이티브로 지원한다는 점, 그리고 인코더 제거로 메모리 효율이 높아져 같은 VRAM에서 더 긴 컨텍스트를 처리할 수 있다는 점이다. Phi-4가 합성 데이터 기반 수학·추론 특화에 집중하는 반면, Gemma 4 12B는 범용 멀티모달 이해를 지향한다.

어디에 쓸 수 있나

외부 클라우드 API 사용이 제한된 보안 환경에서는 Gemma 4 12B를 사내 서버에 배포해 PDF 스캔 이미지, 음성 회의록, 영상 보고서를 통합 분석하는 에이전트를 구축할 수 있다. 더 작은 Gemma 4 E2B(2B 엣지 모델)는 Android 스마트폰에서도 구동되고, 12B 모델은 고급형 노트북 수준에서 돌아가 개발자 로컬 테스트 환경으로 적합하다. vLLM이나 TGI로 서빙하면 OpenAI 호환 API 서버로 노출할 수 있어 기존 앱을 코드 수정 없이 로컬 모델로 바꿔 끼울 수 있다.

# vLLM 서버 실행 예시
vllm serve google/gemma-4-12B-it \
  --dtype bfloat16 \
  --max-model-len 131072 \
  --gpu-memory-utilization 0.9

Google이 Gemma 4 라인업 전체에 Apache 2.0을 적용한 것은 오픈소스 커뮤니티의 신뢰를 얻기 위한 전략적 결정이고, Hugging Face·Ollama·LM Studio·Unsloth 등 생태계 파트너 통합 지원은 채택 속도를 끌어올리는 요인이다. 인코더 없는 멀티모달 설계가 충분한 품질을 계속 입증한다면, 향후 출시될 모델들도 같은 패러다임을 따를 가능성이 있다.

Sources

Gemma4인코더프리멀티모달엣지AI양자화인식학습온디바이스AI