Llama 4 Scout: RTX 3090 한 장으로 1000만 토큰 멀티모달을 돌리는 법
Meta Llama 4 Scout의 Early Fusion 멀티모달 설계, iRoPE 위치 인코딩, MoE 라우팅과 소비자 GPU 양자화·오프로딩 전략을 정리한다.
2026-08-14 · 최초 발행 2026-04-24
2026년 4월 Meta가 공개한 Llama 4 Scout는 170억(17B) 활성 파라미터와 16개 전문가(Expert) 네트워크를 결합한 MoE(Mixture-of-Experts) 아키텍처 기반의 비전-언어 멀티모달 모델이다. 단일 NVIDIA H100 GPU 또는 소비자용 RTX 3090(4비트 양자화 기준)에서도 실용적인 추론 속도를 달성하면서, 업계 최고 수준의 1000만 토큰 컨텍스트 윈도우를 제공한다는 점에서 오픈 웨이트 멀티모달 모델의 새로운 기준점으로 평가받는다. 여기서는 Scout의 핵심 아키텍처—Early Fusion 멀티모달 설계, iRoPE 위치 인코딩, MoE 라우팅—와 소비자 GPU에서의 양자화·추론 최적화 전략을 짚는다.
Herd 안에서 Scout가 맡은 자리
Meta의 Llama 4 시리즈는 Scout, Maverick, Behemoth 세 모델로 구성된다. Scout는 엣지-친화적 경량 모델, Maverick는 멀티모달 SOTA 표적 모델, Behemoth는 훈련 중인 초대형 교사 모델이다.
| 모델 | 활성 파라미터 | 총 파라미터 | 전문가 수 | 타깃 하드웨어 |
|---|---|---|---|---|
| Scout | 17B | 109B | 16 | 단일 H100 / RTX 3090 Q4 |
| Maverick | 17B | 400B | 128 | 8× H100 또는 멀티 GPU |
| Behemoth | ~2T | ~2T | - | 대규모 클러스터 (훈련 중) |
Scout는 109B 총 파라미터 중 포워드 패스 당 17B만 활성화되므로, 동일 전체 파라미터 크기의 밀집 모델(Dense Model) 대비 추론 연산량(FLOPs)을 대폭 절감한다. 이 특성이 소비자 GPU 단일 배포를 가능하게 하는 핵심 설계 원리다.
이미지와 텍스트를 처음부터 한 시퀀스로
기존 멀티모달 LLM의 대표적 접근법인 Cross-Attention Adapter 방식은 사전 훈련된 언어 모델에 별도 비전 인코더를 사후 결합한다. Flamingo, LLaVA 계열이 이 방식을 택하며, 텍스트 백본과 비전 어댑터 간 Cross-Attention 레이어를 통해 시각 정보를 주입한다.
Llama 4 Scout는 대신 Early Fusion 전략을 채택했다. MetaCLIP 기반의 강화된 비전 인코더가 이미지를 비전 토큰으로 변환하면, 이 토큰들이 텍스트 토큰과 동일한 임베딩 공간에 배치된다. 이후 첫 번째 Transformer 레이어부터 텍스트와 이미지 토큰이 하나의 통합 시퀀스로 처리된다.
Early Fusion의 핵심 이점은 Self-Attention이 텍스트와 이미지 패치 토큰을 동등하게 처리한다는 점이다. 단어 토큰이 해당 이미지 패치 토큰을 직접 어텐션할 수 있고, 반대로 이미지 패치 토큰도 관련 텍스트 토큰을 참조할 수 있다. 이 양방향 교차 어텐션(Cross-Modal Attention)은 별도 어댑터 없이 단일 백본 내에서 이뤄지므로, 모달리티 간 정보 흐름이 더 자연스럽고 훈련 효율도 높다.
Meta는 Scout를 ~40조 토큰의 멀티모달 데이터로 사전 훈련했으며, 200개 이상의 언어가 포함되고 그 중 100개 이상 언어가 10억 토큰 이상으로 대표된다. 포스트 훈련 단계에서는 256K 컨텍스트 길이로 파인튜닝해 베이스 모델의 길이 일반화 능력을 확보했다.
토큰마다 16개 중 일부만 깨우는 MoE
Scout의 MoE 설계에서 각 토큰은 16개 전문가 네트워크(Expert FFN) 중 일부만 활성화하는 스파스(Sparse) 라우팅을 거친다. 라우터(Router)가 각 토큰에 대해 게이팅 점수(Gating Score)를 계산하고, 상위 k개 전문가만 선택해 해당 토큰의 FFN 처리를 수행한다.
Scout에서 Transformer 레이어 중 일부는 Dense Attention 레이어이고, 나머지가 MoE 레이어로 구성된 인터리브드(Interleaved) 구조를 사용한다. 모든 레이어를 MoE로 바꾸는 대신 선택적으로 배치함으로써 배포 시 메모리 대역폭 압박을 완화한다.
MoE의 배포 복잡성—전문가 분산(Expert Parallelism), 부하 균형(Load Balancing)—을 단일 GPU 환경에서 해결하기 위해 Scout는 모든 전문가를 단일 GPU VRAM에 올리거나, 오프로딩(Offloading) 기법으로 RAM 또는 NVMe SSD를 활용하는 방식을 지원한다.
256K로 훈련해 1000만 토큰까지 외삽하는 법
Scout의 또 다른 핵심 혁신은 iRoPE(Interleaved Rotary Position Embedding) 아키텍처다. 기존 RoPE(Rotary Position Embedding)를 대부분의 레이어에 적용하되, 일부 어텐션 레이어에는 위치 임베딩 없이 NoPE(No Positional Embedding) 어텐션을 인터리브한다.
NoPE 어텐션 레이어는 절대 위치에 무관하게 컨텍스트를 처리하므로, 훈련 시 사용한 256K 컨텍스트 이상으로 추론 시 길이를 외삽(Extrapolation)할 수 있는 근거가 된다. Scout가 1000만 토큰 컨텍스트 윈도우를 제공할 수 있는 것은 이 iRoPE 설계 덕분이다.
실용적 관점에서 1000만 토큰 컨텍스트는 약 750만 단어에 해당하며, 대형 코드베이스 전체나 수십 권의 책을 단일 컨텍스트로 처리할 수 있는 수준이다. 단, 소비자 GPU에서 이 최대 컨텍스트를 실제 활용하려면 KV 캐시 메모리 관리가 병목이 된다.
얼마까지 압축해야 24GB에 들어가나
Scout의 소비자 GPU 배포 가능성은 양자화(Quantization)에 의존한다. 모델 파라미터 정밀도를 낮춰 VRAM 요구량을 줄이는 이 전략은 품질-속도-메모리의 트레이드오프를 조정한다.
하드웨어별 권장 설정은 다음과 같다.
| GPU | VRAM | 권장 양자화 | 예상 속도 | 컨텍스트 |
|---|---|---|---|---|
| RTX 4090 | 24GB | Q4_K_M | ~20 tok/s | 8K–16K |
| RTX 3090 | 24GB | Q4_K_M 또는 Q8 | ~15–20 tok/s | 8K+ |
| RTX 4080 Super | 16GB | Q4_K_S + 오프로딩 | ~10 tok/s | 4K–8K |
| RTX 3080 | 10GB | 오프로딩 필수 | ~5 tok/s | 2K–4K |
| Apple M3 Ultra | 192GB | FP16 MLX | ~25 tok/s | 100K+ |
RTX 3090 기준으로 Q8 양자화(근손실 없는 수준)가 가능하며, 8K 이상 컨텍스트도 처리할 수 있다. 4비트 GGUF 포맷을 사용하면 약 27GB로 단일 24GB VRAM GPU에서도 오프로딩 없이 실행 가능하다.
GGUF(llama.cpp) 포맷은 CPU+GPU 하이브리드 추론을 지원하고, 레이어별 정밀도 혼합(Mixed Quantization)이 가능하다. 특히 MoE 전문가 레이어의 일부를 CPU RAM에 오프로딩하면서 어텐션 레이어만 GPU에 올리는 분할 배포가 가능해, VRAM이 부족한 소비자 하드웨어에서 현실적인 선택지가 된다. AWQ(Activation-aware Weight Quantization)는 활성화 분포를 고려해 가중치를 양자화하므로, 동일 비트 수에서 GGUF보다 정확도 손실이 적은 경향이 있다. RedHat AI가 공개한 Llama-4-Scout-17B-16E-Instruct-quantized.w4a16가 대표적 사례로, W4A16(가중치 4비트, 활성화 16비트) 방식을 적용했다.
시스템 수준에서 메모리를 아끼는 법
단순 양자화 외에도 소비자 GPU에서의 실용적 추론을 위해 여러 시스템 수준 최적화가 필요하다.
긴 컨텍스트를 처리할 때 KV(Key-Value) 캐시가 VRAM의 상당 부분을 차지한다. 배치 크기 1, Q4 양자화 기준으로 Scout의 KV 캐시는 컨텍스트 1만 토큰당 약 1–2GB를 추가로 소비한다. 따라서 실용적 소비자 GPU 배포에서는 컨텍스트 길이를 8K–16K 범위로 제한하는 것이 일반적이다. Flash Attention 2/3 알고리즘은 어텐션 연산을 메모리 계층 구조(HBM/SRAM)를 고려해 블록 단위로 재구성함으로써, 전체 어텐션 행렬을 VRAM에 올리지 않고도 연산이 가능하다. 소비자 GPU에서 긴 컨텍스트를 처리할 때 필수적인 최적화다.
MoE 아키텍처의 특성상 포워드 패스 당 16개 전문가 중 일부만 활성화된다. 이를 활용해 현재 활성화되지 않은 전문가 가중치를 CPU RAM이나 NVMe SSD에 저장하고, 필요할 때 GPU로 불러오는 전문가 오프로딩 기법이 가능하다. 속도 패널티가 있지만, VRAM이 충분하지 않은 환경에서 전체 모델을 실행할 수 있게 해준다.
소비자 GPU 추론 속도를 높이는 또 다른 접근법은 Speculative Decoding이다. 소형 드래프트 모델(Draft Model)이 여러 토큰을 빠르게 예측하고, Scout가 이를 검증(Verify)하는 병렬 구조로 실효 처리량을 높인다. llama.cpp와 Unsloth 등의 프레임워크에서 Scout와 함께 이 기법을 지원한다.
이미지가 토큰이 되기까지
Scout의 비전 처리 흐름은 다음과 같다. MetaCLIP 기반 비전 인코더가 입력 이미지를 패치(Patch) 단위로 분할하고, 각 패치를 고차원 벡터로 인코딩한다. 이 벡터들이 텍스트 임베딩 공간에 투영(Projection)되어 비전 토큰을 형성하고, 텍스트 토큰과 함께 Transformer에 입력된다.
이미지 해상도와 토큰 수의 관계가 VRAM 소비에 직접 영향을 준다. 고해상도 이미지일수록 더 많은 비전 토큰이 생성되어 컨텍스트 공간을 차지한다. Scout는 동적 해상도 처리를 지원해, 하드웨어 제약에 따라 이미지 토큰 수를 조정할 수 있다.
Scout는 이미지뿐 아니라 비디오 입력도 처리한다. 비디오는 프레임 샘플링 후 각 프레임을 이미지로 처리하는 방식으로, 멀티프레임 시각 이해가 가능하다. 단, 비디오는 프레임 수에 비례해 컨텍스트를 소비하므로 소비자 GPU에서는 프레임 수 제한이 실용적이다.
Unsloth는 Scout의 파인튜닝과 추론 모두를 지원하며, 동적 양자화(Dynamic Quantization)와 메모리 최적화를 통해 단일 24GB GPU에서 파인튜닝까지 가능하게 한다. Llama 4 특화 최적화가 포함되어 있어 표준 Transformers 대비 2배 이상의 속도 향상을 제공한다고 밝히고 있다. Apple Silicon(MLX) 환경에서 Scout는 통합 메모리(Unified Memory) 특성 덕분에 M3 Ultra(최대 192GB)에서 FP16 풀 정밀도로 실행 가능하다. MLX 프레임워크를 통해 Metal GPU와 Apple Neural Engine을 활용하여, 데스크톱 클래스 Apple Silicon에서도 실용적인 멀티모달 추론이 가능하다.
실제로 얼마나 잘하는가
Scout는 Gemma 3, Gemini 2.0 Flash-Lite, Mistral 3.1 등 동급 모델 대비 다양한 벤치마크에서 우위를 보인다. 특히 멀티모달 이해(Multimodal Understanding), 비주얼 QA(Visual Question Answering), 긴 문서 이해(Long Document Understanding) 분야에서 강점이 두드러진다.
오픈 웨이트 모델이라는 특성상 로컬 배포와 파인튜닝이 자유롭고, Meta의 Llama 라이선스 조건 하에 상업적 활용도 허용된다. 이는 기업이 내부 데이터로 파인튜닝하거나 엣지 디바이스에 커스텀 배포하는 시나리오에서 큰 의미를 가진다.
Meta Llama 4 Scout는 Early Fusion 기반 네이티브 멀티모달리티, MoE 스파스 활성화, iRoPE 위치 인코딩이라는 핵심 아키텍처 선택으로 17B 활성 파라미터 모델이 단일 소비자 GPU에서 동작 가능한 엣지 추론 경계를 새롭게 정의했다. 4비트 양자화와 전문가 오프로딩, Flash Attention 등 시스템 수준 최적화 기법을 함께 적용하면 RTX 3090 단 한 장으로도 실용적인 멀티모달 추론이 가능하며, 오픈 웨이트 특성과 결합해 엣지 AI 배포의 접근성을 크게 낮추고 있다. 1000만 토큰 컨텍스트와 비전-언어 통합 추론 능력을 소비자 하드웨어에서 활용할 수 있다는 점은 온디바이스 AI 애플리케이션 개발 패러다임에 의미 있는 전환점을 제시한다.
Sources
- The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation
- meta-llama/Llama-4-Scout-17B-16E-Instruct · Hugging Face
- Unmatched Performance and Efficiency | Llama 4
- Llama 4 Hardware Guide — Scout 12GB, Maverick 48GB+ | Compute Market
- NVIDIA Accelerates Inference on Meta Llama 4 Scout and Maverick | NVIDIA Technical Blog
- Llama 4's Architecture Deconstructed: MoE, iRoPE, and Early Fusion Explained
- Welcome Llama 4 Maverick & Scout on Hugging Face
- Llama 4: How to Run & Fine-tune | Unsloth Documentation
- Llama 4 Scout on MLX: The Complete Apple Silicon Guide (2026)
- RedHatAI/Llama-4-Scout-17B-16E-Instruct-quantized.w4a16 · Hugging Face