Llama 4 Scout 아키텍처 해부: Early Fusion과 MoE가 만나는 지점

Llama 4 Scout의 Early Fusion 비전-언어 통합, 128개 Expert 라우팅 구조, 양자화별 하드웨어 요구사항과 TensorRT-LLM 가속을 정리한다.

2026-08-14 · 최초 발행 2026-04-17

Meta가 Llama 4 패밀리의 첫 번째 모델로 공개한 Llama 4 Scout은 17B 활성 파라미터와 16개 전문가(Expert)로 구성된 Mixture-of-Experts(MoE) 기반 비전-언어 통합 모델이다. 총 109B 파라미터 규모임에도 단일 H100 GPU에서 구동 가능하며, INT4 양자화 적용 시 RTX 3090급 소비자 GPU에서도 대화 수준의 추론 속도를 달성한다.

17B가 연산하고 109B가 기억한다

Meta가 2025년 4월 공개한 Llama 4 Scout의 핵심 스펙은 토큰당 실제 연산에 참여하는 활성 파라미터 17B, 16개 Expert 전체 가중치를 합산한 총 파라미터 109B, Mixture-of-Experts(MoE)와 Early Fusion 멀티모달을 결합한 아키텍처, Llama 3 대비 약 78배 확장된 10M 토큰 컨텍스트 윈도우, 약 40조 토큰 규모의 멀티모달 학습 데이터, 오픈 가중치인 Llama Community License, Hugging Face·AWS·Azure·GCP·NVIDIA NIM·Ollama 등 다양한 지원 플랫폼이다. Llama 3.1 405B 대비 활성 파라미터가 약 4%에 불과하면서도 이미지 이해·장문맥 작업에서 동급 최강 성능을 기록했다.

128개 중 1개만 깨우는 라우팅

Scout의 핵심 설계 원리는 "총 파라미터는 크게, 활성 파라미터는 작게"라는 MoE 패러다임이다. 128개 라우티드 Expert가 토큰별로 1개만 활성화되고, 1개 공유 Expert(Shared Expert)가 모든 토큰이 공통으로 거치는 베이스라인 레이어를 담당하며, Dense 레이어와 MoE 레이어가 교대로 배치되고, 게이트 네트워크가 입력 토큰의 임베딩을 기반으로 최적 Expert를 선택한다.

입력 토큰게이트 네트워크(Router)공유 Expert(Shared)라우티드 Expert 1라우티드 Expert 2...라우티드 Expert 128출력 결합(Aggregation)다음 레이어

이 구조의 핵심 이점은 추론 시 17B 파라미터만 연산에 참여하므로 동일 크기의 Dense 모델(17B)과 유사한 추론 속도를 유지하면서 109B급 지식 용량을 확보한다는 점이다.

항목 Dense 17B Llama 4 Scout MoE
총 파라미터 17B 109B
활성 파라미터 17B 17B
추론 FLOPs/토큰 기준값 기준값과 유사
지식 용량 17B급 109B급
VRAM 요구량 ~34GB (FP16) ~55GB (INT4)

첫 레이어부터 이미지와 텍스트를 함께 본다

Scout은 별도 비전 인코더를 후속 연결하는(late fusion) 기존 방식 대신, 트랜스포머 첫 번째 레이어부터 텍스트와 이미지 토큰을 공동 처리하는 Early Fusion 방식을 채택했다. 이미지를 시각 토큰으로 변환하는 MetaCLIP 기반 향상형 비전 인코더, 시각 토큰이 텍스트 토큰과 동일한 임베딩 공간에 매핑되는 토큰 통합 방식, 첫 번째 트랜스포머 레이어부터 텍스트-이미지 크로스 어텐션을 수행하는 공동 어텐션(Joint Attention), 40조 토큰 중 상당 비율이 이미지-텍스트 페어 데이터인 멀티모달 프리트레이닝으로 구성된다.

입력 이미지MetaCLIP 비전 인코더시각 토큰(Visual Tokens)입력 텍스트텍스트 토크나이저텍스트 토큰(Text Tokens)통합 임베딩 공간(Early Fusion)MoE 트랜스포머(Dense + Expert 교차)멀티모달 출력

이미지 이해 벤치마크에서는 다음과 같은 성능을 보였다.

벤치마크 Llama 4 Scout Gemini 2.0 Flash-Lite Gemma 3
ChartQA 88.8 73.0 -
DocVQA (test) 94.4 91.2 -
전반적 이미지 이해 동급 최강 - Scout 대비 열세

차트 해석(ChartQA)에서 15.8점 차이로 Gemini 2.0 Flash-Lite를 압도했고, 문서 이해(DocVQA)에서도 3.2점 우위를 확보했다.

BF16 218GB에서 Q2 25GB까지

Scout의 MoE 구조는 엣지 배포에서 양면성을 갖는다. 활성 파라미터는 17B로 추론 연산이 가볍지만, 전체 109B 가중치를 메모리에 적재해야 하는 제약이 있다.

양자화 수준 모델 크기 최소 VRAM 대표 하드웨어
BF16 (원본) ~218GB 1x H100 80GB+ 데이터센터 GPU
INT8 ~109GB 2x RTX 4090 하이엔드 워크스테이션
INT4 ~55GB 1x H100 또는 RTX 3090 서버/고성능 PC
Q4_K_M (GGUF) ~40GB Mac M4 Pro 48GB 소비자 데스크톱
Q2 (초경량) ~25GB Mac M4 Pro 24GB 소비자 랩톱

소비자 하드웨어 구동 현황을 보면 RTX 3090(24GB)은 Q8 양자화 적용 시 대화 수준 속도로 구동 가능하고, Mac Mini M4 Pro(24GB)는 Q4 양자화로 Ollama를 통한 로컬 추론이 가능하며, RTX 4090(24GB)은 Q4 양자화로 비전 태스크를 포함해 원활하게 추론한다. 다만 진정한 엣지 디바이스(NVIDIA Jetson, 모바일 등)에서의 직접 구동은 현재 기술적 한계가 있다. MoE 구조 특성상 비활성 Expert도 메모리에 상주해야 하는 메모리 병목, 디스크-메모리 간 Expert 스와핑 시 지연 시간이 급증하는 Expert 오프로딩, 스마트폰급 8~12GB RAM으로는 최소 양자화도 불충분한 모바일 배포 불가, 이론적으로 가능하나 Expert 로딩 지연으로 실용성이 부족한 Jetson Orin(64GB)이 그 예다. 향후 Expert 프루닝(Pruning)·지식 증류(Knowledge Distillation)를 통한 Scout-Mini급 파생 모델이 엣지 배포의 핵심 과제로 부상할 전망이다.

코드베이스 전체를 한 프롬프트에

Scout의 1,000만 토큰 컨텍스트 윈도우는 오픈소스 모델 중 업계 최대 수준이며, 수만 파일 규모의 리포지토리를 단일 프롬프트에 입력하는 전체 코드베이스 분석, 수천 페이지 분량의 계약서·판례를 동시 분석하는 법률 문서 일괄 검토, 검색-증강 생성 없이 원문을 직접 참조하는 대규모 문서 RAG 대체, 수백 장의 이미지와 텍스트를 결합한 복합 분석이 가능한 멀티모달 장문맥 시나리오를 지원한다. 장문맥 검색 정확도(Long-Context Retrieval Accuracy)에서 Scout은 Maverick을 포함한 오픈소스 모델 중 최상위 성능을 기록했다.

초당 4만 토큰, TensorRT-LLM 가속

NVIDIA는 Llama 4 Scout에 대한 TensorRT-LLM 최적화를 공식 지원한다. NVIDIA Blackwell B200에서 초당 40,000+ 토큰 처리를 달성했고, Blackwell 아키텍처 전용 4비트 부동소수점 최적화인 FP4 양자화, MoE Expert를 다수 GPU에 분산 배치해 처리량을 극대화하는 Expert 병렬 처리, 컨테이너 기반 원클릭 배포로 프로덕션 서빙을 간소화하는 NIM 마이크로서비스, 소형 드래프트 모델로 토큰 생성 속도를 가속하는 Speculative Decoding을 지원한다.

Scout의 등장은 오픈소스 멀티모달 AI 생태계의 경쟁 구도를 재편했다.

모델 개발사 파라미터 멀티모달 컨텍스트 MoE
Llama 4 Scout Meta 17B/109B 비전+텍스트 10M O
Gemma 4 E4B Google 4B 비전+텍스트+오디오 128K X
Qwen 3.5 72B Alibaba 72B 비전+텍스트 128K X
Mistral 3.1 Mistral 24B 비전+텍스트 128K X

Scout은 MoE 아키텍처와 10M 컨텍스트 윈도우로 차별화되며, 특히 장문맥 멀티모달 태스크에서 독보적 위치를 점유한다.

Llama 4 Scout은 "대형 모델의 지식 용량을 소형 모델의 추론 비용으로"라는 MoE의 이상을 멀티모달 영역까지 확장한 모델이다. 109B 총 파라미터가 제공하는 지식 깊이와 17B 활성 파라미터가 보장하는 추론 효율성의 균형은, 데이터센터뿐 아니라 고성능 소비자 하드웨어에서도 실용적 멀티모달 AI 서비스를 가능하게 한다. 다만 진정한 엣지 디바이스 배포에는 Expert 프루닝과 지식 증류 등 추가 경량화 기술이 필수적이며, 이 영역의 후속 연구가 오픈소스 멀티모달 AI의 다음 전장을 결정할 것이다.

Sources

Llama4ScoutMoEEarlyFusionTensorRT-LLM양자화