Llama 4가 로컬 LLM 커뮤니티를 갈라놓은 이유: MoE는 빨랐지만 메모리는 배신했다

Meta Llama 4 Scout·Maverick·Behemoth의 MoE 아키텍처와 벤치마크 성능, r/LocalLLaMA 커뮤니티의 실사용 평가와 로컬 실행 하드웨어 요구사항을 정리한다.

2026-08-14 · 최초 발행 2026-04-03

Meta의 Llama 4가 프론티어 모델과 경쟁 가능한 수준에 도달했다는 평가가 이어지고 있다. Scout, Maverick, Behemoth 세 가지 변형 모델로 구성된 Llama 4 패밀리는 MoE(Mixture of Experts) 아키텍처를 채택해 파라미터 효율성과 추론 성능을 동시에 노렸다. 다만 r/LocalLLaMA 커뮤니티의 실사용 후기는 기대와 우려가 함께 뒤섞인 모습이다.

Scout·Maverick·Behemoth로 나뉜 패밀리

Meta는 Llama 4를 세 가지 변형으로 공개했다. 각 모델은 서로 다른 규모와 용도를 대상으로 설계됐다.

모델 총 파라미터 활성 파라미터 Expert 수 컨텍스트 길이 상태
Llama 4 Scout 109B 17B 16 1,000만 토큰 공개
Llama 4 Maverick 400B 17B 128 100만 토큰 공개
Llama 4 Behemoth 2T 288B 16 미공개 훈련 중

Llama 4는 Meta 최초의 MoE 아키텍처 기반 오픈 모델이다. MoE 아키텍처는 전체 파라미터를 여러 소규모 "전문가(Expert)" 네트워크로 분할하고, 라우터가 각 토큰을 관련 전문가에게만 전달해 추론 시 연산 비용을 대폭 줄이는 구조다.

Llama 모델 진화 과정Llama 1 (2023)Llama 2 (2023)Llama 3 (2024)Llama 3.1 (2024)Llama 4 (2026)7B / 13B / 33B / 65B7B / 13B / 70B8B / 70B8B / 70B / 405BScout 109B (MoE)Maverick 400B (MoE)Behemoth 2T (MoE)17B 활성, 10M 컨텍스트17B 활성, 1M 컨텍스트288B 활성, 훈련

Scout는 109B 총 파라미터 중 17B만 활성화돼 GPT-4급 품질을 유지하면서도 추론 속도가 매우 빠르다. Maverick의 아키텍처는 DeepSeek V3와 유사한 극단적 희소성(extreme sparsity)과 다수 전문가 구조를 채택했다.

프론티어 모델과 나란히 놓인 벤치마크

ArtificialAnalysis는 Llama 4 모델들을 "최고 수준의 비추론(non-reasoning) 모델"로 평가하며, 주요 프론티어 모델을 벤치마크에서 앞선다고 분석했다. Maverick은 멀티모달 종합에서 최고 수준을 보이며(GPT-4o·Gemini 2.0 Flash는 하위, DeepSeek V3는 비교 가능 수준), 추론·코딩에서는 DeepSeek V3 수준(활성 파라미터 17B, DeepSeek V3는 37B)으로 평가됐다. Scout는 Gemma 3, Gemini 2.0 Flash-Lite, Mistral 3.1을 광범위한 벤치마크에서 앞서는 성능을 보였고, 특히 1,000만 토큰의 컨텍스트 윈도우는 오픈·클로즈드 모델을 통틀어 업계 최장 수준이다. 아직 훈련 중인 Behemoth는 288B 활성 파라미터로 GPT-4.5, Claude Sonnet 3.7, Gemini 2.0 Pro를 여러 STEM 벤치마크에서 앞서는 것으로 보고됐다.

커뮤니티는 반으로 갈렸다

로컬 LLM 커뮤니티의 반응은 기대와 우려가 공존하는 양상이다. 긍정적인 쪽에서는 중고 RTX 3090(약 700달러)으로 Scout Q8 양자화 모델을 대화 속도로 실행할 수 있다는 점을 꼽는다 — GPT-4급 품질을 eBay에서 구입 가능한 GPU로 달성할 수 있다는 뜻이다. 최초의 오픈웨이트 네이티브 멀티모달 모델로 이미지 이해와 텍스트 생성을 단일 모델에서 처리할 수 있다는 점, Scout의 1,000만 토큰 컨텍스트가 전체 코드베이스나 대규모 문서를 한 번에 처리할 수 있는 수준이라는 점도 호평받는다.

우려하는 쪽은 MoE 구조로 인해 총 파라미터가 커서 메모리 제약이 있는 "GPU 빈곤층(GPU-poor)" 사용자에게 부담이 된다는 점, 낮은 비트 양자화 시 MoE 모델의 성능 저하가 Dense 모델보다 클 수 있다는 보고를 지적한다. r/LocalLLaMA 커뮤니티의 일부 사용자는 Llama 시리즈를 중심으로 명명된 커뮤니티임에도 MoE의 높은 메모리 요구량이 로컬 실행 커뮤니티의 취지에 맞지 않는다는 불만을 표출하고 있다.

로컬에서 돌리려면 무엇이 필요한가

모델 양자화 최소 VRAM 권장 GPU 예상 속도
Scout Q8 24GB RTX 3090/4090 대화 수준
Scout Q4 16GB RTX 4080 대화 수준
Maverick Q8 8x H100 DGX H100 고속
Maverick Q4 4x A100 클라우드 권장 중속

Scout 모델은 단일 H100에서 Int4 양자화로 실행 가능하며, 소비자급 GPU에서도 양자화를 통해 실행할 수 있다는 점이 로컬 LLM 커뮤니티에서 가장 주목받는 부분이다.

오픈 모델 생태계가 받은 충격

Llama 4의 등장은 오픈 모델 생태계에 영향을 미치고 있다. 오픈 모델에서 MoE 아키텍처의 실용성을 증명하며 후속 오픈 모델들의 아키텍처 선택에 영향을 주는 MoE 대중화, 오픈웨이트 모델이 클로즈드 프론티어 모델과 경쟁 가능한 수준에 도달한 첫 사례라는 프론티어 격차 축소, Hugging Face를 통한 무료 배포로 파인튜닝·양자화·특화 모델 개발 등 후속 생태계가 활성화되는 생태계 확장이다.

Llama 4는 오픈웨이트 모델이 프론티어 모델과 경쟁 가능한 수준에 도달했음을 보여주는 이정표적 모델이다. MoE 아키텍처를 통한 파라미터 효율성과 업계 최장 컨텍스트 윈도우는 기술적 진보를 대표하고, 소비자급 GPU에서의 실행 가능성은 AI 민주화의 새 장을 열고 있다. 다만 메모리 요구량과 양자화 품질 저하 문제는 로컬 LLM 커뮤니티에서 계속 논의되어야 할 과제로 남아 있다.

Sources

Llama4MoELocalLLaMA오픈웨이트모델로컬LLM