1200억 개 중 120억 개만 깨운다 — NVIDIA Nemotron 3 Super
2026년 3월 11일 GTC에서 공개된 NVIDIA Nemotron 3 Super의 Mamba-Transformer-MoE 하이브리드 아키텍처와 벤치마크, 오픈소스 배포 전략, Perplexity·CodeRabbit 등 도입 사례를 정리한다.
2026-08-14 · 최초 발행 2026-03-14
1200억 개의 파라미터를 갖고 있지만, 추론할 때 실제로 깨어나는 건 120억 개뿐이다. 2026년 3월 11일 GTC에서 NVIDIA가 공개한 Nemotron 3 Super는 이런 절제된 활성화로 에이전틱 AI 시스템의 두 가지 병목 — "컨텍스트 폭발"과 "사고 세금" — 을 풀려는 완전 오픈소스 하이브리드 MoE 모델이다.
에이전트가 토큰을 삼키는 이유
현대의 멀티에이전트 시스템은 일반 대화 대비 최대 15배 많은 토큰을 생성한다. 에이전트가 매 추론 단계마다 대화 히스토리, 도구 출력, 중간 추론 결과를 반복적으로 전송하기 때문이다. 이로 인해 두 가지 문제가 생긴다.
컨텍스트 폭발(Context Explosion)은 장시간 태스크에서 컨텍스트 윈도우가 급격히 늘어나면서 에이전트가 원래 목표를 잃어버리는 "목표 표류(goal drift)" 현상이다. 기존 모델은 수십만 토큰의 컨텍스트를 효율적으로 처리하지 못해 성능이 급락한다.
사고 세금(Thinking Tax)은 모든 하위 태스크에 대용량 추론 모델을 적용하면서 비용과 지연 시간이 폭발적으로 늘어나는 문제다. 복잡한 소프트웨어 엔지니어링 에이전트나 사이버보안 트리아지 시스템을 실제 환경에서 운영하기 어렵게 만드는 근본 원인이다.
Nemotron 3 Super는 이 두 문제를 동시에 겨냥한 아키텍처 혁신을 통해, 높은 정확도를 유지하면서도 경쟁 모델 대비 월등히 높은 처리량을 실현했다.
Mamba-2·Transformer·LatentMoE가 한 모델에 모였다
Nemotron 3 Super는 Mamba-2 레이어와 Transformer Attention 레이어를 혼합한 하이브리드 아키텍처를 채택했다. Mamba-2는 선형 복잡도로 긴 시퀀스를 처리하는 상태 공간 모델(SSM)로, 기존 Transformer의 이차 복잡도 문제를 해소한다. Transformer 레이어는 글로벌 어텐션을 통해 정확한 추론 능력을 보완한다. 이 조합 덕분에 1M 토큰 컨텍스트에서도 GPT-OSS-120B와 Qwen3.5-122B를 RULER 벤치마크 기준으로 앞선다.
기존 MoE(Mixture-of-Experts) 방식은 토큰을 그대로 전문가에게 라우팅한다. LatentMoE는 토큰을 잠재 공간으로 압축한 뒤 라우팅함으로써, 동일한 연산 비용에서 4배 많은 전문가를 활성화할 수 있다. 전체 512개 전문가 중 매 사이클마다 22개가 활성화되며, 이는 FLOP당 정확도와 파라미터당 정확도를 모두 최적화하는 구조다.
Nemotron 3 Super는 Nemotron 3 시리즈 최초로 NVFP4(4비트 부동소수점) 정밀도로 처음부터 사전학습되었다. 학습 후 양자화하는 기존 방식과 달리, 처음부터 4비트로 학습하면 정확도 손실 없이 메모리와 연산 효율을 극대화할 수 있다. MTP(Multi-Token Prediction) 레이어를 내장해 네이티브 추론 가속도 지원한다 — 여러 토큰을 병렬로 예측하는 방식으로 생성 속도를 대폭 높인다. 이 두 기술의 결합으로 64GB 하드웨어에서도 양자화 상태로 배포할 수 있다.
25조 토큰을 어떻게 학습시켰나
Nemotron 3 Super는 25조 토큰으로 사전학습됐으며, 이후 고품질 레이블 데이터를 활용한 지도 학습인 SFT(Supervised Fine-Tuning)와 추론·코딩·도구 호출 등 에이전틱 태스크에 최적화하는 RL(Reinforcement Learning) 단계의 후처리 학습이 적용됐다.
NVIDIA는 모델 가중치뿐 아니라 사전학습 데이터셋과 학습 레시피까지 전체를 오픈소스로 공개했다. 단순한 모델 배포를 넘어 AI 생태계 전반에 기여하겠다는 의지를 보여준다.
벤치마크로 확인한 처리량
| 벤치마크 | Nemotron 3 Super | GPT-OSS-120B | Qwen3.5-122B |
|---|---|---|---|
| PinchBench | 85.6% | - | - |
| SWE-Bench Verified | 60.47% | - | - |
| RULER 1M Context | 91.75% | 낮음 | 낮음 |
| AI Intelligence Index | 36 | 비교 대상 | 비교 대상 |
| 추론 처리량 (8k/16k) | 기준 | 0.45x | 0.13x |
특히 DeepResearch Bench에서 1위를 기록했으며, 장문 컨텍스트 처리 능력을 측정하는 RULER 1M에서 91.75%로 경쟁 모델들을 크게 앞질렀다. SWE-Bench Verified 60.47%는 실제 소프트웨어 엔지니어링 이슈 해결 능력을 검증하는 핵심 지표로, 코드 에이전트 적용 가능성을 직접 시사한다.
HuggingFace·NIM·온프레미스로 접근한다
NVIDIA는 세 가지 채널로 Nemotron 3 Super 접근을 지원한다. 완전 오픈소스로는 HuggingFace에서 가중치, 데이터셋, 훈련 레시피를 NVIDIA Nemotron 라이선스로 무료 제공해, 연구자와 개발자가 커스터마이징 없이 즉시 활용하거나 파인튜닝할 수 있다. NVIDIA NIM은 클라우드 기반 API를 통한 즉시 배포를 지원하며, AWS, Azure, GCP 등 주요 클라우드에서 NIM 마이크로서비스로 제공되어 인프라 관리 부담 없이 엔터프라이즈 수준 배포가 가능하다. 온프레미스는 NVFP4 양자화 버전으로 64GB 메모리 하드웨어에서 운영 가능해, 데이터 주권이 중요한 기업 환경에 적합하다.
출시 당일부터 붙은 기업들
Perplexity는 검색 서비스에 Nemotron 3 Super를 도입하고, Computer 제품에서 20개 오케스트레이션 모델 중 하나로 활용한다. 높은 처리량이 실시간 검색 에이전트 운영에 직접 기여한다.
CodeRabbit은 AI 코드 리뷰 에이전트에 통합했다. Nemotron Nano에서 Super로 업그레이드하면서 대규모 코드베이스의 컨텍스트 수집 속도와 리뷰 요약 품질을 모두 향상시켰다. 1M 토큰 컨텍스트가 대형 PR 처리를 가능케 했다.
Factory / Greptile은 소프트웨어 개발 에이전트에 독점 모델과 함께 Nemotron 3 Super를 혼합 사용해, 높은 정확도를 낮은 비용으로 달성하는 하이브리드 전략을 구현했다.
Edison AI 등 생명과학 및 프론티어 AI 기관들은 장문 문서 분석과 복잡한 추론 태스크에 활용한다.
Nebius Token Factory에서도 즉시 접근 가능하며, 이미 주요 클라우드와 독립 추론 플랫폼들이 지원을 선언했다.
시리즈 안에서의 자리
Nemotron 3 Super는 Nano(2025년 12월 출시) 이후 두 번째 모델로, 에이전틱 추론에 특화된 중대형 모델을 포지셔닝한다. "Super"라는 이름은 Nano보다 큰 파라미터 규모와 에이전틱 태스크에서의 우월한 성능을 함께 반영한다.
가중치만이 아니라 학습법까지 공개한 이유
NVIDIA가 단순한 모델 가중치가 아닌 데이터셋과 학습 레시피까지 공개한 것은 전략적으로 중요하다. OpenAI의 GPT-OSS나 Meta의 Llama 시리즈와 달리, 학습 방법론 전체를 투명하게 공개함으로써 학계와 개발자 커뮤니티의 신뢰를 확보하고 생태계 주도권을 노린다. NVFP4 포맷의 공개는 NVIDIA GPU에 최적화된 추론 워크플로우 표준화를 유도하는 효과도 있다.
Nemotron 3 Super는 Mamba-2, Transformer, LatentMoE의 세 아키텍처 혁신을 결합해 GPT-OSS-120B 대비 2.2배, Qwen3.5-122B 대비 7.5배 높은 처리량을 달성하면서도 비교 가능한 정확도를 유지한다. 1M 토큰 컨텍스트 지원과 64GB 하드웨어 배포 가능성은 이 모델을 연구소 수준을 넘어 실제 프로덕션 에이전트에 적합한 선택으로 만든다.
Sources
- https://developer.nvidia.com/blog/introducing-nemotron-3-super-an-open-hybrid-mamba-transformer-moe-for-agentic-reasoning/
- https://blogs.nvidia.com/blog/nemotron-3-super-agentic-ai/
- https://research.nvidia.com/labs/nemotron/Nemotron-3-Super/
- https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Super-Technical-Report.pdf
- https://build.nvidia.com/nvidia/nemotron-3-super-120b-a12b/modelcard
- https://venturebeat.com/technology/nvidias-new-open-weights-nemotron-3-super-combines-three-different
- https://artificialanalysis.ai/articles/nvidia-nemotron-3-super-the-new-leader-in-open-efficient-intelligence
- https://llm-stats.com/blog/research/nemotron-3-super-launch
- https://maximelabonne.substack.com/p/nemotron-3-super-nvidias-gpt-oss
- https://allclaw.org/blog/nemotron-3-super-nvidia-hybrid-moe-agentic-ai-benchmarks
- https://www.coderabbit.ai/blog/faster-code-reviews-with-nemotron-3-super
- https://nebius.com/blog/posts/nemotron3-super-now-available