NVIDIA Vera Rubin AI 팩토리 플랫폼의 통합 아키텍처
NVIDIA Vera Rubin NVL72의 Rubin GPU, Vera CPU, NVLink 6, BlueField-4 DPU 구성과 추론 비용 절감 구조를 정리한다.
2026-08-14 · 최초 발행 2026-04-29
NVL72가 묶는 AI 팩토리의 범위
NVIDIA는 CES 2026 기조연설에서 Vera Rubin 플랫폼의 전량 양산 전환을 공식 선언했다. 핵심 구성인 NVL72는 7종의 신규 칩을 하나의 시스템으로 결합하며, Blackwell 대비 추론 토큰 비용을 10분의 1로 줄이는 것을 목표로 한다. AWS, Google Cloud, Microsoft, OCI 등 주요 클라우드 파트너는 2026년 하반기부터 Vera Rubin 기반 인스턴스를 제공할 예정이다.
NVIDIA가 말하는 Vera Rubin의 설계 방향은 극한의 공동 설계(Extreme Co-Design)다. 6종의 칩이 독립된 역할을 맡되, 결과적으로는 하나의 AI 슈퍼컴퓨터처럼 작동하도록 구성했다.
플래그십인 Vera Rubin NVL72에는 Rubin GPU 72개와 Vera CPU 36개가 NVLink 6로 연결된다. NVFP4 추론 성능은 시스템 전체 기준 3.6 엑사플롭스(EFLOPS), 학습 성능은 2.5 EFLOPS이며 스케일업 대역폭은 260 TB/s다.
Rubin GPU가 바꾼 메모리와 연산 경로
Rubin GPU는 3,360억 개 트랜지스터를 두 개의 레티클 다이(Reticle Die)에 담았다. NVFP4 정밀도에서 추론 성능은 50 페타플롭스(PFLOPs), 학습 성능은 35 PFLOPs다.
메모리는 HBM4를 채택했다. HBM3e보다 인터페이스 폭을 두 배로 넓혔고, 메모리 컨트롤러 재설계와 메모리 에코시스템 공동 엔지니어링을 통해 Blackwell 대비 메모리 대역폭을 2.8배 향상시켰다. 총 메모리 대역폭은 22 TB/s다.
연산 경로에는 하드웨어 가속 적응형 압축(Hardware-Accelerated Adaptive Compression)을 포함한 3세대 Transformer Engine이 들어간다. 모델 정확도를 유지하면서 연산 밀도를 높여 와트당 처리량을 끌어올리는 방식이다.
CPU·GPU·네트워크를 하나의 경로로 연결하는 방식
Vera CPU와 Rubin GPU 사이에는 2세대 NVLink-C2C 인터커넥트가 놓인다. 이 경로는 1.8 TB/s의 일관성(Coherent) 대역폭을 제공하며, CPU와 GPU가 동일한 주소 공간(Unified Address Space)을 공유하게 한다. 따라서 LPDDR5X의 CPU 메모리와 HBM4의 GPU 메모리를 단일 메모리 풀처럼 다룰 수 있다.
Vera CPU는 NVIDIA가 자체 설계한 88코어 Olympus 아키텍처를 기반으로 한다. Arm 완전 호환을 유지하면서 단일 스레드 성능과 에너지 효율을 높이는 데 초점을 맞췄다. CPU·GPU 일관 메모리 통합은 KV 캐시 오프로드와 다중 모델 동시 실행 같은 고급 추론 기법의 기반이 된다.
인프라 처리를 DPU로 분리하는 이유
BlueField-4 DPU(Data Processing Unit)는 64코어 NVIDIA Grace CPU를 탑재한 이중 다이(Dual-Die) 패키지다. 인프라 오프로드와 보안을 맡아 호스트 CPU에서 네트워크 처리 부하를 완전히 분리한다.
- 스토리지 I/O 가속: NVMe-oF 및 분산 스토리지 프로토콜 처리
- 네트워크 가상화: VXLAN/GENEVE 터널링, 분산 방화벽, 마이크로세그멘테이션
- 보안 처리: 암호화/복호화, 인증서 관리, 신뢰 실행 환경(TEE)
이 역할 분리는 Rubin GPU가 AI 연산에 집중하도록 만든다. AI 팩토리 클러스터에서 GPU 활용률(GPU Utilization)을 높이는 데도 직접 연결된다.
NVL72 안팎의 통신 계층
NVLink 6 스위치는 6세대 스케일업 패브릭이다. GPU 간 대역폭은 3.6 TB/s이며, NVL72 내부의 Rubin GPU 72개는 올-투-올(All-to-All) 통신을 수행한다. MoE(Mixture-of-Experts) 학습에서 필요한 Expert Parallelism과 대규모 배치 추론 모두를 겨냥한 구성이다.
ConnectX-9 SuperNIC은 스케일아웃 네트워킹의 엔드포인트 역할을 한다. 데이터센터의 여러 NVL72 랙을 연결해 초대형 AI 클러스터를 구성한다.
Spectrum-6 Ethernet 스위치는 동봉형 광학(Co-Packaged Optics)을 적용한 스케일아웃 이더넷 스위치다. 효율성과 신뢰성을 높이고, 대규모 AI 팩토리에서 테라비트급 이더넷 패브릭을 제공한다.
토큰 비용을 낮추는 결합 효과
Blackwell 대비 추론 토큰 비용 10분의 1 절감은 단일 구성 요소의 성능이 아니라 여러 계층의 결합에서 나온다.
| 아키텍처 요소 | Blackwell 대비 개선 |
|---|---|
| HBM4 메모리 대역폭 | 2.8x 향상 (KV 캐시 병목 완화) |
| NVFP4 Transformer Engine | 연산 밀도 극대화, 정밀도 손실 최소화 |
| NVLink-C2C 일관 메모리 | CPU-GPU 데이터 이동 오버헤드 제거 |
| BlueField-4 DPU 오프로드 | GPU 활용률 극대화 |
| NVLink 6 스위치 | 분산 추론 지연 최소화 |
| 시스템 전체 전력 효율 | 와트당 토큰 처리량 대폭 향상 |
MoE 학습 효율도 이 플랫폼이 강조하는 지점이다. NVIDIA는 Rubin 기반 시스템이 Blackwell 대비 4분의 1의 GPU로 동일한 MoE 모델 학습이 가능하다고 밝혔다.
Hopper에서 Rubin까지 이어진 플랫폼 변화
NVIDIA는 1년 주기 플랫폼 갱신 전략을 유지하고 있다. Rubin은 Hopper(H100)와 Blackwell(B100/B200)을 잇는 3세대 플랫폼이다.
- Hopper(H100): HBM2e, NVLink 4, Transformer Engine 1세대, FP8 지원
- Blackwell(B200): HBM3e, NVLink 5, Transformer Engine 2세대, FP6/FP4 지원
- Rubin(R100): HBM4(2.8x BW), NVLink 6(3.6 TB/s), Transformer Engine 3세대, NVFP4 하드웨어 가속
Rubin의 변화는 GPU 성능 향상만으로 설명되지 않는다. Vera CPU와 Rubin GPU의 이종 통합, HBM4와 LPDDR5X를 묶는 일관 메모리 풀이 AI 팩토리의 운영 모델 자체를 바꾸는 축이다.
클라우드 공급은 점진적 병렬 배포를 따른다
Vera Rubin NVL72의 볼륨 생산에 맞춰 AWS, Google Cloud, Microsoft Azure, OCI는 2026년 하반기 1차 클라우드 파트너로 배포를 준비하고 있다. CoreWeave, Lambda, Nebius, Nscale 같은 NVIDIA 클라우드 파트너도 초기 배포에 합류한다.
하이퍼스케일러는 이미 Blackwell 기반 GPU 인스턴스를 대규모로 운영하고 있다. Rubin으로의 전환은 기존 환경을 한 번에 교체하기보다 점진적인 병렬 배포 방식으로 이뤄질 전망이다.
Vera Rubin은 HBM4 기반 2.8배 메모리 대역폭 향상, NVLink-C2C 일관 메모리 통합, BlueField-4 DPU 오프로드, NVLink 6 스위치 패브릭을 결합한 AI 팩토리 아키텍처다. 2026년 하반기 볼륨 생산과 주요 클라우드 파트너의 인스턴스 공급이 맞물리면 AI 추론 비용의 대규모 하락과 에이전틱 AI 서비스의 경제성 확보가 가속화될 것이다.
Sources
- Inside the NVIDIA Vera Rubin Platform: Six New Chips, One AI Supercomputer | NVIDIA Technical Blog
- NVIDIA Kicks Off the Next Generation of AI With Rubin | NVIDIA Newsroom
- Nvidia CEO confirms Vera Rubin NVL72 is now in production | Tom's Hardware
- Nvidia launches Vera Rubin NVL72 AI supercomputer at CES | Tom's Hardware
- NVIDIA Vera Rubin NVL72 Detailed: 72 GPUs, 36 CPUs, 260 TB/s Scale-Up Bandwidth | VideoCardz
- Infrastructure for Scalable AI Reasoning | NVIDIA Vera Rubin Platform
- NVIDIA Vera Rubin NVL72 | Co-Designed Infrastructure for Agentic AI