NVIDIA Rubin CPX가 겨냥한 대규모 컨텍스트 추론 인프라

128GB GDDR7과 30페타플롭스 NVFP4 성능을 갖춘 Rubin CPX의 설계 방향과 Vera Rubin NVL144 CPX 구성을 분석한다.

2026-08-14 · 최초 발행 2026-04-08

학습용 GPU와 다른 문제를 겨냥하다

NVIDIA가 공개한 Rubin CPX는 대규모 컨텍스트 AI 추론에 특화된 새로운 GPU 클래스다. 128GB GDDR7 메모리와 30페타플롭스 NVFP4 연산 성능을 갖추고, 100만 토큰 이상의 장문 컨텍스트 워크로드를 효율적으로 처리하도록 설계됐다. 이를 랙 단위로 구성한 Vera Rubin NVL144 CPX는 단일 랙에서 8엑사플롭스의 AI 성능을 제공한다.

기존 Rubin GPU가 AI 학습과 추론을 모두 맡는 범용 고성능 가속기라면, Rubin CPX는 대규모 컨텍스트 추론에 설계의 초점을 좁혔다.

NVIDIA Rubin 아키텍처Rubin GPU(범용 AI 학습/추론)Rubin CPX(대규모 컨텍스트 추론 전용)HBM4 메모리(고비용, 고대역폭)GDDR7 128GB(저비용, 고효율)비디오 디코더/인코더 통합어텐션 가속 3배(GB300 NVL72 대비)

이 구분은 메모리 선택에서 선명하게 드러난다. 기존 고성능 AI GPU가 HBM4를 채택하는 것과 달리 Rubin CPX는 128GB GDDR7을 사용한다. GDDR7은 HBM보다 비용과 발열 부담이 낮고 첨단 패키징이 필요하지 않아 대규모 배포의 경제성을 높인다. 학습 워크로드와 달리 추론에서는 메모리 대역폭만큼 용량과 비용 효율이 중요하다는 판단이 반영된 설계다.

Rubin CPX에 담긴 연산·메모리·비디오 처리 사양

항목 사양
컴퓨트 성능 30 petaFLOPs (NVFP4)
메모리 128GB GDDR7
어텐션 가속 GB300 NVL72 대비 3배
비디오 처리 NVENC 4개, NVDEC 4개 통합
다이 구조 모놀리식 다이
출시 예정 2026년 말

NVENC 4개와 NVDEC 4개를 칩에 통합한 점도 Rubin CPX의 용도를 보여준다. 장문 컨텍스트와 멀티모달 처리를 함께 요구하는 비디오 검색이나 고품질 생성형 비디오 워크로드를 단일 칩에서 처리할 수 있도록 구성했다.

랙 단위로 완성되는 Vera Rubin NVL144 CPX

Rubin CPX의 배포 단위는 개별 GPU에 머물지 않는다. NVIDIA는 Rubin CPX GPU와 범용 Rubin GPU, Vera CPU를 결합한 Vera Rubin NVL144 CPX 통합 랙 시스템을 제시했다.

Vera Rubin NVL144 CPX단일Rubin CPX GPU144개Rubin GPU144개Vera CPU36개8 exaFLOPsNVFP4 AI 성능100TB고속 메모리1.7 PB/s메모리 대역폭

한 랙에는 Rubin CPX GPU 144개, Rubin GPU 144개, Vera CPU 36개가 들어간다. 이 구성의 NVFP4 AI 성능은 8엑사플롭스로, GB300 NVL72 대비 7.5배다. 여기에 100TB의 고속 메모리와 1.7PB/s의 메모리 대역폭을 랙 내부에서 제공해 초대규모 컨텍스트 윈도우를 사용하는 AI 모델의 추론을 뒷받침한다.

장문 컨텍스트가 별도의 제품군을 만든 배경

GPT-4o, Claude, Gemini 등 최신 LLM이 100만 토큰 이상의 컨텍스트 윈도우를 지원하면서 추론 단계에서 필요한 메모리와 연산량도 기하급수적으로 증가하고 있다.

학습과 추론을 모두 처리하도록 만들어진 기존 데이터센터 GPU는 장문 컨텍스트 추론에서 비용 대비 효율이 떨어지는 문제가 있었다. NVIDIA는 이 워크로드를 범용 가속기의 일부로 다루는 대신, 추론 전용 GPU 제품군으로 분리해 공략하는 전략을 택했다.

NVIDIA는 1억 달러 투자당 50억 달러의 토큰 수익을 창출할 수 있다고 제시했다. 이를 바탕으로 Rubin CPX가 추론 서비스 사업자에게 전례 없는 수익성을 제공할 것으로 전망하고 있다.

GB300 NVL72와 비교한 플랫폼 성능

Vera Rubin NVL144 CPX와 GB300 NVL72를 나란히 놓으면 연산 성능뿐 아니라 메모리 규모와 대역폭에서도 차이가 나타난다.

항목 GB300 NVL72 Vera Rubin NVL144 CPX 향상 배율
AI 연산 성능 약 1.07 exaFLOPs 8 exaFLOPs 7.5배
컨텍스트 추론 효율 기준 3배 어텐션 가속 3배
메모리 총량 약 13TB 100TB 약 7.7배
메모리 대역폭 약 0.4 PB/s 1.7 PB/s 약 4.3배

추론 인프라 선택에 생기는 변화

Rubin CPX는 대규모 컨텍스트 추론을 위해 GDDR7 기반의 비용 효율과 비디오 처리 기능을 결합한 전용 GPU 클래스다. Vera Rubin NVL144 CPX가 한 랙에서 제공하는 8엑사플롭스 성능은 100만 토큰 이상의 컨텍스트 윈도우를 실시간으로 처리하기 위한 새로운 인프라 기준을 제시한다.

출시는 2026년 말로 예정되어 있다. 장문 컨텍스트 추론이 독립된 인프라 수요로 커지는 상황에서 Rubin CPX는 AI 추론 인프라 시장의 판도를 바꿀 핵심 변수가 될 전망이다.

Sources

NVIDIARubin CPXGPU 인프라대규모 컨텍스트AI 추론