Feynman과 Kyber, NVIDIA가 GPU 다음으로 재설계하려는 것은 네트워크다

Vera Rubin 후속으로 프로토타입 공개된 NVIDIA Feynman GPU와 Kyber 네트워킹 프로토콜의 설계 원칙, NVLink·InfiniBand 대비 개선점, 상용화 로드맵을 정리한다.

2026-08-14 · 최초 발행 2026-03-19

NVIDIA가 GTC 2026에서 공개한 Feynman 아키텍처는 Vera Rubin의 뒤를 잇는 차세대 GPU 플랫폼으로, AI·고성능 컴퓨팅 워크로드의 패러다임을 다시 전환하는 이정표로 평가받는다. 단순한 연산 성능 향상에 그치지 않고, Kyber라는 새로운 네트워킹 프로토콜과 긴밀하게 통합돼 초대형 AI 클러스터의 효율성을 끌어올리는 방향으로 설계됐다.

물리학자의 이름을 딴 프로토타입

Feynman 아키텍처는 NVIDIA의 네이밍 철학에 따라 물리학자 리처드 파인만의 이름을 딴 플랫폼으로, 2026년 GTC에서 프로토타입 수준의 데모와 함께 공개됐다. Hopper → Blackwell → Vera Rubin → Feynman 순의 세대 구조에서 단일 GPU 칩 성능보다 시스템 레벨 효율(연산 밀도, 통신 병목 해소)에 최적화하는 것이 목표이며, GPU-네트워크 공동 설계(Co-design) 원칙을 적용한다. 타겟 워크로드는 수조 파라미터 규모의 LLM 학습, 실시간 추론, 과학 시뮬레이션이고, 공정은 차세대 TSMC 공정 기반이나 세부 스펙은 미공개 상태다.

Hopper 아키텍처Blackwell 아키텍처Vera Rubin 아키텍처Feynman 아키텍처Kyber 네트워킹 통합차세대 NVLink FabricAI 연산 밀도 극대화초대형 AI 클러스터

연산·메모리·통신 삼각형의 재설계

Feynman GPU는 트랜지스터 집적 밀도 향상이 아니라 연산-메모리-통신의 삼각 구조 최적화에 초점을 맞춘다. 연산 성능은 Vera Rubin 대비 FP8/FP4 AI 연산 성능 약 2배 이상을 목표로 하고, 모델 가중치 희소성을 하드웨어 레벨에서 직접 가속하는 스파스 연산 최적화, Attention 연산 전용 서브유닛을 추가하고 동적 정밀도 전환을 고도화한 Transformer 엔진 개선, FP8과 FP4 사이 중간 정밀도 포맷으로 품질-성능 트레이드오프를 개선하는 FP6 지원을 갖춘다.

메모리 서브시스템은 대역폭 4TB/s 이상을 목표로 하는 HBM4e를 적용하고, 단일 GPU당 메모리 용량은 288GB 이상(프로토타입 기준 추정치)이며, L2 캐시 확장·Scratchpad 메모리 아키텍처 개선으로 캐시 계층을 재설계하고 하드웨어 레벨 활성화 압축으로 유효 메모리 대역폭을 증폭한다.

전력·열 관리는 직접 액체 냉각(Direct Liquid Cooling)을 전제로 설계됐고, 전력 밀도는 1,200W TDP를 초과할 것으로 예상돼 서버당 전력 관리의 중요성이 커지며, 미사용 유닛을 선택적으로 전원 차단하는 Dynamic Power Gating으로 에너지 효율을 높인다.

GPU가 직접 메시지를 라우팅하는 Kyber

Kyber는 NVIDIA가 Feynman 플랫폼과 함께 발표한 차세대 AI 클러스터 네트워킹 프로토콜로, 기존 NVLink와 InfiniBand의 역할을 통합하고 초월하는 것을 목표로 한다. 정식 명칭은 NVIDIA Kyber Networking Protocol이며, GPU 내부 NVLink Fabric과 랙 간 Kyber 패브릭의 이중 구조를 갖고, 기존 이더넷·InfiniBand TCP 계층을 우회하는 독자 프로토콜 스택을 쓴다. 지연 시간 목표는 마이크로초 단위 이하의 GPU 간 직접 통신이고, 확장성은 단일 도메인 내 수십만 GPU 연결을 지원하도록 설계됐다.

NVLink FabricNVLink FabricKyber 프로토콜GPU 노드 AFeynman GPUGPU 노드 BFeynman GPUKyber 스위치GPU 노드 CGPU 노드 DKyber 패브릭 컨트롤러클러스터 오케스트레이터

Kyber의 핵심 설계 원칙은 다섯 가지다. CPU 개입 없이 GPU 간 직접 메시지를 라우팅하는 GPU-Native 프로토콜, 패킷 재전송 없는 신뢰성을 보장하는 무손실 패브릭, 네트워크 혼잡 상황을 실시간으로 감지하고 경로를 재설정하는 적응형 라우팅, 클러스터 전체 GPU 메모리를 단일 주소 공간으로 추상화하는 통합 주소 공간, 하드웨어 레벨 크레딧 기반으로 백프레셔를 제거하는 흐름 제어다.

NVLink보다 넓고 InfiniBand보다 가볍게

Kyber는 기존 NVIDIA 네트워킹 생태계가 가진 계층적 복잡성과 이기종 프로토콜 문제를 근본적으로 해결하려는 시도다.

NVLink 5세대(Vera Rubin)와 비교하면, 적용 범위가 단일 노드·NVLink 도메인에서 클러스터 전체로 넓어지고, 최대 GPU 수는 NVSwitch 기반 수백 개에서 Kyber Fabric 기반 수십만 개로 늘며, 프로토콜 계층은 독자 NVLink 프로토콜에서 NVLink와 Kyber의 통합으로 바뀐다. CPU 개입은 일부 제어 경로가 필요했던 NVLink와 달리 GPU-Native로 완전 자율화되며, 대역폭은 NVLink 5세대의 3.6TB/s(양방향) 대비 미공개(대폭 향상 예상)다.

InfiniBand 대비로는 별도 HCA(Host Channel Adapter) 없이 GPU 내장 Kyber 컨트롤러를 쓰는 프로토콜 통합, RDMA 드라이버 레이어 제거로 소프트웨어 오버헤드를 줄이는 소프트웨어 스택 단순화, InfiniBand HDR/NDR 대비 지연 시간 30-50% 감소를 목표로 하는 지연 시간 개선, 전용 네트워크 카드 제거로 시스템 전체 전력 소모를 줄이는 전력 효율, 단일 NVIDIA 소프트웨어 스택으로 통합되는 관리 복잡도 개선이 특징이다. 이더넷 대비로는 표준 이더넷의 손실 특성 없이 무손실 전송을 지원하는 Lossless 보장, AllReduce·AllGather 등 집합 통신 연산을 하드웨어 오프로드하는 AI 특화 최적화, AI 학습 패턴에 최적화된 혼잡 제어 알고리즘 내장이 강점으로 제시된다.

학습 병목 해소부터 데이터센터 재설계까지

Feynman과 Kyber 조합은 AI 클러스터 인프라 설계 방식 자체를 변화시킬 잠재력을 가진다. 학습 효율성 측면에서는 대규모 LLM 학습 시 All-to-All 통신 오버헤드를 최소화하는 통신 병목 해소, 스테이지 간 활성화 전송 지연을 줄여 버블 비율을 축소하는 파이프라인 병렬화 개선, 통신 비용 감소 덕분에 더 많은 GPU에 걸쳐 텐서를 분할할 수 있는 텐서 병렬화 확장, 대형 클러스터에서도 60% 이상 MFU(Model FLOPs Utilization)를 유지할 수 있다는 목표가 제시됐다.

추론 인프라 측면에서는 클러스터 전체 GPU 메모리를 활용한 대규모 KV 캐시 분산 저장, Prefill과 Decode 역할을 분리한 이질적 추론 구조(Disaggregated Inference), 토큰 생성 레이턴시 감소로 실시간 응용 프로그램 적용 범위가 확대되는 서비스 레이턴시 개선이 기대된다.

NVLinkHCA내장 Kyber 컨트롤러단일 통합 패브릭기존 AI 클러스터 구조GPU 서버InfiniBand 네트워크이더넷 관리망Feynman + Kyber 클러스터Feynman GPU 서버Kyber 패브릭 스위치

데이터센터 설계 측면에서는 내부·외부 네트워크 이중 구조에서 단일 Kyber 패브릭으로 통합하는 단일 패브릭 전략, 네트워크 카드 제거로 단위 랙당 GPU 수가 늘어나는 랙 밀도 향상, 이기종 케이블(InfiniBand+이더넷)을 통합해 운영 복잡도를 낮추는 케이블링 단순화, 네트워킹 전용 전력 비중이 줄어 GPU 연산에 더 많은 전력을 할당할 수 있는 전력 예산 개선이 예상된다.

아직은 프로토타입, 양산은 2027년부터

Feynman과 Kyber는 2026년 현재 프로토타입 단계이며, 양산·고객 배포까지의 경로가 주요 관심사다. NVIDIA 발표 기준 일정은 2026년 상반기 Feynman 아키텍처 프로토타입 공개·파트너 검증 시작, 2026년 하반기 주요 클라우드 파트너(CSP) 대상 early access 프로그램 운영, 2027년 Feynman 기반 DGX 시스템·HGX 모듈 양산 출하, 2027-2028년 Kyber 네트워킹 스위치·에코시스템 장비 상용화 순이다.

경쟁 구도에서는 동기간 경쟁 GPU 플랫폼인 AMD MI350X·MI400과의 성능 격차 유지 여부가 관건이고, 이더넷 기반 클러스터 전략을 쓰는 Intel Gaudi 4와의 생태계 대립이 심화될 전망이며, Ultra Ethernet Consortium(UEC) 기반 개방형 AI 네트워킹 진영과의 경쟁, Google TPU·Microsoft Maia·Meta MTIA 같은 자체 칩 개발사와의 소프트웨어 생태계 경쟁도 예상된다.

소프트웨어 생태계 준비로는 Kyber API와 Feynman 특화 커널 라이브러리를 추가하는 CUDA 업데이트, Kyber 패브릭 기반 집합 통신 라이브러리 최적화 버전인 NCCL 3.x 출시, Feynman 기반 추론 최적화 마이크로서비스 업데이트인 NIM, Kyber 패브릭 인식 GPU 스케줄러·네트워크 플러그인을 제공할 예정인 Kubernetes 연동이 준비되고 있다. 주요 고객·파트너로는 AWS·Google Cloud·Azure·Oracle Cloud 같은 하이퍼스케일 클라우드의 조기 도입, 대규모 모델 학습 인프라 교체 수요가 있는 AI 스타트업, 미국·유럽·일본 등 국가 주도 AI 컴퓨팅 인프라 조달 대상인 국가 AI 인프라, 과학 시뮬레이션과 AI 혼합 워크로드 수요가 늘고 있는 HPC 센터가 거론된다.

NVIDIA Feynman 아키텍처와 Kyber 네트워킹 프로토콜은 단순한 세대 교체를 넘어, AI 컴퓨팅 인프라의 설계 원칙을 재정의하는 시도다. GPU 연산 성능 향상과 클러스터 네트워킹 혁신을 하나의 통합된 플랫폼으로 제시함으로써 기존 이기종 인프라의 복잡성을 해소하고 AI 학습·추론 효율을 동시에 극대화하는 방향성을 제시하며, 2027년 이후 본격적인 상용화가 진행되면 LLM 학습에 소요되는 비용과 시간이 다시 한번 단축될 것으로 기대된다.

Sources

NVIDIAFeynmanKyberGPU아키텍처AI클러스터