AI 워크로드를 위한 800GbE 패브릭과 RoCE·InfiniBand 선택
AI 분산 학습과 추론에 필요한 800GbE 네트워크, RoCE v2·InfiniBand 패브릭, Spine-Leaf 토폴로지 설계 기준을 정리한다.
2026-08-14 · 최초 발행 2026-04-19
AI 트래픽을 감당하지 못하는 기존 네트워크
Omdia 조사에서 AI 워크로드를 수용할 네트워크 인프라가 준비됐다고 답한 기업은 49%였다. 반면 데이터센터의 89%는 향후 1년 안에 대역폭을 11% 이상 확장할 계획을 갖고 있다. 투자 계획과 현재 준비도 사이의 간극은 AI 트래픽이 단순히 링크 속도만 높여서는 해결되지 않는다는 점을 보여준다.
분산 학습에서는 수천~수만 개 GPU가 AllReduce, AllGather, ReduceScatter 같은 집합 통신을 동시에 수행한다. 이때 발생하는 incast 트래픽은 TCP 중심 네트워크에서 큐 버스트와 테일 레이턴시를 키울 수 있다. 추론도 예외가 아니다. TTFT(Time To First Token)와 TBT(Time Between Tokens)를 낮추려면 수 마이크로초 단위의 네트워크 지연이 필요하다.
글로벌 하이퍼스케일러는 800GbE 전환을 완료했거나 진행하고 있지만, 일반 엔터프라이즈는 400GbE 도입 단계에 머물러 있는 경우가 많다.
학습과 추론이 만드는 서로 다른 네트워크 요구
대형 언어 모델 학습에서 네트워크는 연산 장치 사이를 잇는 보조 경로가 아니라 연산의 일부다. 텐서 병렬화, 파이프라인 병렬화, 데이터 병렬화를 함께 쓰는 3D 병렬 학습에서는 단계마다 GPU 간 통신이 발생한다.
| 통신 유형 | 주요 연산 | 요구 대역폭 | 레이턴시 민감도 |
|---|---|---|---|
| Scale-up (노드 내) | NVLink AllReduce | 3.2~7.2 TB/s | 나노초 |
| Scale-out (노드 간) | RDMA AllReduce | 400G~800G/port | 마이크로초 |
| 스토리지 → GPU | 체크포인트 로드 | 100G 이상 | 밀리초 허용 |
텐서 병렬화는 노드 안에서 NVLink로 처리하지만, 파이프라인 병렬화와 데이터 병렬화는 노드 간 패브릭의 영향을 직접 받는다. GPU 이용률을 90% 이상으로 유지하려면 네트워크가 연산 속도를 따라가야 한다. NVIDIA Blackwell B200의 단일 GPU 메모리 대역폭은 1.8 TB/s이므로, 노드 간 연결이 병목이 되면 클러스터 전체 효율이 급락할 수 있다.
추론에서는 응답 흐름이 더 민감하다. 실시간 챗봇, 음성 인식, 추천 엔진은 5ms 이상의 지연만으로도 사용자 경험이 크게 저하될 수 있다. 엣지 추론에서 핵심 에코시스템 근처에 배치할 때의 목표 레이턴시는 3ms 미만이다.
PagedAttention과 Disaggregated Prefill처럼 KV 캐시를 분산 메모리로 다루는 구조는 prefill 노드와 decode 노드 사이의 KV 전송에 저지연·고대역폭 링크를 요구한다. 이 경로의 품질이 TTFT에 영향을 준다.
800GbE로 전환할 때 함께 결정할 항목
IEEE 802.3 체계에서 800GbE는 200Gbps SerDes 레인 4개로 구성된다. 이를 기반으로 한 스위치 ASIC이 2025~2026년에 걸쳐 출시되며 AI 네트워크 전환을 이끌고 있다.
- Broadcom Tomahawk 6: 2025년 중반 출하 시작, 102.4 Tbps 집계 용량, 512×200G SerDes 기반
- Cisco Silicon One G300: 2026년 2월 발표, 하반기 출하, 동일한 102.4 Tbps 아키텍처
- Arista 7800R3 / 7060X6: 하이퍼스케일 800G 배포 선도, 주요 클라우드 프로바이더 채택
데이터센터 스케일업 수요로 이더넷 TAM은 2500억 달러를 돌파할 전망이다. 800GbE 스위치 포트는 가장 빠른 램프업을 기록하고 있으며, 1.6TbE(IEEE 802.3dj, 2026년 중반 표준 예정)도 로드맵에 포함돼 있다.
400GbE에서 800GbE로 옮길 때는 포트 속도 외에 광 모듈, 패브릭 비율, 혼잡 제어를 같이 검토해야 한다.
광 모듈은 케이블 거리와 비용에 따라 800G-SR8(단거리), 800G-DR8(중거리), 800G-2xFR4(장거리)를 고른다. AI 클러스터 내부에는 DR8(500m), 데이터센터 간 연결에는 2xFR4(2km)가 일반적이다.
AI 학습 클러스터는 1:1 non-blocking 구성이 이상적이지만, 비용 때문에 스파인 계층에 2:1을 적용하는 경우가 많다. 트래픽이 덜 균일한 추론 클러스터는 4:1까지 허용할 수 있다.
혼잡 제어는 PFC(Priority Flow Control)와 ECN(Explicit Congestion Notification)을 결합한 DCQCN을 사용한다. 다만 PFC 폭풍, 즉 pause frame cascade를 막기 위해 watchdog 타이머를 두고 lossless 우선순위 큐 수를 최소화해야 한다.
RoCE v2와 InfiniBand가 갈리는 지점
| 항목 | InfiniBand | RoCE v2 |
|---|---|---|
| 전송 레이어 | IB 전용 패브릭 | IP/UDP over Ethernet |
| 라우팅 | Subnet Manager(중앙 집중) | ECMP + BGP/OSPF |
| 레이턴시 | ~2µs (단일 홉) | ~5µs (단일 홉) |
| 혼잡 제어 | 내장 credit 기반 | DCQCN (PFC+ECN) |
| 멀티벤더 | NVIDIA 중심 | 완전 개방형 생태계 |
| TCO | 높음 | 낮음 (기존 이더넷 투자 활용) |
| 최대 클러스터 규모 | 수만 GPU | 수천~수만 GPU |
InfiniBand는 NVIDIA NDR(400Gbps)/HDR(200Gbps) 표준을 바탕으로 결정론적인 저지연을 제공한다. NVIDIA DGX SuperPOD의 기본 패브릭이며, 수만 GPU 규모에서도 성능 저하 없이 동작하는 것이 실증됐다.
대신 장비 비용과 벤더 종속성을 감수해야 한다. InfiniBand 스위치와 HCA(Host Channel Adapter)는 동급 이더넷 장비보다 2~3배 비싸고, NVIDIA Quantum 스위치 생태계에 사실상 종속된다. Subnet Manager는 단일 장애 지점이 될 수 있으며, 대규모 패브릭에서는 SM 수렴 시간이 길어질 수 있다.
2025년부터는 AI 백엔드 네트워크 배포에서 이더넷의 비중이 커지고 있다. UEC(Ultra Ethernet Consortium) 1.0 스펙 성숙, AI 최적화 이더넷 실리콘 출시, 하이퍼스케일러의 대규모 RoCE 검증이 함께 작용했다.
Meta의 24,000 GPU 학습 클러스터는 표준 이더넷 위의 RoCEv2로 구축됐다. RoCEv2는 InfiniBand 학습 처리량의 85~95%를 훨씬 낮은 비용으로 달성하며, 64개 이상의 GPU 클러스터에서는 대부분의 신규 엔터프라이즈·클라우드 AI 배포에 권고된다.
클러스터 규모에 맞춰 토폴로지 고르기
AI·HPC 클러스터에서는 Spine-Leaf가 사실상 표준이다. 모든 리프 스위치가 모든 스파인 스위치와 연결되는 2계층 구조여서, 클러스터 내부의 어느 노드도 최대 2홉으로 도달할 수 있다. AI 집합 통신에 필요한 비블로킹 이스트-웨스트 트래픽을 확보하기 위한 구성이다.
일반적인 AI 클러스터는 스파인에 800GbE, 리프에 400GbE를 적용한 2계층 Spine-Leaf 패브릭을 사용한다. 오버서브스크립션 1:1~2:1은 성능과 비용 사이의 균형점으로 제시된다.
Fat-Tree는 Spine-Leaf를 계층적으로 확장한 멀티스테이지 Clos 네트워크다. 리프-스파인-코어의 3계층으로 수만 GPU를 비블로킹으로 연결하며, HPC 슈퍼컴퓨터와 InfiniBand 기반 NVIDIA DGX SuperPOD에서 사용된다.
NVIDIA DGX 클러스터에서는 Rail-Optimized 토폴로지도 활용된다. GPU의 NVLink 스위치 연결 방식에 맞춰 스위치를 배치하고, 같은 Rails(GPU 위치)의 노드가 같은 리프 스위치에 모이도록 구성해 AllReduce 통신 패턴을 최적화한다.
| 토폴로지 | 최적 규모 | 장점 | 단점 |
|---|---|---|---|
| 2-tier Spine-Leaf | 64~4,096 GPU | 단순, 저비용, 빠른 구축 | 대규모 확장 한계 |
| 3-tier Fat-Tree | 4,096~100K+ GPU | 최고 확장성 | 복잡성, 비용 |
| Rail-Optimized | DGX 클러스터 특화 | AllReduce 최적화 | 벤더 종속 |
| Dragonfly+ | 수만 GPU | 홉 수 최소화 | 트래픽 불균형 리스크 |
Arista 7060X6(800G 스파인)와 Arista 7050X4(400G 리프)를 조합한 AI 팩토리 레퍼런스 아키텍처에서는 스파인 32대 × 64포트 800G가 리프 2,048대를 연결한다. 각 리프는 32대의 GPU 서버(400G NIC)를 수용하며, 단일 패브릭으로 최대 65,536 GPU 클러스터를 구성할 수 있다.
패브릭 선택은 워크로드와 규모의 문제다
AI 워크로드에 맞는 네트워크는 800GbE 전환만으로 완성되지 않는다. 분산 학습과 추론이 요구하는 대역폭·지연 조건을 기준으로 RoCE v2 또는 InfiniBand를 고르고, 토폴로지와 혼잡 제어까지 함께 설계해야 한다.
신규 엔터프라이즈 AI 클러스터에서는 비용 효율성과 생태계 성숙도를 고려해 RoCE v2 over 800GbE Spine-Leaf를 출발점으로 삼을 수 있다. 초대형 규모이거나 결정론적 레이턴시가 절대적으로 요구되는 환경에서는 InfiniBand를 검토할 수 있다.
Sources
- 400G vs 800G Ethernet in 2026: Data Center Trends & Upgrade Roadmap – network-switch.com
- 400G vs 800G Ethernet: The Future of Data Center Networks - The Network DNA
- Arista unveils 800G platforms to power AI data center interconnects - SDxCentral
- RoCE vs InfiniBand for AI Data Center Networking: What Network Engineers Need to Know in 2026 | FirstPassLab
- InfiniBand vs. RoCE v2: A Comparison of Network Architectures for AI Computing Centers - NADDOD Blog
- AI Data Center Networking: How GPU Clusters Are Changing Network Design - The Network DNA
- Spine-Leaf Network Architecture Explained for AI and HPC Clusters 2025 – network-switch.com
- GPU Cluster Network Topology Design: Fat-Tree, Dragonfly - introl.com
- AI Inference: The Next Stress Test for Data Center Infrastructure - Data Center Knowledge
- Omdia: Global Cloud Infrastructure Spending Rose 29% in Q4 2025 - Business Wire
- Data center scale-up to drive Ethernet TAM to beyond $250B | Lightwave Online
- AI Network Traffic Report: 2026 Update Analysis - Omdia