NVIDIA Dynamo 1.0: Prefill과 Decode를 분리해 처리량 3.6배를 낸 추론 서빙

NVIDIA Dynamo 1.0의 Disaggregated Serving·Smart Router·분산 KV 캐시 구조와 vLLM·TGI·SGLang 대비 벤치마크, 도입 시 고려사항을 정리한다

2026-08-14 · 최초 발행 2026-03-29

프리필과 디코드를 같은 GPU에서 처리하면 서로 다른 하드웨어 특성이 충돌한다. NVIDIA Dynamo는 이 둘을 물리적으로 갈라놓는 방식으로 해법을 냈다. NVIDIA가 2026년 3월, AI 추론 최적화 소프트웨어 Dynamo 1.0을 오픈소스로 공개하며 AI 인프라 생태계에 새로운 전환점을 제시했다. 단순한 라이브러리 배포를 넘어, 대규모 언어 모델 서빙의 병목을 근본적으로 해소하겠다는 NVIDIA의 의지가 담긴 선언이다. 추론 비용이 학습 비용을 압도하기 시작한 지금, Dynamo의 등장은 업계 전반에 걸쳐 상당한 파급력을 예고한다.

Dynamo가 하는 일

Dynamo는 GPU 클러스터 위에서 동작하는 고성능 AI 추론 서빙 프레임워크다. NVIDIA TensorRT-LLM을 기반으로 하되, 분산 추론 오케스트레이션, 동적 배치(Dynamic Batching), KV 캐시 관리까지 통합한 풀스택(full-stack) 솔루션이다. 핵심 설계 철학은 단일 GPU에서 수백 GPU 클러스터까지 선형에 가까운 성능 확장성(scalability)을 보장하는 것이다.

가장 주목할 기능은 프리필(prefill)과 디코드(decode) 단계를 물리적으로 분리하는 Disaggregated Serving이다. LLM 추론은 두 단계로 구성된다. 프리필은 입력 토큰 전체를 처리해 KV 캐시를 생성하는 연산 집약 단계이고, 디코드는 토큰을 하나씩 생성하는 메모리 대역폭 집약 단계다. 두 단계를 동일한 GPU에서 처리하면 서로 다른 하드웨어 특성이 충돌한다. Dynamo는 이를 별도 GPU 풀로 분리해 각 단계에 최적화된 하드웨어를 할당한다.

Smart Router는 요청을 적절한 워커 노드로 라우팅하는 지능형 라우터다. KV 캐시 재사용률(prefix cache hit rate)을 극대화하도록 요청을 분배하며, 노드 상태를 실시간으로 모니터링해 부하를 균등하게 유지한다. Distributed KV Cache Manager는 다수의 GPU 노드에 걸쳐 KV 캐시를 공유 관리하는 분산 캐시 레이어다. 동일하거나 유사한 프롬프트가 반복될 때 캐시 히트를 통해 중복 연산을 제거하며, 시스템 프롬프트가 고정되는 실제 RAG(검색 증강 생성) 워크로드에서 처리량이 극적으로 향상된다.

처리량 3.6배가 나온 이유

NVIDIA 공식 발표에 따르면 Dynamo는 단일 H100 서버 기준 기존 TensorRT-LLM 대비 최대 3.6배의 토큰 생성 처리량을 기록했다. 멀티노드 환경에서는 8노드(64 GPU) 구성 시 선형 확장 대비 90% 이상의 효율을 달성한다.

KV 캐시 히트 여부 확인캐시 히트캐시 미스KV 캐시 생성 완료KV 캐시 저장클라이언트 요청Smart RouterDistributed KV CacheManager캐시 응답 반환Prefill Workers (연산 집약)Decode Workers (메모리집약)토큰 스트리밍 응답

주요 성능 지표를 나란히 놓으면 이렇다.

항목 기존 TensorRT-LLM Dynamo 1.0 개선율
처리량 (tokens/sec) 12,000 43,200 3.6×
TTFT (Time-To-First-Token) 180ms 52ms 3.5×
KV 캐시 재사용률 15% 68% 4.5×
GPU 활용률 62% 89% 1.4×

vLLM·TGI·SGLang과 나란히 놓으면

vLLM은 현재 가장 널리 사용되는 오픈소스 LLM 서빙 프레임워크다. PagedAttention 기반 메모리 관리로 GPU 메모리 효율을 크게 향상시켰다. 그러나 단일 노드 최적화에 강점이 있고 멀티노드 분산 추론은 Dynamo에 비해 제한적이다. Dynamo는 vLLM과의 호환 레이어를 제공해 기존 vLLM 기반 코드를 점진적으로 마이그레이션할 수 있게 한다.

Hugging Face의 TGI(Text Generation Inference)는 모델 허브와의 통합과 사용 편의성에서 앞서지만, 성능 상한선은 Dynamo보다 낮다. 엔터프라이즈 규모 트래픽보다는 소규모~중규모 배포에 적합하다.

Stanford 연구팀이 개발한 SGLang은 구조화된 생성(structured generation)과 배치 최적화에서 뛰어난 성능을 보인다. Dynamo와 가장 직접적으로 경쟁하는 포지션이며, 특히 에이전트 워크로드에서 우열이 갈린다. SGLang은 Python 우선 설계로 유연성이 높지만, CUDA 커널 레벨의 최적화 깊이에서는 Dynamo가 우위를 점한다.

소규모 (1-2 GPU)중규모 (4-16 GPU)대규모 (32+ GPU)에이전트/구조화 생성범용 서빙추론 프레임워크 선택배포 규모vLLM / TGI워크로드 유형Dynamo 1.0SGLangDynamo / vLLM

오픈소스로 공개한 진짜 이유

NVIDIA가 Dynamo를 오픈소스로 공개한 것은 단순한 기술 공유가 아니다. CUDA 에코시스템처럼, Dynamo를 통해 NVIDIA GPU가 AI 추론 인프라의 표준 플랫폼으로 자리매김하려는 전략적 포석이다. AMD ROCm이나 Intel Gaudi 기반 솔루션이 대안으로 부상하는 시점에, 소프트웨어 레이어를 개방함으로써 하드웨어 종속성을 강화하는 역설적 전략이다. Apache 2.0 라이선스로 공개된 Dynamo는 GitHub에서 컨트리뷰션을 받으며, NVIDIA는 엔터프라이즈 지원과 클라우드 서비스 형태로 수익을 창출할 계획이다.

도입 전에 확인할 것

Dynamo는 강력하지만 진입 장벽도 상당하다. NVIDIA GPU와 CUDA 12.x 이상이 필수이며, Disaggregated Serving의 이점을 충분히 누리려면 최소 4노드 이상의 클러스터가 필요하다. 소규모 팀이나 단일 GPU 환경에서는 vLLM이 여전히 더 실용적인 선택이다.

설치는 Docker 컨테이너 기반으로 제공되며, Python API와 OpenAI 호환 REST API를 모두 지원한다. 기존 vLLM 엔드포인트를 사용하는 애플리케이션이라면 URL만 교체해 즉시 전환할 수 있다.

Disaggregated Serving과 분산 KV 캐시 관리라는 핵심 혁신은 대규모 LLM 서빙의 경제성을 근본적으로 바꿀 잠재력을 지닌다. 오픈소스 공개로 커뮤니티 기여가 쌓이면 향후 성숙도가 빠르게 높아질 것으로 예상되며, 엔터프라이즈 규모의 AI 추론 인프라를 구축하는 팀이라면 지금 프로토타입 테스트를 시작할 가치가 있다.

Sources

NVIDIA DynamoLLM 추론 서빙KV 캐시vLLMTensorRT-LLM