AWS Trainium3와 NeuronCore-v4 기반 AI 학습 인프라 분석
AWS Trainium3의 NeuronCore-v4, HBM3e, EFA 네트워크와 Neuron SDK를 중심으로 대규모 AI 학습 인프라의 구조와 TCO 경쟁력을 분석한다.
2026-08-14 · 최초 발행 2026-05-01
칩에서 UltraCluster까지 이어지는 Trainium3 구성
AWS가 2025년 12월 정식 출시한 Trainium3은 NeuronCore-v4를 기반으로 한 4세대 커스텀 AI 가속기다. Trainium2와 비교해 최대 4.4배의 컴퓨팅 성능을 제공하며, 칩당 FP8 연산 성능은 2.52 PFLOPS다.
TSMC 3nm(N3P) 공정으로 제조된 이 칩에는 144GB HBM3e 메모리와 4.9TB/s 메모리 대역폭이 들어간다. 대규모 언어 모델 학습을 기준으로 NVIDIA Blackwell B200/B300과 경쟁하는 구성이며, EC2 UltraCluster 3.0의 최대 100만 칩 단일 평면 네트워크와 결합할 때 FP8 TCO 기준 Blackwell GB300 NVL72보다 약 30% 우위를 제공한다.
칩 하나에는 NeuronCore-v4 8개가 통합된다. FP8 정밀도에서 2.52 PFLOPS를 제공하고, MXFP8/MXFP4 연산을 위한 512×128 시스톨릭 어레이를 포함한다. HBM3e 용량은 Trainium2보다 1.5배 늘어난 144GB이며, 메모리 대역폭은 4.9TB/s다.
Trainium2 대비 에너지 효율은 40% 개선됐다. 144칩 액체냉각 구성인 UltraServer Gen2 전체는 약 362 PFLOPS FP8 성능, 20.7TB 총 HBM 용량, 706TB/s 메모리 대역폭을 제공한다.
NeuronCore-v4에서 커스텀 커널을 실행하는 방식
NeuronCore-v4는 Trainium3의 연산 엔진이다. 코어마다 BF16 행렬 연산용 128×128 시스톨릭 어레이와 저정밀도 연산용 512×128 MXFP8/MXFP4 시스톨릭 어레이가 배치된다. 지수 함수 같은 비선형 연산은 Vector Engine이 담당하며, 전용 SRAM은 코어당 32MiB, 칩 전체로는 256MiB다.
GPSIMD Engine은 완전히 프로그래밍 가능한 범용 프로세서다. Neuron Kernel Interface(NKI)를 통해 접근할 수 있고, Apache 2.0 라이선스의 오픈소스 C/C++ 기반 커스텀 커널 개발을 지원한다. 특수 연산자나 비표준 어텐션 패턴을 하드웨어 수준에서 최적화하려는 경우 이 인터페이스가 사용된다.
분산 학습을 위한 인터커넥트 계층
Trainium3의 분산 학습 확장성은 칩, 서버, 클러스터를 잇는 인터커넥트 설계에 달려 있다.
칩 사이에서는 NeuronLink-v4가 칩당 2TB/s로 직접 연결을 담당한다. Trainium2의 4×4×4 3D 토러스 토폴로지에서 NeuronSwitch-v1 기반 올-투-올(all-to-all) 토폴로지로 바뀌었고, AllReduce와 AllGather 같은 집합 통신의 레이턴시는 10마이크로초 미만으로 낮아졌다.
서버는 두 형태로 제공된다. UltraServer Gen1은 에어냉각 방식이며 최대 64칩을 수용한다. 액체냉각 방식인 UltraServer Gen2는 최대 144칩을 구성할 수 있고, 362 PFLOPS FP8 성능과 706TB/s 메모리 대역폭을 제공한다.
클러스터 계층에서는 EFA(Elastic Fabric Adapter) 기반 Petabit-scale 논블로킹 네트워크가 최대 100만 개 Trainium3 칩을 단일 평면으로 연결한다. EC2 UltraCluster 3.0은 10조 개 이상의 파라미터를 가진 모델의 프리트레이닝 환경을 지원한다.
Neuron SDK가 제공하는 컴파일과 병렬화 계층
AWS Neuron SDK는 Trainium3에서 딥러닝 프레임워크를 실행하기 위한 소프트웨어 계층이다. PyTorch는 네이티브와 torch.compile을 포함해 지원하며, JAX(Beta), PyTorch Lightning, Hugging Face Transformers, vLLM, TorchTitan도 사용할 수 있다. 기존 PyTorch 모델은 코드 수정 없이 Trainium3에서 실행 가능하다.
분산 학습은 다음 추상화로 구성된다.
| 방식 | 설명 |
|---|---|
| FSDP | 모델 파라미터·그래디언트·옵티마이저 상태 샤딩 |
| DTensor | 동적 텐서 샤딩, 사용자 정의 병렬화 전략 지원 |
| DDP | 데이터 병렬 학습 |
| Tensor Parallelism | 텐서 레벨 모델 병렬화 |
| NxD Training | NeMo 호환 고효율 분산 학습 인터페이스(Beta) |
Neuron Compiler는 PyTorch/JAX 연산 그래프를 NeuronCore-v4 명령셋으로 컴파일한다. torch.compile API로 eager 모드와 컴파일 모드를 함께 사용할 수 있어 개발과 디버깅을 지원한다. 프로파일링 및 모니터링 도구도 포함돼 학습 효율성 진단에 사용된다.
NxD Training은 모델 크기에 맞춘 자동 샤딩 전략을 제공한다. 수십만 칩 규모의 분산 학습에서도 사용자가 샤딩 로직을 직접 구현하지 않아도 되는 방식이다.
하이퍼스케일러 가속기와 비교할 때 볼 지점
2025~2026년 기준 주요 하이퍼스케일러 커스텀 AI 가속기의 사양은 다음과 같다.
| 가속기 | FP8 성능 | HBM 메모리 | 메모리 대역폭 | 출시 |
|---|---|---|---|---|
| AWS Trainium3 | 2.52 PFLOPS/칩 | 144GB HBM3e | 4.9TB/s | 2025년 12월 GA |
| Google TPUv5p (Ironwood) | 4.614 TFLOPS/칩 | 192GB HBM | 7.37TB/s | 2025년 GA |
| Azure Maia 100 | 미공개 | 미공개 | 미공개 | 제한적 배포 |
| NVIDIA H200 | H100 대비 ~40% 향상 | 141GB HBM3e | 4.8TB/s | 2024년 GA |
| NVIDIA Blackwell B200 | H200 이상 | 192GB HBM3 | 8TB/s | 2025년 GA |
NVIDIA는 CUDA 생태계와 폭넓은 소프트웨어 호환성을 강점으로 둔다. Google TPU는 JAX 네이티브 지원과 9,216칩 = 42.5 ExaFLOPS 규모의 pod 구성에 특화돼 있다. Trainium3는 PyTorch 코드 호환성, 그리고 실리콘부터 랙 인프라까지 이어지는 수직 통합을 통한 TCO 최적화를 차별점으로 삼는다.
Azure Maia 100은 Microsoft가 자체 개발한 가속기이며, 동부 미국 데이터센터에 제한 배포 중이다. 공개 사양이 없어 직접 비교는 어렵다. Google Ironwood는 전체 pod 기준 42.5 ExaFLOPS로 대규모 구성에서 절대 성능이 높지만, 단독 칩 단위에서는 Trainium3와 유사한 영역에서 경쟁한다.
FP8 워크로드에서의 TCO 조건
FP8 정밀도 워크로드의 TCO를 기준으로 하면 Trainium3는 NVIDIA Blackwell GB300 NVL72보다 약 30% 우위다. 반면 FP4 정밀도에서는 Blackwell이 더 유리하다.
이 차이는 AWS가 실리콘 설계부터 랙 인프라까지 전체 스택을 수직 통합해 마진 구조를 최적화하는 데서 나온다. Trainium2 대비 40% 개선된 에너지 효율은 데이터센터 전력 비용 절감에 기여하며, EC2 UltraCluster의 스케일 이코노미는 대규모 배포에서 단위 비용을 낮춘다.
Decart는 실시간 생성형 비디오 추론에서 4배 속도 향상과 50% 비용 절감을 달성했다. Anthropic은 AWS와 $100B 규모의 장기 계약을 체결해 Trainium3 기반 모델 학습 인프라를 확보했다. 복수 고객사는 학습·추론 비용이 50% 감소했다고 보고하고 있다.
Trainium3는 TSMC 3nm 공정, NeuronCore-v4, 144GB HBM3e, EC2 UltraCluster 3.0을 결합해 NVIDIA Blackwell과 경쟁하는 커스텀 가속기다. FP8 TCO의 약 30% 우위와 PyTorch 코드 호환성, NKI 기반 커스텀 커널 개발 지원은 이 플랫폼의 선택 기준이 된다. AWS·Google·Microsoft·NVIDIA의 경쟁은 AI 학습 인프라 비용 효율화에 계속 영향을 주고 있다.
Sources
- https://awsdocs-neuron.readthedocs-hosted.com/en/latest/about-neuron/arch/neuron-hardware/trainium3.html
- https://aws.amazon.com/about-aws/whats-new/2025/12/amazon-ec2-trn3-ultraservers/
- https://aws.amazon.com/ec2/instance-types/trn3/
- https://aws.amazon.com/ai/machine-learning/trainium/
- https://newsletter.semianalysis.com/p/aws-trainium3-deep-dive-a-potential
- https://www.tomshardware.com/tech-industry/artificial-intelligence/amazon-launches-trainium3-ai-accelerator-competing-directly-against-blackwell-ultra-in-fp8-performance-new-trn3-gen2-ultraserver-takes-vertical-scaling-notes-from-nvidias-playbook
- https://awesomeagents.ai/hardware/aws-trainium3/
- https://www.ankursnewsletter.com/p/google-tpus-vs-aws-trainium-and-inferentia
- https://www.cloudexpat.com/blog/comparison-aws-trainium-google-tpu-v5e-azure-nd-h100-nvidia/
- https://awsdocs-neuron.readthedocs-hosted.com/en/v2.26.1/
- https://aws.amazon.com/about-aws/whats-new/2024/09/aws-neuron-nki-nxd-training-jax/
- https://www.nextplatform.com/2025/12/03/with-trainium4-aws-will-crank-up-everything-but-the-clocks/