AWS Trainium3로 보는 커스텀 AI 가속기와 GPU 선택 기준
AWS Trainium3의 NeuronCore-v4, HBM3e, UltraServer 설계와 NVIDIA GPU 대비 비용·성능 트레이드오프를 정리한다.
2026-08-14 · 최초 발행 2026-04-18
Trainium3가 겨냥하는 AI 인프라
AWS는 2025년 12월 re:Invent에서 Trainium3 칩과 EC2 Trn3 UltraServer를 공개했고, 2026년 3월 정식 GA 단계로 전환했다. TSMC 3nm 공정으로 제조된 Trainium3는 Trainium2 대비 3~4배 성능과 40% 향상된 전력 효율을 제공한다. NVIDIA Blackwell Ultra(B300)와 FP8 영역에서 경쟁하는 AWS의 커스텀 AI 실리콘이다.
Trainium3는 칩당 2.52 PFLOPS FP8 성능을 내는 3세대 AI 훈련·추론 가속기다. 칩에는 8개의 NeuronCore-v4 연산 엔진이 들어가며, Trn3 UltraServer는 144개 칩을 NeuronSwitch-v1로 묶어 362 PFLOPS FP8을 제공한다. AWS가 제시하는 목적은 엔터프라이즈 LLM 워크로드에서 NVIDIA GPU 대비 최대 50% 비용 절감과 40% 전력 절감이다.
NeuronCore-v4와 데이터 경로
NeuronCore-v4는 두 종류의 시스톨릭 어레이를 함께 사용한다. 128×128 BF16 시스톨릭 어레이는 Trainium2와 같은 크기를 유지해 기존 모델 코드 호환성을 뒷받침한다. 512×128 MXFP8/MXFP4 시스톨릭 어레이는 FP8 영역에서 2배 확장돼 저정밀 훈련과 추론의 처리량을 높인다.
각 코어에는 32 MiB 전용 SRAM이 있고, SBUF 입력 버퍼와 PSUM 부분합 버퍼 사이에서 데이터가 이동한다. 행렬 곱셈의 K 차원 누적은 PSUM 버퍼를 통해 하드웨어에서 직접 처리된다.
이 구조는 단일 칩의 메모리·연산 계층과 칩 간 스케일업 패브릭을 연결한다. 핵심은 PSUM 버퍼가 matmul의 K 차원 누적을 하드웨어 내부에서 처리한다는 점이다.
HBM3e가 받쳐 주는 모델 적재 용량
Trainium3는 12-high HBM3e 스택 4개로 구성된 144 GB HBM3e를 사용한다. 메모리 대역폭은 4.9 TB/s이며 Trn2 대비 1.7배다. 공급은 SK Hynix·Micron으로 전환돼 Samsung 대비 동작 속도가 향상됐다.
데이터는 HBM, SBUF(on-chip), PSUM, Systolic 순으로 이어지는 4단계 경로를 통과한다. 144개 칩으로 구성된 UltraServer에서는 총 20.7 TB HBM3e와 706 TB/s 집합 대역폭을 제공한다. 이는 70B 파라미터 모델을 단일 UltraServer에 FP8로 적재할 수 있는 수준이다.
칩 성능보다 스케일업 단위의 처리량
| 항목 | Trainium3 | NVIDIA B200 | NVIDIA B300 |
|---|---|---|---|
| FP8 Dense (칩당) | 2.52 PFLOPS | 4.5 PFLOPS | 6.7 PFLOPS |
| HBM 용량 | 144 GB HBM3e | 192 GB HBM3e | 288 GB HBM3e |
| 메모리 대역폭 | 4.9 TB/s | 8 TB/s | 8 TB/s |
| 스케일업 단위 | 144칩 UltraServer | 72칩 NVL72 | 72칩 GB300 NVL72 |
| FP8 UltraServer | 362 PFLOPS | 360 PFLOPS | 약 480 PFLOPS |
칩 단위의 절대 성능은 Blackwell이 앞선다. 반면 UltraServer 수준의 집합 FP8 성능에서는 Trainium3가 NVL72 GB300과 동등한 수준까지 도달한다. AWS는 단일 칩의 성능보다 스케일업 단위 전체의 처리량을 설계 중심에 둔 셈이다.
비용과 전력에서도 차이가 있다. Anthropic, Ricoh, Splash Music 공식 레퍼런스에서는 엔터프라이즈 훈련·추론의 TCO가 GPU 대비 최대 50% 절감된다고 제시한다. 전력 효율은 Trn2 대비 4배이며, 메가와트당 출력 토큰은 5배 이상이다. NVIDIA GPU보다 할당 대기 시간이 짧고 AWS 자체 CapEx로 수급을 커버한다는 점도 장점이다.
대신 Neuron SDK의 커널·라이브러리 생태계는 CUDA보다 얇다. 오픈소스 모델을 포팅하는 작업이 필요할 수 있다.
워크로드에 따라 달라지는 선택
Trainium3는 기초 모델 훈련을 직접 운영하는 환경에 적합하다. Anthropic처럼 Claude급 모델을 자체 훈련하는 기업에서는 비용 절감 효과가 억 단위 달러에 이를 수 있다. 대규모 생성형 추론에서도 GPT-OSS 기준으로 Trn2 대비 3배 처리량과 4배 응답 속도가 제시된다.
1~3년 Savings Plan을 활용할 수 있는 장기 예약 인스턴스 워크로드도 Trainium3의 TCO를 최적화하기 좋다. SageMaker, Bedrock, S3, FSx와 제로-카피 통합이 필요한 AWS 네이티브 환경도 해당한다.
반대로 CUDA 커스텀 커널에 의존하는 강화학습 시뮬레이터나 물리 시뮬레이션은 NVIDIA GPU가 더 유리하다. PyTorch 최신 기능과 연구 코드의 우선 지원이 필요한 빠른 실험·프로토타이핑, 온프레미스·GCP·Azure 사이에서 동일 코드를 옮겨야 하는 멀티 CSP 환경도 GPU 쪽에 가깝다. FP4 극저정밀 추론에서는 Blackwell B300의 FP4 하드웨어 지원이 현재 앞선다.
엔터프라이즈 적용 사례
Anthropic은 다음 세대 Claude 모델 훈련을 위한 대규모 컴퓨팅 인프라에 Project Rainier 기반 수십만 Trainium2/3 칩을 활용한다. GPU 대비 훈련 비용 약 50% 절감과 모델 릴리즈 주기 단축이 결과로 제시됐다.
Decart는 실시간 비디오 생성 추론 워크로드를 Trainium3 UltraServer로 전환했다. GPU 대비 50% 비용에 4배 빠른 추론을 결과로 제시한다.
일본 Ricoh는 일본어 특화 비즈니스 LLM을 위해 Trn3 기반 훈련·파인튜닝 파이프라인을 적용했다. 훈련·추론 비용 절반과 데이터 주권 요구 충족이 도입 결과다.
운영 전 확인할 지점
Neuron SDK에는 PyTorch/JAX 브리지가 있지만 최신 커널의 커뮤니티 기여가 지연될 수 있다. 모델 아키텍처에 따라 torch.compile 호환성을 사전에 검증해야 한다.
MXFP8·MXFP4를 사용한다면 정확도 드롭 여부를 벤치마크로 확인해야 한다. Anthropic이 공개한 마이크로 스케일 양자화 레시피도 참고 대상이다. 144칩 UltraServer를 넘어서는 훈련에는 EFAv3 기반 스케일아웃 토폴로지가 필요하다.
Trainium4는 2026년 말 발표 예정이며, FP4 네이티브·288GB HBM·NVLink Fusion 지원과 이기종 클러스터 허용을 로드맵으로 제시한다. Trn3 투자에서는 Trn4 출시 시기에 맞춰 감가상각 기간을 계산할 필요가 있다.
현재 공개된 방향
Trn3는 2026년 3월부터 us-east-1과 us-west-2에서 즉시 사용할 수 있다. AWS는 Trainium4에서 NVIDIA NVLink와 상호운용하는 NeuronLink Fusion을 예고했고, GPU를 완전히 대체하기보다 공존시키는 전략을 공식화했다.
Llama 4, Mistral Large, GPT-OSS가 Neuron에서 기본 제공되면서 오픈 모델 도입의 진입 장벽도 낮아지고 있다. Trainium3는 Blackwell Ultra보다 칩당 절대 성능이 소폭 낮지만, UltraServer 단위의 집합 처리량·TCO·전력 효율을 바탕으로 엔터프라이즈 LLM의 가속기 포트폴리오에 포함할 근거를 제공한다.
Sources
- Announcing Amazon EC2 Trn3 UltraServers for faster, lower-cost generative AI training
- Trainium3 Architecture — AWS Neuron Documentation
- AWS Trainium3 Deep Dive | SemiAnalysis
- Trainium3 UltraServers now available: Enabling customers
- Amazon launches Trainium3 AI accelerator, competing directly against Blackwell Ultra | Tom's Hardware
- AWS Trainium3 Cuts AI Data Centre Power Consumption by 40%
- With Trainium4, AWS Will Crank Up Everything But The Clocks