AWS Trainium3: 대규모 AI 학습을 겨냥한 커스텀 실리콘

AWS Trainium3의 연산·메모리·인터커넥트 구조와 Trn3 UltraServer 구성, GPU 및 클라우드 가속기 전략을 정리한다.

2026-08-14 · 최초 발행 2026-04-17

Trainium3가 겨냥하는 학습 인프라

AWS는 2025년 12월, 4세대 AI 가속기 Trainium3를 탑재한 EC2 Trn3 UltraServer를 정식 출시했다. TSMC 3nm 공정을 기반으로 한 Trainium3는 칩당 2.52 PFLOPs의 FP8 연산 성능을 제공한다. AWS는 Trainium2와 비교해 최대 4.4배 높은 학습 성능과 4배의 전력 효율 향상을 제시한다.

이 칩은 대규모 생성형 AI 모델 학습, 에이전트 워크로드, 추론을 위한 AWS 자체 설계 ASIC이다. NVIDIA GPU 의존도를 낮추고 클라우드 AI 인프라의 비용 효율을 확보하려는 커스텀 실리콘 전략의 중심에 놓여 있다. AWS는 NVIDIA GPU보다 30~40% 높은 가격 대비 성능을 목표로 제시하며, 차세대 에이전트형 AI, 추론 모델, 비디오 생성 모델 학습을 대상 워크로드로 든다.

세대를 거치며 바뀐 Trainium 계열

Trainium12022Inferentia22023Trainium22024Trainium32025Trainium42026~2027

AWS는 2022년 첫 Trainium을 내놓은 뒤 매년 새 세대를 발표하며 GPU 대안 생태계를 넓혀 왔다. Trainium 계열은 학습용, Inferentia 계열은 추론용이라는 역할 분담을 가지면서도 아키텍처를 공유한다.

세대 출시 연도 공정 주요 특징
Trainium1 2022 7nm 첫 AI 학습 전용 ASIC, NeuronCore v2
Inferentia2 2023 5nm 추론 전용, Trainium1 기반 아키텍처 공유
Trainium2 2024 5nm HBM3, 스케일아웃 강화, UltraServer 도입
Trainium3 2025 3nm 2.52 PFLOPs FP8, HBM3e, All-to-All 토폴로지
Trainium4 2026~2027 미정 차세대 XPU 아키텍처 예고

연산과 메모리를 함께 확장한 설계

Trainium3는 칩당 2.52 PFLOPs의 FP8 연산을 지원하며, Trainium2보다 2배 높은 수준이다. MXFP4와 MXFP8 같은 마이크로스케일링 부동소수점 형식을 지원하고, 다중 NeuronCore 구성으로 밀집 워크로드와 전문가 병렬 워크로드를 동시에 처리한다. FP8과 FP4를 자동 전환해 학습 정확도와 처리량의 균형을 맞추는 방식도 포함한다.

메모리는 144 GB HBM3e로 구성되며 Trainium2보다 1.5배 늘었다. 대역폭은 4.9 TB/s로 1.7배 높다. 대규모 모델의 파라미터를 온칩에 유지해 외부 메모리 접근을 줄이는 것이 이 구성이 겨냥하는 지점이다.

All-to-All로 묶인 UltraServer

Trainium3는 Trainium2의 2D-Torus 대신 칩 간 All-to-All 연결을 사용한다. NeuronSwitch-v1은 칩 간 인터커넥트 대역폭을 2배 높이고, UltraCluster 3.0은 수십만 개 칩을 하나의 클러스터로 확장할 수 있도록 설계됐다.

UltraCluster 3.0Trn3 UltraServerNeuronSwitch-v1 FabricAll-to-AllInterconnectTrainium3Chip 1Trainium3Chip 2Trainium3...Trainium3Chip 144UltraServer 1UltraServer 2UltraServer N

이 토폴로지는 2D-Torus보다 임의 칩 간 통신 지연을 줄이고, 대규모 분산 학습의 그래디언트 동기화 효율을 높이는 데 초점이 있다.

항목 사양
최대 칩 수 144개 Trainium3
총 FP8 연산 362 PFLOPs
총 HBM3e 20.7 TB
메모리 대역폭 706 TB/s
칩 간 연결 NeuronSwitch-v1 (All-to-All)
클러스터 확장 UltraCluster 3.0 (수십만 칩)
소프트웨어 스택 AWS Neuron SDK

하나의 Trn3 UltraServer는 362 PFLOPs의 FP8 연산을 제공하며, 수천억 파라미터 규모 LLM 학습을 단일 서버 안에서 처리할 수 있는 수준이다. UltraCluster 3.0으로 수십만 칩을 연결하면 조 단위 파라미터 모델 학습도 가능하다.

Trainium2에서 달라진 지점

항목 Trainium2 Trainium3 향상 비율
FP8 연산 (칩당) ~1.26 PFLOPs 2.52 PFLOPs 2배
HBM 용량 96 GB 144 GB (HBM3e) 1.5배
메모리 대역폭 ~2.9 TB/s 4.9 TB/s 1.7배
UltraServer 성능 기준 4.4배 4.4배
메모리 대역폭 (시스템) 기준 3.9배 3.9배
전력 효율 기준 4배 4배
칩 간 토폴로지 2D-Torus All-to-All 구조 개선
제조 공정 5nm 3nm 1세대 축소

시스템 관점에서는 Trn3 UltraServer가 Trn2 대비 4.4배의 성능, 3.9배의 메모리 대역폭, 4배의 전력 효율을 달성한다. 에너지 효율 40% 개선은 대규모 데이터센터 운영 비용과 직접 연결되는 지표다.

GPU와 학습 전용 ASIC의 선택 기준

NVIDIA GPU는 범용 병렬 처리에 기반한 CUDA Core와 Tensor Core를 사용하며, CUDA/cuDNN 생태계와 멀티클라우드 이식성이 강점이다. Trainium3는 NeuronCore를 중심으로 행렬 연산과 AI 학습·추론에 맞춘 설계를 택한다.

비교 항목 NVIDIA GPU (H100/B200) AWS Trainium3
설계 철학 범용 병렬 처리 AI 학습 전용 최적화
아키텍처 CUDA Core + Tensor Core NeuronCore (행렬 연산 특화)
소프트웨어 생태계 CUDA/cuDNN (광범위) AWS Neuron SDK (AWS 전용)
메모리 80~192 GB HBM3/HBM3e 144 GB HBM3e
가격 대비 성능 기준 30~40% 우위 (AWS 발표)
학습 비용 기준 ~54% 절감 (토큰당, A100 대비)
전력 효율 5~10 TOPS/W 10~15 TOPS/W
워크로드 유연성 학습+추론+HPC+그래픽 AI 학습+추론 특화
벤더 종속 멀티클라우드 지원 AWS 전용
CUDA 기존 코드 활용AWS 네이티브 학습추론 최적화AI 워크로드유형 선택NVIDIA GPU(H100/B200)Trainium3(Trn3 UltraServer)Inferentia2/3(Inf2 인스턴스)장점: 생태계, 유연성단점: 높은 비용장점: 비용 효율, 전력 효율단점: AWS 종속장점: 추론 최저 비용단점: 학습 불가

AWS 내부 벤치마크에서는 Trainium이 A100 클러스터보다 토큰당 약 54% 낮은 비용으로 LLM 학습이 가능하다고 제시한다. 다만 이 비용 우위는 AWS 전용 Neuron SDK 환경과 맞물려 있으므로, 기존 CUDA 자산을 가진 조직에는 마이그레이션 범위가 선택의 핵심 변수가 된다.

클라우드 사업자가 칩을 설계하는 방식

AWS는 Trainium과 Inferentia를 통해 학습과 추론을 모두 포괄하는 풀스택 커스텀 실리콘 전략을 취한다. UltraServer와 UltraCluster를 결합해 대규모 분산 학습에 집중하면서도, AWS 리전에는 100만 개 이상 NVIDIA GPU를 함께 배치한다. GPU 대비 30~40% 높은 가격 대비 성능을 제시하는 전략이다.

Google은 2015년부터 TPU를 개발해 온 커스텀 AI 칩 프로그램을 운영한다. TPU v7 Ironwood는 2025년 11월 공개됐고 달러당 성능 최대 4배 향상을 내세운다. Transformer와 LLM에 특화한 MXU 아키텍처, JAX·TensorFlow 네이티브 통합, Meta 등 외부 기업의 TPU 채택이 특징이다.

Microsoft Maia는 추론 특화 가속기 전략에 무게를 둔다. Maia 200은 2026년 1월 공개됐으며 TSMC 3nm 공정, FP4 10 PFLOPs 이상, 216 GB HBM3e, 7 TB/s 대역폭, 750W TDP 사양을 제시한다. Trainium3보다 FP4 기준 약 3배 성능을 주장하며, Maia AI 전송 프로토콜을 통해 최대 6,144개 가속기 클러스터링을 지원한다.

비교 AWS Trainium3 Google TPU v7 MS Maia 200
공정 3nm 미공개 3nm
주력 영역 학습+추론 학습+추론 추론 특화
FP8 성능 2.52 PFLOPs 미공개 5 PFLOPs
HBM 용량 144 GB 미공개 216 GB
최대 클러스터 수십만 칩 수천 칩(Pod) 6,144 가속기
소프트웨어 Neuron SDK JAX/TF Azure AI SDK

도입 전 검토할 운영 조건

CUDA 기반 기존 코드는 Neuron SDK로 마이그레이션해야 한다. PyTorch와 JAX 지원은 확대되고 있지만 CUDA와 비교하면 라이브러리 커버리지가 제한적이다.

Trainium은 AWS 전용이므로 멀티클라우드 전략과 충돌할 수 있다. 학습 파이프라인의 클라우드 이식성을 먼저 평가해야 하며, 인스턴스 단가만이 아니라 마이그레이션 비용, 엔지니어 학습 비용, 운영 복잡성까지 비용 구조에 포함해야 한다.

워크로드도 구분해야 한다. Trainium3는 밀집 Transformer 학습에 최적화돼 있지만 HPC 시뮬레이션이나 그래픽 워크로드에는 적합하지 않다. LNC=8 지원은 2026년 중반으로 예정돼 있어, 대규모 모델의 NeuronCore 병렬화 전략도 사전에 계획할 필요가 있다.

Sources

AWSTrainium3AI 가속기커스텀 실리콘분산 학습클라우드 AI