Amazon Trainium 채택이 보여주는 AI 가속기 선택의 조건
Amazon Trainium의 아키텍처와 Anthropic·Uber 채택 사례를 바탕으로 NVIDIA GPU 대비 비용, 성능, 소프트웨어 생태계의 선택 기준을 정리한다.
2026-08-14 · 최초 발행 2026-04-19
AWS 커스텀 실리콘이 대형 학습 워크로드로 들어오는 방식
Amazon의 AI 가속기 Trainium은 NVIDIA GPU 의존도를 줄이고 클라우드 안의 AI 컴퓨팅 비용을 낮추기 위해 설계됐다. 2025~2026년에는 실험 단계를 넘어 대형 프로덕션 채택 사례가 나타났다.
Anthropic은 500,000개 Trainium2 칩으로 구성된 Project Rainier 클러스터를 Claude 모델 훈련의 핵심 인프라로 선택했다. Uber는 2026년 4월 AWS와 인프라 파트너십을 확대하면서 Trainium3 파일럿을 시작했다. OpenAI도 AWS 약정을 포함한 $500억 규모 계약 안에 Trainium을 포함했다.
| 기업 | 채택 칩 | 규모 | 용도 |
|---|---|---|---|
| Anthropic | Trainium2 (Project Rainier) | 500,000개 클러스터 | Claude 모델 훈련 |
| Uber | Trainium3 | 파일럿 착수 | 라이드쉐어 AI (ETA, 드라이버 배정) |
| OpenAI | Trainium (AWS 약정 포함) | $500억 규모 계약 내 포함 | 대규모 훈련 워크로드 |
Andy Jassy는 2026년 4월 Trainium2 완판과 Trainium3의 거의 완판 상태를 공개하며 제3자 직접 판매 검토를 언급했다. AWS 칩 사업부의 연간 매출 run rate는 $200억이며, 독립 가치는 ~$500억으로 추정된다.
Trainium3는 연산 유닛과 메모리 계층을 함께 설계한다
Trainium은 머신러닝 훈련에 특화한 AWS 자체 설계 가속기다. Trainium3 UltraServer는 144칩을 통합하며, 내부의 NeuronCore-v4와 메모리 계층은 행렬·텐서 연산을 지속적으로 공급하는 구조에 맞춰져 있다.
계열은 Trainium1에서 Trainium2, Trainium3로 이어지며 Trainium4가 예정돼 있다. Trainium3는 2025년 12월 출시됐고, UltraServer 기준 362 FP8 PFLOPs를 제공한다. Trainium2와 비교하면 컴퓨팅은 4.4×, 에너지 효율은 4×, 메모리 대역폭은 4×다.
시스톨릭 어레이는 행렬 곱을 하드웨어 파이프라인에서 병렬로 처리한다. Trainium의 Tensor Engine은 딥러닝에서 반복적으로 수행되는 행렬·텐서 연산을 이 구조에 맞춘다.
- BF16 시스톨릭 어레이는 128×128 크기이며 기본 훈련 정밀도를 담당한다.
- MXFP8/MXFP4 어레이는 512×128 크기로 저정밀도 고처리량 연산에 사용된다.
- NeuronCore마다 32 MiB SRAM이 전용 탑재돼 레이턴시를 낮춘다.
| 계층 | 설명 | Trainium2 | Trainium3 |
|---|---|---|---|
| SBUF | 시스톨릭 어레이 입력 스트리밍 버퍼 | - | - |
| PSUM | 행렬 곱 출력 타일 부분합 누적 | - | - |
| TCM | GpSimdE 코어당 64 KB, 3사이클 접근 | 포함 | 포함 |
| HBM | 고대역폭 메인 메모리 | 96 GB, 2.9 TB/s | 144 GB HBM3e, 4.9 TB/s |
칩 내부 SRAM과 HBM을 계층화해 데이터 이동 병목을 줄이고, 시스톨릭 어레이가 연속적으로 데이터를 소비하도록 만든 것이 이 설계의 핵심이다.
비용은 칩이 아니라 시스템 단위에서 비교해야 한다
Trainium3의 경쟁 방식은 단일 칩 피크 성능보다 aggregate compute/cost에 가깝다. 144칩 UltraServer가 제공하는 총 처리량과 비용의 비율을 기준으로 경쟁력을 확보하려는 구조다.
| 비교 항목 | Trainium3 | NVIDIA H100 | NVIDIA B200 |
|---|---|---|---|
| 단일 칩 성능 | 2.52 PFLOPs FP8 | 기준 | H100 대비 추론 4~5× |
| 시스템 비용 | H100 대비 30~50% 절감 | 기준 | Trainium 대비 40~60% 고가 추정 |
| 토큰당 비용 | A100 대비 ~54% 낮음 (AWS 내부) | 기준 | - |
| 소프트웨어 성숙도 | Neuron SDK (성장 중) | CUDA (20년 이상) | CUDA |
| 멀티클라우드 지원 | AWS 전용 | 온프레미스·멀티클라우드 | 온프레미스·멀티클라우드 |
프로덕션 판단에는 FLOPS만으로는 부족하다. 가변 요청 크기, 혼합 모델 구성, 동시 사용자 레이턴시 요구사항까지 반영한 토큰당 비용(Cost per million tokens)이 평가 기준이 돼야 한다.
Anthropic과 Uber가 선택한 워크로드
Project Rainier의 하드웨어 협업
Anthropic의 Project Rainier는 500,000개 Trainium2 칩 클러스터로, 2025년 10월 가동했다. 기존 훈련 대비 5배 이상의 컴퓨팅을 확보해 Claude 모델 훈련의 핵심 인프라로 사용한다.
이 사례는 단순한 인스턴스 구매와는 다르다. Anthropic 엔지니어들은 Neuron SDK용 저수준 커널을 직접 작성했고 Trainium3 칩 설계에도 직접 참여했다. AI 스타트업이 클라우드 공급자의 하드웨어 설계에 관여하는 파트너십 모델이라는 점에서 의미가 있다.
Uber의 선택적 이전
Uber의 AI 모델은 드라이버 배정, ETA 계산, 배달 추천을 위해 13.567 billion 트립 데이터를 기반으로 훈련된다. Uber는 Trainium3 파일럿과 AWS 파트너십 확대를 진행하는 한편, Graviton4 프로세서로 Trip Serving Zones를 이관하고 있다.
비용 목표는 H100/H200 대비 30~50% 수준이다. 다만 Oracle과 Google Cloud를 함께 유지하면서 특정 워크로드만 옮기는 방식을 택했다. 전체 인프라를 한 공급자로 바꾸기보다, 워크로드별로 경제성을 평가하는 접근이다.
Neuron SDK 전환 비용은 아키텍처 적합성과 함께 봐야 한다
Trainium 도입에서 가장 큰 장벽은 하드웨어보다 소프트웨어 생태계의 격차다.
| 항목 | CUDA (NVIDIA) | Neuron SDK (AWS) |
|---|---|---|
| 역사 | 20년 이상 | 2018년 시작 |
| 개발자 규모 | 400만 명 이상 | 성장 중 |
| ML 프레임워크 지원 | 최우선 최적화 | 2025년 이후 격차 축소 |
| 커스텀 연산자 | 완전 지원 | 일부 제한 |
| 이식성 | NVIDIA 전용 | AWS Trainium/Inferentia 전용 |
Depthwise convolution이나 LayerNorm을 사용하는 아키텍처(ConvNeXt 등)에서는 컴파일 실패 사례가 보고됐다. 복잡한 커스텀 연산자에 의존하는 코드베이스도 마이그레이션 비용이 높다.
반대로 TorchNeuron은 2025년에 PyTorch native backend로 FSDP, DTensor, torch.compile 지원을 확대했다. AWS는 소프트웨어 스택 대부분의 오픈소스화를 추진하며 CUDA 생태계 구축 전략을 모방하고 있다.
워크로드와 배치 환경이 선택을 가른다
Trainium은 AWS 네이티브 스택을 쓰는 기업, 대규모 Transformer 기반 LLM 훈련, 비용 민감도가 높은 장기 배치 훈련 워크로드에 맞는다. 벤더 락인을 일부 감수하고 AWS 파트너십을 심화하려는 경우에도 선택지가 된다.
NVIDIA는 다양한 모델 아키텍처를 실험해야 하거나, 온프레미스·멀티클라우드 요구사항이 있거나, 최고 단일 칩 추론 성능이 필요한 경우에 유리하다. 복잡한 커스텀 연산자를 사용하는 기존 코드베이스도 CUDA 생태계의 강점을 더 크게 받는다.
AWS 밖에서 고려할 수 있는 가속기 조합
Trainium은 AWS 전용이므로 클라우드 종속을 피하거나 데이터 주권이 필요한 환경에서는 다른 선택지가 필요하다.
- NVIDIA DGX H100/H200/B200: 고성능, 완성된 생태계, 높은 초기 투자
- AMD Instinct MI300X: CUDA와의 ROCm 호환성 개선 중, 비용 경쟁력
- Intel Gaudi 3: 오픈소스 소프트웨어 스택, 데이터센터 통합 용이
- 자체 실리콘: 구글 TPU Pod 임대, Meta MTIA 등 소수 대형 기업 선택지
프리 트레이닝은 Trainium으로 비용 효율을 추구하고, 파인튜닝·추론은 온프레미스 NVIDIA GPU에서 처리해 데이터 주권과 레이턴시를 다루는 조합도 현실적인 균형점으로 떠오르고 있다.
NVIDIA AI 가속기 시장 점유율은 2026년 약 75%로 점진적 하락이 전망되지만, 2024년 ~80%에서 여전히 높은 수준이다. Trainium3 완판과 Trainium4 설계 진행, 제3자 판매 검토는 AWS가 독립적인 칩 사업을 확대하는 흐름을 보여준다. Anthropic이 Trainium3 설계에 직접 참여한 방식이 확산되면 AI 기업과 클라우드 공급자 사이의 수직 통합도 심화될 가능성이 있다.
Sources
- https://techcrunch.com/2026/04/07/uber-is-the-latest-to-be-won-over-by-amazons-ai-chips/
- https://www.anthropic.com/news/anthropic-amazon-trainium
- https://techcrunch.com/2026/03/22/an-exclusive-tour-of-amazons-trainium-lab-the-chip-thats-won-over-anthropic-openai-even-apple/
- https://newsletter.semianalysis.com/p/aws-trainium3-deep-dive-a-potential
- https://awsdocs-neuron.readthedocs-hosted.com/en/latest/general/nki/arch/trainium_inferentia2_arch.html
- https://www.aboutamazon.com/news/aws/trainium-3-ultraserver-faster-ai-training-lower-cost
- https://www.aboutamazon.com/news/aws/aws-uber-ai-trainium-graviton
- https://www.cnbc.com/2025/11/21/nvidia-gpus-google-tpus-aws-trainium-comparing-the-top-ai-chips.html
- https://datacentremagazine.com/news/aws-how-500-000-trainium2-chips-power-project-rainier