AWS Trainium3와 NeuronCore: AI 학습용 커스텀 실리콘

AWS Trainium3의 NeuronCore-v3, HBM3e, UltraCluster2.0 구성과 GPU 대안 가속기 전략을 정리한다.

2026-08-14 · 최초 발행 2026-04-17

GPU 의존도를 줄이려는 AWS의 학습용 칩

AWS는 2026년 re:Invent 시즌을 앞두고 AI 학습 전용 ASIC인 Trainium3를 일반 출시(GA)했다. 공식 발표 기준으로 Trainium2보다 학습 처리량은 약 3배, 에너지 효율은 약 40% 개선됐다. NVIDIA H200·B200 GPU에 집중된 학습 인프라 의존도를 완화하려는 하이퍼스케일러의 자체 가속기 전략이 학습 영역까지 확장된 사례다.

Trainium3는 AWS Annapurna Labs가 설계하는 DLSA(Deep Learning Specialized ASIC) 계열의 3세대 제품군이다. Inferentia가 추론 워크로드를 겨냥한다면, Trainium은 수십억~수천억 파라미터 모델의 pre-training과 fine-tuning을 대상으로 한다. 대규모 Foundation Model 학습의 비용·전력·공급망 리스크를 낮추는 것이 이 칩의 목적이다.

TSMC 3nm 공정, HBM3e 192GB, 칩 간 NeuronLink 광대역 직결을 결합해 노드 내부의 메모리 대역폭과 All-Reduce 성능을 함께 끌어올렸다.

연산·메모리·패브릭을 묶은 Trainium3 구성

NeuronCore-v3는 Systolic Tensor Engine과 Scalar/Vector Engine을 분리한 구조다. FP8·MXFP6·INT4 저정밀 연산을 네이티브로 지원하며, 블록 단위 Sparsity 2:4/4:8 가속도 제공한다.

메모리 서브시스템은 HBM3e 192GB와 약 5.2TB/s 대역폭을 사용한다. On-chip SRAM 확대로 Activation Re-materialization 비용을 줄이고, DMA 엔진은 Collective Op과 오버랩해 동작한다.

노드와 클러스터 확장은 NeuronLink v3가 맡는다. 칩 간 직결은 1.6Tbps 수준이며, UltraCluster2.0에서는 수만 개 가속기를 비차단 토폴로지로 연결한다. EFA(Elastic Fabric Adapter) 3세대와도 통합된다.

모델 코드에서 UltraCluster2.0까지 이어지는 경로

Model Code (PyTorch / JAX)Neuron SDK CompilerHLO / StableHLO IRNeuronCore-v3 KernelTrn3 Instance (16xTrainium3)NeuronLink FabricUltraCluster2.0 (수만가속기)EFA v3 + SRD ProtocolS3 Express One Zone / FSx

모델 코드는 Neuron SDK를 거쳐 NeuronCore-v3 커널로 하향 번역되고, 이후 인스턴스·패브릭·스토리지 계층으로 확장된다. 컴파일러가 StableHLO IR을 사용하므로 PyTorch 2.x의 torch.compile 및 JAX의 pjit 워크플로를 큰 수정 없이 수용한다.

GPU 대안 가속기와의 위치

구분 NVIDIA B200 AWS Trainium3 Google TPU v5p Meta MTIA v2
설계 주체 NVIDIA AWS Annapurna Google Meta
타깃 범용 학습/추론 학습 특화 학습/추론 혼합 내부 워크로드
메모리 HBM3e 192GB HBM3e 192GB HBM3 95GB HBM2e 128GB
SW 스택 CUDA/NCCL Neuron SDK XLA/Pathways PyTorch 내부
접근 방식 오픈 생태계 AWS 종속 GCP 종속 비공개

Trainium3의 경쟁력은 단일 칩 성능보다 클러스터 스케일 경제성에 있다. Capacity Reservation과 EC2 Capacity Blocks for ML을 함께 사용하면 수 주 단위로 수만 가속기를 선점할 수 있다. 시간당 비용은 H200 기반 p5보다 약 30~40% 낮게 책정됐다.

대규모 학습과 fine-tuning 환경

AWS와 Anthropic의 다년 전략 파트너십에서는 Trainium3 우선 공급이 전제된다. Claude 4 계열 이후 모델의 대규모 pre-training 워크로드를 이관하고, Neuron SDK의 JAX 경로를 통해 기존 학습 파이프라인을 재사용하는 방식이다.

엔터프라이즈 fine-tuning 플랫폼에서는 SageMaker HyperPod Trn3 패밀리로 LoRA·QLoRA 대규모 병렬 학습을 수행할 수 있다. MXFP6 양자화 학습은 GPU 대비 35% 비용 절감을 목표로 하며, Spot Capacity Blocks는 야간 배치 학습 비용을 추가로 낮추는 수단이다.

컴파일과 집합 통신이 만나는 지점

노드노드PyTorch XLA / JAXNeuron Compiler(neuronx-cc)HLO Pass / ShardingPlannerNeuron Runtime (libnrt)Collective 선택NeuronLink All-ReduceEFA v3 SRD모델 상태 업데이트

컴파일 타임의 샤딩 계획과 런타임의 집합 통신 선택은 분리돼 있다. 운영 환경에서는 컴파일러가 생성한 NEFF(Neuron Executable File Format) 캐시를 공유 스토리지에 두어 수천 워커의 cold-start 시간을 단축하는 구성이 권장된다.

비용 구조와 운영 제약을 함께 평가할 때

학습 TCO는 30% 이상 절감할 수 있고, GPU 공급 지연 리스크도 완화할 수 있다. AWS 장기 할인인 Reserved/Savings Plans와의 연계도 가능하다.

FP8/MXFP6 네이티브 연산은 메모리 발자국을 줄이며, 집합 통신 오버랩은 MFU(Model FLOPs Utilization) 향상에 기여한다. StableHLO IR 기반이라는 점은 프레임워크 포팅에도 유리하다.

대신 Neuron SDK 종속성은 고려해야 한다. 커스텀 CUDA 커널에는 포팅 비용이 발생하며, FlashAttention 등 최신 커널의 Neuron 포팅 시점도 확인해야 한다. 초기 리전은 us-east-1과 us-west-2 중심이므로 확장 일정 역시 점검 대상이다.

Trainium3 GA는 신규 인스턴스 출시를 넘어, 하이퍼스케일러의 자체 실리콘 전략이 학습 워크로드에 본격적으로 침투한 사건이다. 학습 비용 구조를 다시 설계할 선택지가 늘어난 만큼, NeuronCore 소프트웨어 호환성과 장기 캡슐화 비용을 함께 평가한 뒤 도입 여부를 결정해야 한다.

Sources

AWSTrainium3AI 학습커스텀 실리콘Neuron SDK