LLM 아키텍처 갤러리: GPT-2 이후 주요 아키텍처가 바뀌어온 방식

GPT-2를 기준점으로 GPT·BERT·T5·LLaMA·Mistral·Mamba 계열의 핵심 아키텍처 혁신과 Attention·위치인코딩·정규화 트렌드 변화를 정리한다.

2026-08-14 · 최초 발행 2026-03-17

LLM(Large Language Model)의 역사는 단 몇 년 만에 폭발적으로 발전했다. GPT-2가 공개된 2019년부터 현재까지, 수십 개의 아키텍처가 등장하고 사라지고 진화했다. 머신러닝 연구자이자 교육자인 Sebastian Raschka는 이 복잡한 아키텍처 계보를 시각적으로 정리한 "LLM Architecture Gallery"를 공개했다. 이 갤러리를 기반으로 GPT-2 이후 주요 LLM 아키텍처의 핵심 혁신과 트렌드를 정리한다.

Raschka의 갤러리가 다루는 방식

Sebastian Raschka는 Machine Learning Q&A, "Build a Large Language Model from Scratch" 저자로 잘 알려진 연구자다. 복잡한 ML 개념을 명확한 시각화로 설명하는 것으로 유명하며, 그의 LLM 아키텍처 갤러리는 GPT-2를 기준점으로 삼아 이후 등장한 주요 모델들의 아키텍처 변화를 도식화한 자료다. 이 갤러리가 특히 가치 있는 이유는 각 아키텍처의 논문 수식이나 코드가 아닌 "무엇이 변경되었는가"에 집중하기 때문이다. GPT-2의 기본 구조에서 어떤 컴포넌트가 추가되고, 교체되고, 최적화되었는지를 한눈에 파악할 수 있다.

GPT-2: 모든 비교의 기준점

GPT-2(2019, OpenAI)는 현대 LLM의 원형이다. Decoder-only Transformer 구조를 채택해 자기회귀(autoregressive) 언어 모델링을 수행하며, 이후 대부분의 생성 모델들이 이 구조를 계승하거나 변형한다.

입력 토큰토큰 임베딩 +위치 임베딩Transformer Decoder Block(x N)Multi-Head Self-Attention(Causal Masking)Add & Layer NormFeed-Forward Network(2-layer MLP)Add & Layer Norm언어 모델 헤드(Linear + Softmax)다음 토큰 예측

GPT-2의 핵심 특징은 인코더 없이 디코더만 쓰는 Decoder-only 구조, 미래 토큰을 볼 수 없도록 마스킹하는 Causal Self-Attention, Layer Normalization을 Attention 이전에 적용하는 Pre-norm, Byte Pair Encoding을 쓰는 BPE 토크나이저다.

GPT 계열: 스케일 확장이 증명한 것

GPT 시리즈는 아키텍처 혁신보다 스케일(파라미터 수, 데이터량)의 중요성을 증명한 계열이다.

모델 연도 파라미터 핵심 변화
GPT-2 2019 1.5B 기준 Decoder-only
GPT-3 2020 175B Few-shot learning 능력 출현
InstructGPT 2022 175B RLHF 도입, 지시 따르기
GPT-4 2023 비공개 MoE 추정, 멀티모달

GPT-3에서 GPT-4로의 가장 중요한 변화는 RLHF(Reinforcement Learning from Human Feedback) 도입이다. 순수 언어 모델링에서 인간 선호도를 반영하는 방향으로 학습 패러다임이 전환되었다.

BERT 계열: 텍스트 이해를 위한 Encoder-only

BERT(2018, Google)와 그 후속 모델들은 텍스트 생성보다 텍스트 이해에 최적화된 Encoder-only 구조다.

BERT (2018)Encoder-onlyMLM + NSPRoBERTa (2019)MLM 개선 많은 데이터DeBERTa (2021)Disentangled Attention위치 인코딩 분리ALBERT (2020)파라미터 공유경량화

BERT의 혁신은 Masked Language Modeling(MLM)이다. 입력 토큰의 일부를 마스킹하고 예측하는 방식으로 양방향 문맥을 학습할 수 있다. GPT가 "왼쪽에서 오른쪽"으로만 보는 반면, BERT는 양방향을 본다.

T5와 Seq2Seq: 텍스트-텍스트로 통일하다

T5(2019, Google)는 모든 NLP 태스크를 "텍스트를 입력받아 텍스트를 출력"하는 통일된 형식으로 처리한다는 아이디어를 실현했다. Encoder-Decoder 구조를 사용한다.

입력: 번역: 안녕하세요Encoder(양방향 Self-Attention)크로스 어텐션디코더 입력Decoder(단방향 Self-Attention)출력: Hello

T5의 영향을 받은 모델로는 FLAN-T5, mT5, UL2 등이 있으며, 요약, 번역, 질문 답변 등 다양한 태스크에서 강력한 성능을 보였다.

LLaMA 계열: 오픈소스의 판도를 바꾸다

LLaMA(2023, Meta)는 오픈소스 LLM의 판도를 바꿨다. GPT-3 수준의 성능을 공개적으로 접근 가능한 형태로 제공하면서, 커뮤니티 기반 개발의 폭발적 성장을 촉발했다.

LLaMA 1 (2023)(1) RMSNorm 도입(2) SwiGLU 활성화(3) RoPE 위치 인코딩LLaMA 2 (2023)(1) 컨텍스트 2배 확장(2) GQA 도입(3) RLHF 적용LLaMA 3 (2024)(1) 128K 어휘(2) GQA 전면 적용(3) 많은 데이터LLaMA 3.1+ (2024)(1) 405B 파라미터(2) 멀티링궐 강화(3) 함수 호출 지원

LLaMA가 GPT-2 대비 도입한 핵심 혁신은 네 가지다. Layer Norm 대신 Root Mean Square Norm을 써서 평균을 빼는 연산을 생략해 계산 효율을 높인 RMSNorm, GELU보다 나은 성능을 내는 활성화 함수 혁신인 SwiGLU, 절대 위치 대신 상대 위치를 회전 행렬로 인코딩해 더 긴 시퀀스로 외삽 가능하게 한 RoPE(Rotary Position Embedding), KV 캐시 메모리를 줄이면서 Multi-Head Attention 성능을 유지하는 GQA(Grouped Query Attention)다.

Mistral: 작지만 강한 모델의 효율

Mistral 7B(2023)는 "작지만 강한" 모델의 대명사가 되었다. 7B 파라미터로 LLaMA-2 13B를 능가하는 성능을 보였다.

핵심 기술은 Sliding Window Attention(SWA)과 MoE(Mixture of Experts)다. SWA는 모든 토큰이 전체 컨텍스트에 주목하는 대신, 일정 윈도우 내 토큰에만 집중해 긴 시퀀스를 효율적으로 처리한다. Mixtral 8x7B는 MoE 구조로 실제 활성화되는 파라미터를 줄이면서 더 많은 총 파라미터를 활용한다.

Mamba: Attention을 걷어내려는 시도

Mamba(2023)는 Transformer의 Self-Attention을 완전히 제거하고 State Space Model(SSM)로 대체한 아키텍처다. Attention의 O(n²) 복잡도를 O(n)으로 줄이면서 경쟁력 있는 성능을 보였다.

대체 시도TransformerSelf-AttentionO(n²) 복잡도MambaSSM 기반O(n) 복잡도Mamba-2이론적 연결 강화Linear Attention근사적 선형화RetNet, RWKV하이브리드 접근

그러나 Mamba는 실제 하드웨어(GPU) 최적화가 Transformer만큼 성숙하지 않아, 이론적 효율성이 실제 처리 속도로 완전히 연결되지 않는다는 한계가 있다.

Attention부터 MoE까지, 진화 트렌드를 관통하는 흐름

GPT-2 이후 LLM 아키텍처의 진화를 관통하는 핵심 트렌드는 다음과 같다. Full Attention에서 MHA·GQA·MQA를 거쳐 Sliding Window로 향하는 효율적 Attention, 절대 위치에서 상대(ALiBi)를 거쳐 회전(RoPE)으로 더 긴 컨텍스트를 지원하게 된 위치 인코딩 진화, Post-norm에서 Pre-norm으로 학습 안정성을 높인 정규화 위치 변화, ReLU에서 GELU를 거쳐 SwiGLU로 성능을 개선한 활성화 함수, 순수 사전학습에서 SFT·RLHF·DPO로 정렬(Alignment)을 강화한 학습 패러다임, Dense 모델에서 Sparse MoE로 동일 계산 비용에 더 많은 파라미터를 쓰게 된 MoE 확산이다.

어떤 아키텍처를 어디에 쓰는가

새로운 LLM 프로젝트나 파인튜닝을 시작할 때 아키텍처 선택 기준은 다음과 같다.

사용 사례 권장 아키텍처 계열 이유
텍스트 분류, NER BERT/DeBERTa Encoder-only, 양방향 이해
텍스트 생성, 대화 LLaMA/Mistral Decoder-only, 오픈소스 생태계
번역, 요약 T5/FLAN-T5 Seq2Seq 최적화
엣지 디바이스 배포 Phi-3, Gemma 2B 경량화 특화
최대 성능 필요 GPT-4o, Claude 상용 최신 모델

Raschka의 LLM 아키텍처 갤러리는 GPT-2에서 현재까지의 기술 진화를 한눈에 파악하는 레퍼런스다. RMSNorm, RoPE, GQA, SwiGLU 등의 혁신은 단순히 "더 크게"가 아닌 "더 효율적으로"라는 방향성을 보여준다. 오픈소스 모델의 발전으로 연구자와 엔지니어 누구나 최신 아키텍처를 직접 실험할 수 있는 환경이 마련되었다.

Sources

LLM아키텍처트랜스포머GPTLLaMAMamba