SubQ와 Zyphra가 여는 비트랜스포머 LLM 상용화 경쟁

SubQ의 하이브리드 구조와 Zyphra의 AMD 기반 MoE를 중심으로 비트랜스포머 LLM의 메모리 효율과 장문 처리, 상용화 경쟁을 분석한다.

2026-08-14 · 최초 발행 2026-05-19

트랜스포머의 셀프 어텐션은 시퀀스가 길어질수록 연산량과 메모리 사용량이 O(n²)으로 증가한다. LLM 업계를 지배한 지 7년이 넘었지만, 이 구조적 제약은 여전히 컨텍스트 확장의 병목이다.

2025년에는 이 한계를 다른 구조로 우회하려는 움직임이 상용화 단계로 들어섰다. SubQ는 $2,900만 시드 펀딩을 확보한 뒤 SubQ 1M-Preview를 공개하며 12M 컨텍스트를 실용화했다. Zyphra는 AMD GPU로 훈련한 8B MoE 모델을 오픈소스로 내놓았다. 비-트랜스포머 LLM 경쟁이 연구실 밖으로 나온 사례들이다.

어텐션 비용을 시퀀스 길이와 분리하는 방법

표준 트랜스포머는 시퀀스 길이 n에 대해 O(n²) 연산과 O(n²) 메모리를 요구한다. 128K 토큰에서는 어텐션 행렬만 약 64GB를 차지하고, 1M 토큰에 이르면 요구량이 수학적으로 감당하기 어려운 수준으로 커진다. 서브쿼드라틱 아키텍처는 이 행렬을 그대로 만들지 않는 방식으로 병목을 피한다.

선형 어텐션은 소프트맥스 커널을 함수 φ로 근사하고 행렬 곱의 결합 법칙에 따라 계산 순서를 바꾼다.

Attention(Q,K,V) = φ(Q)(φ(K)ᵀV) / φ(Q)φ(K)ᵀ1

어텐션 행렬을 명시적으로 계산하지 않으므로 복잡도는 O(n·d²)로 낮아진다. 대신 표준 어텐션보다 표현력이 제한될 수 있다.

상태 공간 모델(SSM)은 시퀀스를 연속 시간 선형 시스템으로 다룬다.

h'(t) = Ah(t) + Bx(t)
y(t)  = Ch(t) + Dx(t)

이를 이산화하면 학습에서는 병렬 스캔을 통해 O(n log n), 추론에서는 O(1) 상태 업데이트가 가능하다. Mamba는 입력에 따라 파라미터가 달라지는 Selective State Space를 도입해 SSM이 컨텍스트에서 필요한 정보를 선택하는 능력을 높였다.

SubQ는 로컬 정밀도와 글로벌 상태를 결합한다

SubQ 1M-Preview는 하나의 기법에 의존하지 않는다. 로컬 윈도우 안에서는 정확한 어텐션을 수행하고, 윈도우 밖의 글로벌 컨텍스트는 압축된 상태 표현으로 전달한다.

입력 토큰 시퀀스 (12M)청크 분할 레이어로컬 어텐션 윈도우 (8K)글로벌 상태 압축 레이어청크 정밀 어텐션SSM 기반 장거리 전파청크 출력 임베딩글로벌 컨텍스트 벡터크로스-청크 통합 레이어최종 표현 출력

이 계층적 하이브리드 구조에서는 메모리 사용량이 컨텍스트 길이에 비례한다. 표준 어텐션이 12M 토큰에서 약 576TB를 요구하는 데 비해, SubQ의 청크 하이브리드는 수십 GB 수준에서 처리할 수 있다.

아키텍처별 차이는 다음과 같다.

아키텍처 컨텍스트 복잡도 메모리(1M 토큰) 추론 속도
표준 트랜스포머 O(n²) ~수 PB 기준
슬라이딩 윈도우 O(n·w) ~수십 GB 1.2x
선형 어텐션 O(n) ~수 GB 1.8x
Mamba (SSM) O(n) ~수 GB 2.1x
SubQ 하이브리드 O(n log n) ~수십 GB 1.6x

긴 컨텍스트에서는 캐시와 정보 손실을 함께 봐야 한다

아키텍처의 복잡도만 낮춘다고 12M 컨텍스트를 실용적으로 쓸 수 있는 것은 아니다. 생성 과정의 상태 관리와 오래된 정보의 보존 방식까지 처리 파이프라인 전체에서 다시 설계해야 한다.

트랜스포머의 KV 캐시는 자기회귀 생성 과정에서 이전 토큰의 키·값 행렬을 보관해 재계산을 줄인다. 문제는 컨텍스트가 길어질수록 캐시도 계속 커진다는 점이다. fp16 기준 1M 토큰의 KV 캐시만 약 128GB에 이른다.

SSM 계열의 서브쿼드라틱 모델은 KV 캐시 대신 고정 크기의 은닉 상태에 전체 이력을 압축한다. 메모리 증가를 억제할 수 있지만, 압축 과정에서 정보가 사라질 수 있다. 특히 긴 문서에서 특정 사실을 정확히 회상하는 Retrieval 작업에서는 이 약점이 드러난다.

토큰 t₁...tₙSSM 상태 압축고정 크기 은닉 상태 h다음 토큰 생성 tₙ₊₁상태 업데이트트랜스포머 KV 캐시K₁...Kₙ, V₁...Vₙ 누적O(n) 메모리 증가

모델 내부 상태만으로 부족한 경우에는 외부 메모리와 토큰 압축을 함께 사용한다. 슬라이딩 윈도우가 이동할 때 이전 청크를 고밀도 요약 토큰으로 바꾸는 방식이 한 예다. Mamba 기반 구현에서는 원본 대비 16:1 압축률을 달성한 사례가 있다.

벡터 DB에서 관련 청크를 검색해 로컬 어텐션 윈도우에 삽입하는 외부 어텐션 메모리도 사용할 수 있다. 청크 사이에 전달할 정보는 학습된 게이트로 걸러 노이즈를 줄인다.

SubQ 1M-Preview는 컨텍스트 전파를 단순한 선형 재귀로 처리하지 않고 학습된 비선형 게이팅으로 구현했다. 이 구조는 수백만 토큰 앞에서 정의된 개념을 문서 후반에서도 정확히 참조하는 능력을 유지하도록 설계됐다.

상용화 경쟁에 들어온 비트랜스포머 계열

SubQ의 투자 유치와 Zyphra의 모델 공개는 비-트랜스포머 구조가 학술 연구를 넘어 제품과 추론 인프라의 경쟁 대상이 됐음을 보여준다. 다만 같은 비-트랜스포머 범주 안에서도 접근법은 서로 다르다.

Mamba와 Mamba-2는 SSM 계열에서 가장 성숙한 생태계를 갖췄다. Mamba-2는 선택적 상태 공간을 구조화된 SSM인 SSD로 확장해 GPU 텐서 코어 효율을 높였다. 같은 규모의 트랜스포머보다 추론 품질이 소폭 낮다는 점은 한계다.

RWKV-7은 RNN과 트랜스포머를 결합한 구조다. 행렬-값 어텐션을 RNN 형식으로 구현해 병렬 학습과 순차 추론을 모두 지원하며, 이전 버전보다 멀티헤드 확장성을 크게 개선했다.

xLSTM은 LSTM에 지수 게이팅과 행렬 기억 셀을 도입한 현대적 재해석이다. 트랜스포머 수준의 확장성을 달성했다는 주장이 있으며, 유럽 연구진이 주도해 비영어권 언어 모델링에서 강점을 보인다.

Zyphra AMD 8B MoE는 AMD MI300X GPU에 최적화된 훈련으로 주목받는다. MoE 구조로 활성 파라미터 수를 줄이면서 전체 파라미터가 제공하는 이점을 유지하고, 비-트랜스포머 게이팅 메커니즘과 MoE를 결합했다.

비-트랜스포머 LLM 계보순환 계열SSM 계열하이브리드 계열xLSTMRWKV-7Mamba / Mamba-2S4 / S6 시리즈SubQ (청크+SSM)Zyphra MoE+SSMJamba (트랜스포머+Mamba)

비용 우위와 검색 정확도 사이의 간극

긴 문서 안에서 특정 사실을 찾는 Needle-in-a-Haystack 테스트에서는 트랜스포머 계열이 아직 앞선다. SubQ는 공개 벤치마크에서 12M 컨텍스트를 대상으로 GPT-4o 128K와 비슷한 검색 정확도를 기록했다고 발표했지만, 독립 검증이 필요하다.

비-트랜스포머 모델의 경쟁력은 긴 시퀀스의 추론 비용에서 뚜렷해진다. 32K 이상 컨텍스트에서는 토큰당 처리 비용이 표준 트랜스포머보다 40-70% 절감된다는 초기 데이터가 있다.

엔터프라이즈 도입에서는 모델 성능만큼 생태계도 중요하다. PyTorch, Hugging Face, vLLM 등 주요 인프라는 Mamba를 우선 지원하고 있다. SubQ와 Zyphra는 자체 추론 엔진 개발에 투자하는 단계다.

순수 대체보다 계층적 하이브리드가 앞선다

현재의 흐름은 트랜스포머를 완전히 제거하는 방향보다 여러 구조를 계층적으로 조합하는 쪽에 가깝다. AI21 Labs의 Jamba처럼 트랜스포머 레이어와 Mamba 레이어를 교차 배치하면 트랜스포머의 표현력과 SSM의 효율을 함께 노릴 수 있다. SubQ도 로컬 어텐션 레이어를 완전히 없애지 않았다.

SubQ의 12M 컨텍스트 지원과 Zyphra의 AMD 기반 MoE 공개는 O(n²) 어텐션을 우회하는 구조가 실용화 경쟁에 들어섰다는 신호다. 다만 지원 가능한 컨텍스트 길이가 곧 그 전체를 의미 있게 추론할 수 있다는 뜻은 아니다. 앞으로의 경쟁 축은 길이 자체보다 긴 컨텍스트에서 필요한 정보를 얼마나 정확하게 보존하고 활용하는지에 놓일 가능성이 높다. 2025년 하반기는 이러한 비-트랜스포머 모델이 실제 엔터프라이즈 환경에서 검증되는 시험대가 될 것이다.

Sources

비트랜스포머 LLMSubQZyphra상태 공간 모델장문 컨텍스트