MiniMax M3가 바꾼 오픈웨이트 프론티어 모델의 기준

MiniMax M3의 MSA 희소 어텐션, 1M 컨텍스트, 벤치마크 성능과 비용 구조를 엔터프라이즈 모델 선택 관점에서 분석한다.

2026-08-14 · 최초 발행 2026-06-10

MSA가 긴 컨텍스트를 다루는 방식

2026년 6월 1일 MiniMax가 공개한 M3는 오픈웨이트 모델의 위치를 다시 보게 만든다. SWE-Bench Pro 점수는 59.0%로 GPT-5.5의 58.6%를 앞섰고, 비용은 GPT-5.5 대비 5~10% 수준이다. 이 결과의 중심에는 1M 토큰 컨텍스트를 처리하도록 설계된 MSA(MiniMax Sparse Attention)가 있다.

일반적인 Transformer의 풀 어텐션은 컨텍스트 길이를 N이라 할 때 O(N²)의 연산 복잡도를 갖는다. 컨텍스트가 1M 토큰까지 늘어나면 모든 토큰 사이의 관계를 계산하는 방식은 현실적으로 운용하기 어렵다.

MSA는 GQA(Grouped-Query Attention) 백본에 블록 수준 선택 레이어를 결합해 이 문제를 다룬다. 경량 인덱스 브랜치가 입력 토큰을 훑고, 각 쿼리가 참조해야 할 KV 캐시 블록을 골라낸다. 선택되지 않은 블록은 어텐션 연산에서 제외된다.

여기서 중요한 차이는 KV 자체를 저차원 공간으로 압축하지 않는다는 점이다. DeepSeek의 MLA(Multi-Head Latent Attention)는 KV를 압축해 메모리 사용량을 줄이지만, 압축 과정에서 정보가 손실될 가능성이 있다. MSA는 원본 KV를 보존하고 관련 블록만 선택하는 방식으로 연산 효율과 정보 품질을 함께 다룬다.

입력 토큰 시퀀스 (1M)경량 인덱스 브랜치관련 블록 선택선택된 KV 캐시 블록 (비압축)비선택 블록 스킵GQA 어텐션 연산출력 토큰MLA 방식 비교KV 저차원 압축메모리 절감잠재 정보 손실 가능성

이 설계로 프리필(prefill) 속도는 이전 세대보다 9.7배, 디코드 속도는 15.6배 향상됐다. 토큰당 연산량은 1/20 수준으로 감소했고 출력 처리량은 초당 약 100토큰에 도달했다. M3가 1M 컨텍스트를 이론적인 사양에 머물지 않고 실제 배포 환경에서 운용 가능한 형태로 구현한 첫 번째 오픈웨이트 모델이라는 평가를 받는 이유다.

M3는 텍스트뿐 아니라 이미지와 비디오를 네이티브로 처리하는 멀티모달 모델이기도 하다. 가중치와 기술 보고서는 출시 약 10일 뒤 HuggingFace와 GitHub에 공개됐다. MiniMax API와 MiniMax Code 플랫폼을 통한 API 접근도 제공된다.

M1에서 이어지고 달라진 설계

M3의 출발점을 보려면 2025년 6월 공개된 M1을 함께 봐야 한다. M1은 하이브리드 MoE(Mixture-of-Experts)와 선형 어텐션을 결합한 Lightning Attention을 사용했다. 총 파라미터는 456B, 활성 파라미터는 45.9B이며 1M 토큰 컨텍스트를 지원한다. 라이선스는 Apache 2.0이다.

MSA는 처음부터 M3용으로 만들어진 기술은 아니었다. 원래 M2에 적용하기 위해 개발됐지만 당시에는 채택되지 않았고, M3 개발 과정에서 다시 다듬어져 최종 아키텍처에 들어갔다.

M1이 선형 어텐션을 통한 근사 계산에 의존했다면 M3는 실제 KV 가운데 필요한 블록을 희소하게 선택한다. 긴 컨텍스트를 다룬다는 목표는 이어졌지만, 이를 달성하는 방법은 근사 연산에서 원본 KV 기반 선택으로 바뀌었다.

코딩 성능을 읽을 때 봐야 할 기준

M3가 GPT-5.5를 앞섰다는 표현은 SWE-Bench Pro라는 평가 범위 안에서 해석해야 한다. 이 벤치마크는 Scale AI가 41개 프로덕션 레포지터리에서 뽑은 1,865개 소프트웨어 엔지니어링 과제로 구성했다. 대상 언어는 Python, Go, TypeScript, JavaScript다.

각 과제는 평균 4개 이상의 파일과 107줄의 코드 수정을 요구한다. 버그 수정부터 기능 추가, 최적화, 보안 업데이트까지 실제 엔지니어가 수 시간에서 수일 동안 수행할 만한 작업 복잡도를 모사한다.

데이터셋은 공개 세트 11개 레포, 비공개 세트 12개 레포, 상용 세트 18개 독점 레포로 나뉜다. 공개 벤치마크 데이터를 학습한 모델이 답을 암기해 점수를 높이는 데이터 오염 문제를 줄이기 위한 구조다.

SWE-Bench Verified에서는 81% 이상을 기록하는 모델도 있지만, 이 수치는 현실적인 성능을 과장할 수 있다는 평가를 받는다. SWE-Bench Pro의 46~57% 범위는 프로덕션 적용 가능성을 판단하는 데 더 신뢰할 만한 신호로 여겨진다.

2026년 6월 리더보드 상위권은 Claude Mythos Preview 77.8%, Claude Opus 4.8 69.2%, Claude Opus 4.7 Adaptive 64.3% 순이었다. M3는 35개 평가 모델 가운데 59.0%를 기록해 Claude Opus 4.7에 가까운 위치에 올랐다.

웹 탐색 벤치마크가 보여주는 에이전트 역량

BrowseComp는 단순한 지식 회상 대신 웹을 탐색하며 답을 찾는 능력을 평가한다. OpenAI가 2025년 4월 공개했으며, 1,266개의 고난도 웹 탐색 과제를 담고 있다.

문항은 답을 찾기는 어렵지만 검증하기는 쉬워야 한다는 원칙으로 설계됐다. 사람이 먼저 웹에서 검증 가능한 사실을 찾은 다음 그 사실을 바탕으로 질문을 역설계했다. GPT-4o나 o1이 기본 설정으로 풀 수 없다고 검증된 문제만 포함됐다.

2026년 6월 기준 GPT-5.5 Pro가 90.1%로 선두였고, M3는 83.5를 기록해 21개 평가 모델 가운데 경쟁력 있는 위치를 차지했다. BrowseComp는 멀티스텝 추론과 브라우저 조작을 결합한 에이전틱 웹 탐색 능력을 측정한다는 점에서 일반 지식 벤치마크와 구별된다.

성능만큼 중요한 비용 구조

비용 구조오픈웨이트클로즈드소스 프론티어GPT-5.5 대비 5-10% 비용상위권 유지Claude Opus 4.7SWE Pro 64.3%GPT-5.5SWE Pro 58.6%BrowseComp 90.1%Gemini 3.1 Pro비교 기준MiniMax M3SWE Pro 59.0%BrowseComp 83.5DeepSeek V4 ProSWE Verified 80.6%Qwen 3.5GPQA Diamond 88.4%클로즈드: $2-15/1M tokensM3: $0.30-1.20/1M tokens자체 호스팅: $0.10-0.20/1Mtokens

M3의 입력 토큰 가격은 $0.30/1M, 출력 토큰 가격은 $1.20/1M이며 프로모션 50% 할인이 포함된 금액이다. GPT-5.5와 Gemini 3.1 Pro 비용의 5~10% 수준이다. MSA가 처리해야 할 연산량 자체를 줄이기 때문에 프론티어급 성능을 주장하면서도 이 가격대를 제시할 수 있다.

오픈웨이트 모델 사이에서도 달라진 경쟁선

M3만으로 오픈웨이트와 클로즈드소스 모델의 격차를 단정할 수는 없다. 다만 2026년 중반의 여러 모델을 함께 놓으면 격차가 빠르게 줄어든 흐름은 분명하다.

DeepSeek V4 Pro는 SWE-bench Verified에서 80.6%를 기록해 Claude Opus 4.6과 0.2포인트 차이를 보였다. Qwen 3.5(235B-A22B)는 GPQA Diamond에서 88.4%를 기록하며 대부분의 클로즈드 모델을 앞섰다. Kimi K2.5/K2.6은 중립적인 Artificial Analysis Index에서 54점으로 전체 4위이자 오픈웨이트 1위를 차지했다.

격차가 사라지지 않은 영역도 있다. 법률이나 금융 계약 해석처럼 복잡한 도메인 특화 추론에서는 클로즈드 프론티어가 여전히 10~25% 우위를 유지한다.

대규모 오픈웨이트 모델의 아키텍처는 MoE 중심으로 이동했다. 2026년 플래그십 오픈웨이트 모델 대부분이 희소 MoE를 채택했고, Multi-Head Latent Attention과 FP8 훈련을 결합한 방식은 약 590만 달러의 훈련 비용으로 프론티어 품질을 달성할 수 있음을 보여줬다. 더 많은 컴퓨팅이 언제나 우위를 만든다는 스케일링 가설에 제기된 실질적인 도전이다.

시장 구도도 엇갈린다. 3년 동안 Llama 오픈소스 릴리스를 이어온 메타는 2026년 4월 첫 클로즈드웨이트 모델인 Meta Muse Spark를 내놓았다. LLM 코드명 Avocado와 멀티모달 코드명 Mango도 독점 개발 중인 것으로 알려졌다. 메타가 클로즈드 전략으로 방향을 바꾸는 동안 MiniMax 같은 도전자는 오픈웨이트로 프론티어 성능을 주장하는 상황이다.

엔터프라이즈에서는 모델보다 라우팅을 설계한다

2026년 중반의 현실적인 엔터프라이즈 LLM 전략은 모든 워크로드를 하나의 모델에 맡기는 방식과 거리가 있다. 태스크의 복잡도, 처리량, 프라이버시 요구에 따라 모델을 나누는 하이브리드 라우팅이 중심에 놓인다.

계약 검토, 복잡한 법적 분석, 고위험 의사결정 지원처럼 고복잡도·저볼륨인 태스크는 Claude Opus나 GPT-5.5 같은 클로즈드 프론티어로 보낸다. 반복 호출이 많거나 프라이버시에 민감한 워크로드는 프라이빗 게이트웨이 뒤에서 파인튜닝한 오픈웨이트 모델이 맡는다.

비용 차이는 이런 구조를 선택하게 만드는 직접적인 요인이다. 클로즈드 API의 토큰 비용은 $215/1M 범위지만, 자체 호스팅 오픈웨이트 모델은 $0.100.20/1M 수준이다. 성능 격차가 좁아지는 속도보다 비용 효율에 대한 압박이 크기 때문에 오픈웨이트 모델의 엔터프라이즈 채택은 계속 확대될 전망이다.

M3는 하이브리드 구성에서 오픈웨이트 모델이 담당할 수 있는 작업 범위를 넓힌다. SWE-Bench Pro 59.0%는 단순 코드 완성을 넘어 실제 소프트웨어 엔지니어링 파이프라인에 투입할 근거가 된다. 1M 컨텍스트 창은 대규모 코드베이스 분석, 장기 대화 유지, 문서 전체를 컨텍스트로 사용하는 작업에 실용적인 선택지를 제공한다.

MSA는 오픈웨이트 모델이 코딩과 에이전틱 작업에서 클로즈드 프론티어와 경쟁하면서도 1/10 이하의 비용을 유지할 수 있다는 사례를 만들었다. 희소 어텐션의 연산 효율과 1M 컨텍스트의 실용성을 함께 보여준 M3는 오픈웨이트를 저렴한 대체재가 아니라 엔터프라이즈 모델 포트폴리오의 전략적 선택으로 다루게 한다.

Sources

MiniMax M3오픈웨이트 LLM희소 어텐션AI 에이전트멀티모달