MiMo-V2.5-Pro-UltraSpeed가 바꾼 오픈웨이트 추론 경쟁
MiMo-V2.5-Pro-UltraSpeed의 MoE, MXFP4, DFlash, TileRT 구조와 에이전틱 성능, API 가격, 오픈웨이트 전략을 분석한다.
2026-08-14 · 최초 발행 2026-06-10
플래그십 모델 위에 고속 서빙을 얹다
Xiaomi와 추론 전문 스타트업 TileRT가 공개한 MiMo-V2.5-Pro-UltraSpeed는 1조 파라미터 규모에서 초당 1,000토큰을 돌파한 최초의 오픈웨이트 LLM이다. 모델 자체를 별도로 경량화한 것이 아니라, 기존 플래그십 MiMo-V2.5-Pro 위에 UltraSpeed 서빙 모드를 결합했다.
공개 시점은 2026년 6월 8~9일 베이징 기준이다. 공식 발표에 따르면 표준 MiMo-V2.5-Pro보다 약 10배, ChatGPT나 Claude의 일반적인 생성 속도보다 약 15배 빠르다. Apache-2.0 라이선스를 적용해 상업적으로 활용할 수 있으며, Artificial Analysis Intelligence Index v4.0에서는 54점으로 오픈웨이트 공동 1위를 기록했다. 에이전틱 태스크 점수는 DeepSeek V4 Pro보다 6.7점 높다.
오픈웨이트 공개는 Xiaomi의 하드웨어 전략과도 맞닿아 있다. 스마트폰과 IoT 기기를 대규모로 보유한 만큼 온디바이스 AI를 통합하려면 외부 API 의존도를 낮추고 자체 모델 역량을 확보해야 한다. 커뮤니티 채택에는 Apache-2.0 라이선스를 활용하고, API 가격은 서방 프론티어 모델의 약 5분의 1 수준으로 책정했다. 스마트폰 시장에서 구사해 온 고사양·저가 전략을 LLM 시장으로 옮긴 셈이다.
MoE 모델을 초고속으로 서빙하는 기술
MiMo-V2.5-Pro는 Mixture-of-Experts(MoE) 아키텍처를 사용한다. 전체 파라미터는 1.02조 개지만 한 번의 포워드 패스에서 활성화되는 파라미터는 420억 개다. 최대 100만 토큰 컨텍스트 윈도우는 7:1 하이브리드 비율로 관리한다.
UltraSpeed의 처리량은 MXFP4 양자화, DFlash 추측 디코딩, TileRT 런타임을 함께 적용한 결과다.
MXFP4 양자화는 MoE 전문가 가중치만 FP4로 낮추고 나머지 모듈의 정밀도는 유지한다. QAT(Quantization-Aware Training)를 적용해 품질 손실을 최소화했으며, 체크포인트는 Hugging Face의 XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash에 오픈소스로 공개했다.
DFlash는 블록 확산 드래프터를 사용하는 추측 디코딩 방식이다. 마스킹된 토큰 블록 전체를 단일 포워드 패스로 채워 기존 방식의 직렬 드래프트-자동회귀 병목을 제거한다. 코딩 태스크에서 측정한 평균 수락 길이(acceptance length)는 6.30이다.
TileRT 런타임은 퍼시스턴트 코어 GPU 실행과 이종 파이프라인을 결합한다. 연산자 전환 지연을 없애고 디코드 전 구간에서 GPU 활용률을 극대화하는 역할을 맡는다.
이 구성은 8-GPU 상용 클라우드 노드에서 초당 1,000토큰, 피크 1,200 tokens/sec를 달성했다. 1조 파라미터 모델을 서빙하면서 표준 MoE보다 10배 빠른 처리량을 낸다는 점이 UltraSpeed의 핵심이다.
벤치마크가 보여주는 모델의 성향
Artificial Analysis Intelligence Index v4.0은 GDPval-AA, τ²-Bench Telecom, Terminal-Bench Hard, SciCode, AA-LCR, AA-Omniscience, IFBench, Humanity's Last Exam, GPQA Diamond, CritPt 등 10개 평가 항목을 종합한다.
| 모델 | Intelligence Index | 에이전틱 태스크 | 코딩 | 종합(잠정) |
|---|---|---|---|---|
| MiMo-V2.5-Pro | 54 | 65.8 | 56.1 | 72 |
| Kimi K2.6 | 54 | - | - | - |
| DeepSeek V4 Pro | 52 | 59.1 | 58.8 | 69 |
MiMo-V2.5-Pro는 Intelligence Index에서 Kimi K2.6과 함께 54점을 기록해 오픈웨이트 공동 1위에 올랐다. 에이전틱 태스크에서는 65.8점으로 DeepSeek V4 Pro의 59.1점보다 6.7점 높았고, 특히 Terminal-Bench 2.0에서 격차가 크게 벌어졌다.
코딩 결과만 보면 양상이 달라진다. DeepSeek V4 Pro는 58.8점으로 MiMo-V2.5-Pro의 56.1점보다 2.7점 앞선다. MiMo-V2.5-Pro의 강점이 일반 코딩 전반보다는 장기 추론과 도구 사용이 결합된 에이전틱 작업에 놓여 있음을 시사하는 결과다.
Claude Fable 5와 직접 비교한 공식 에이전틱 수치는 없다. Artificial Analysis의 Intelligence Index에서는 Claude Fable 5가 78점, MiMo-V2.5-Pro가 54점으로 여전히 20점 이상의 차이가 난다. 다만 속도와 비용, 온프레미스 배포 자유도까지 포함하면 폐쇄형 모델과는 다른 선택지를 제공한다.
API 가격과 접근 경로
표준 MiMo-V2.5-Pro API 요금은 256K 이하 컨텍스트에서 백만 토큰당 입력 $1, 출력 $3이다. 256K~1M 구간에는 입력 $2, 출력 $6이 적용된다.
UltraSpeed API는 표준 요금의 3배다. 대신 약 10배 빠른 속도를 제공하기 때문에 실시간 응답이 필요한 워크로드에서는 단가 효율이 개선된다. 서방 프론티어 모델보다 5배 저렴하게 설계된 가격 정책도 Xiaomi의 고사양·저가 전략과 같은 흐름에 있다.
트라이얼은 2026년 6월 9~23일 베이징 시간 기준으로 운영된다. OpenRouter에서는 xiaomi/mimo-v2.5-pro를 통해 접근할 수 있다.
채팅보다 에이전트에 맞춘 선택
MiMo가 일반 코딩보다 에이전틱 태스크를 앞세운 데에는 워크로드 특성이 작용한다. 장기 추론과 다중 도구 연쇄 호출, 멀티모달 워크플로우는 컨텍스트와 처리 시간이 길다. 단순 채팅보다 초당 토큰 속도가 비용과 응답 경험에 직접 영향을 주는 영역이다.
Apache-2.0 라이선스는 기업이 자체 에이전트 파이프라인에 모델을 통합할 때 법적 제약을 제거한다. Xiaomi의 스마트폰·IoT 생태계에 온디바이스 에이전트를 배포하는 경우에도 초고속 추론은 사용자 경험을 좌우하는 지표가 된다.
실무에서 모델을 검토할 때는 전체 파라미터 1.02T와 활성 파라미터 42B를 구분해서 봐야 한다. MoE의 비용 구조는 전체 규모만으로 설명되지 않는다. 7:1 하이브리드 컨텍스트 관리, QAT를 적용한 FP4 양자화, 추측 디코딩의 수락 길이도 실제 서빙 성능을 결정하는 설계 변수다.
인프라 측면에서는 TileRT의 퍼시스턴트 코어 GPU 실행과 이종 파이프라인이 GPU 스케줄링, 메모리 계층, 대역폭 최적화와 연결된다. 8-GPU 상용 노드에서 1조 파라미터 모델을 서빙할 수 있게 된 배경을 이해하려면 모델 구조와 런타임을 함께 봐야 한다.
오픈웨이트 경쟁에 추가된 기준
기존 오픈웨이트 LLM 경쟁은 모델 품질과 비용 효율을 중심으로 전개됐다. UltraSpeed는 여기에 속도를 독립적인 경쟁 기준으로 끌어올렸다. 8-GPU 상용 노드에서 1조 파라미터 모델이 초당 1,000토큰을 넘기면서 실시간 에이전트 응답이라는 운용 가능성을 제시했다.
평가 기준도 달라지고 있다. MMLU나 HumanEval 같은 정적 벤치마크만으로 모델을 비교하던 구도에서 Terminal-Bench와 τ²-Bench처럼 에이전트의 도구 사용과 작업 수행 능력을 측정하는 지표가 부상했다. MiMo-V2.5-Pro는 이 영역에서 DeepSeek V4 Pro를 앞서며 에이전틱 오픈웨이트 모델의 새로운 기준점을 세웠다.
Apache-2.0 라이선스 아래에서 상업적 활용을 허용하면서 API 수익 모델을 병행하는 방식도 주목할 부분이다. 속도와 에이전틱 성능, 배포 자유도가 결합되면서 MiMo-V2.5-Pro-UltraSpeed는 학술적 성과를 넘어 Xiaomi의 스마트폰·IoT 기반 온디바이스 AI 전략을 위한 중장기 포석으로 자리 잡는다.
Sources
- https://platform.xiaomimimo.com/docs/en-US/model-intro/mimo-v2.5-pro-ultraspeed
- https://mimo.xiaomi.com/blog/mimo-tilert-1000tps
- https://www.marktechpost.com/2026/06/08/xiaomi-mimo-and-tilert-push-a-1-trillion-parameter-model-past-1000-tokens-per-second-on-commodity-gpus/
- https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash
- https://artificialanalysis.ai/models/comparisons/deepseek-v4-pro-vs-mimo-v2-5-pro
- https://openrouter.ai/xiaomi/mimo-v2.5-pro
- https://www.gizmochina.com/2026/06/09/xiaomi-mimo-v2-5-pro-ultraspeed-mode-1000-tokens-per-second/
- https://decrypt.co/370449/xiaomi-mimo-ultraspeed-ai-model-faster-chatgpt-claude