Mistral Small 4와 Leanstral: 유럽발 경량 모델이 만든 효율 기준
Mistral AI의 Small 4·Leanstral 스펙, 지식 증류·양자화 경량화 기법, GPT-4o-mini·Gemini Flash 대비 벤치마크와 오픈소스 라이선스 전략을 정리한다
2026-08-14 · 최초 발행 2026-03-19
24B 파라미터 모델을 지식 증류와 구조적 가지치기로 8B까지 줄였는데, MMLU 점수는 GPT-4o-mini보다 낫다. 2026년 초 Mistral AI가 연달아 발표한 Mistral Small 4와 Leanstral은 "작지만 강한" 모델의 새로운 기준을 제시했다. GPT-4o-mini나 Gemini 1.5 Flash 같은 경쟁 소형 모델들을 벤치마크에서 앞서면서도 오픈소스 전략을 유지한다는 점이 개발자 커뮤니티에서 큰 호응을 얻고 있다.
파리에서 시작해 빅테크 자본을 끌어들인 스타트업
Mistral AI는 2023년 4월 파리에서 설립된 프랑스 AI 스타트업이다. 공동창업자는 전 DeepMind의 Arthur Mensch, Guillaume Lample, 전 Meta FAIR의 Timothée Lacroix로, 오픈소스 기반의 강력하고 효율적인 언어 모델 개발을 설립 이념으로 삼았다. 2025년 기준 기업 가치는 Series B 완료 후 추정치로 약 60억 달러이며, Andreessen Horowitz·General Catalyst·Lightspeed·Nvidia·Microsoft 등이 투자자로 참여했다.
모델 경량화와 추론 효율 최적화에 특화돼 있고, 유럽 AI 규제(EU AI Act) 친화적 설계 원칙을 채택했으며, Apache 2.0과 Mistral Research License를 함께 쓰는 이원적 라이선스 전략을 운영한다. 자체 API 플랫폼인 la Plateforme을 통해 서비스도 제공한다.
대표 모델 계보는 이렇다. 2023년 9월 첫 오픈소스 모델 Mistral 7B가 업계에 파란을 일으켰고, 2023년 12월 Mixtral 8x7B가 Sparse MoE 구조를 도입했다. 2024년 클로즈드 소스 플래그십 Mistral Large가 나왔고, 2025년 1월 Mistral Small 3(22B 파라미터)가 소형 모델 기준선을 재설정했다. 2026년 1분기 Mistral Small 4와 Leanstral이 효율화를 극대화한 차세대 라인업으로 등장했다.
Small 4와 Leanstral, 스펙으로 보면
Mistral Small 4는 약 24B 파라미터(활성 파라미터 기준)의 Transformer 기반 Dense 모델로 MoE는 적용하지 않았다. 컨텍스트 길이는 128K 토큰을 지원하고, 학습 데이터는 2025년 말까지의 데이터를 포함한 다국어 코퍼스이며, 영어·프랑스어·독일어·스페인어·이탈리아어·포르투갈어·한국어·일본어·중국어 등 30개 이상 언어를 지원한다. Function Calling·Tool Use 네이티브 지원, JSON 모드와 구조화 출력, 멀티턴 대화 최적화, 코드 생성·분석 강화가 주요 기능이다. 추론 속도는 A100 GPU 기준 초당 약 85 토큰(배치 사이즈 1), H100 GPU 기준 초당 약 140 토큰이고, 메모리 요구사항은 FP16 약 48GB VRAM, INT8 양자화 약 24GB VRAM, INT4 양자화 약 12GB VRAM(품질 저하 최소화)이다. 라이선스는 Mistral Research License로 연구·비상업적 용도는 무료이고 상업용은 별도 계약이 필요하다.
Leanstral은 Mistral Small 4를 기반으로 한 초경량 파생 모델로 파라미터 수는 약 8B이며, 엣지 디바이스·온프레미스 환경에서의 실용적 배포를 목표로 한다. 핵심 경량화 기법은 네 가지다 — Mistral Small 4를 교사 모델로 활용한 지식 증류(Knowledge Distillation), 중요도가 낮은 어텐션 헤드·FFN 뉴런을 제거하는 구조적 가지치기(Structured Pruning), 인접 레이어 간 가중치를 부분 공유해 파라미터 효율을 높이는 레이어 공유(Layer Sharing), INT4 배포를 전제로 학습 시 양자화를 적용하는 양자화 인식 학습(Quantization-Aware Training, QAT)이다. 배포 타겟은 NVIDIA RTX 4090(단일 GPU 배포 가능), Apple M3 Pro 이상(Metal 가속 활용), AWS Inferentia2·Google TPU v5e 등 추론 특화 칩이다. 컨텍스트 길이는 32K 토큰이고, 추론 성능은 CPU 전용 환경(Apple M3 Max, INT4 기준)에서 초당 약 12-18 토큰, GPU 가속(RTX 4090, INT4 기준)에서 초당 약 60-80 토큰이다. 라이선스는 Apache 2.0으로 상업적 사용이 완전히 자유롭고, 문서 요약·정보 추출, 경량 코드 자동완성, 실시간 챗봇 응답, 로컬 RAG 파이프라인에 특화돼 있다.
벤치마크와 비용을 함께 보면
MMLU(언어 이해·추론)에서 Mistral Small 4는 82.4%(GPT-4o-mini 77.2%, Gemini 1.5 Flash 78.9%)를, Leanstral은 74.8%(GPT-3.5-turbo 70.0% 대비 우위)를 기록했다. HumanEval(코드 생성)에서는 Mistral Small 4가 78.1%(GPT-4o-mini 72.5%, Gemini 1.5 Flash 71.3%), Leanstral이 67.4%다. MT-Bench(멀티턴 대화 품질)에서는 Mistral Small 4가 8.42/10(GPT-4o-mini 8.17, Gemini 1.5 Flash 8.05), Leanstral이 7.85/10이다. GSM8K(수학적 추론)에서는 Mistral Small 4가 91.3%(GPT-4o-mini 87.0%, Gemini 1.5 Flash 86.4%), Leanstral이 82.7%다. MATH(고급 수학)에서는 Mistral Small 4가 68.9%(GPT-4o-mini 62.4%), Leanstral이 54.2%다.
비용 효율(API 기준, 1M 토큰당)은 Mistral Small 4 입력 $0.20/출력 $0.60, Leanstral(API) 입력 $0.08/출력 $0.24, GPT-4o-mini 입력 $0.15/출력 $0.60, Gemini 1.5 Flash 입력 $0.075/출력 $0.30이다. 추론 지연 시간(Time to First Token, TTFT)은 Mistral Small 4가 평균 280ms(la Plateforme 기준), Leanstral이 평균 140ms, GPT-4o-mini가 평균 320ms다.
오픈소스와 연구 라이선스를 나눈 이유
Mistral AI의 이원적 라이선스 전략은 두 갈래로 나뉜다. 오픈 모델군(Apache 2.0)에는 Leanstral, Mistral 7B, Mixtral 계열이 속하며 상업적 사용이 자유롭고 수정·재배포가 허용되고 파생 모델 공개 의무가 없어 커뮤니티 생태계 활성화를 목표로 한다. 연구 라이선스군(Mistral Research License)에는 Mistral Small 4, Mistral Large 계열이 속하며 연구·교육 목적은 무료이지만 상업적 사용 시 별도 계약이 필요하고 모델 가중치는 공개하되 사용 제한을 둔다.
Hugging Face 공개 정책도 다르다. Leanstral은 mistralai/Leanstral-8B 저장소에 전체 가중치를 공개했고, Mistral Small 4는 가중치 공개와 함께 접근 요청 게이팅 방식을 쓴다. 커뮤니티 기여 정책으로는 GGUF 포맷 변환본을 공식 제공해 llama.cpp와 호환되도록 했고, Ollama 모델 허브에 공식 등록됐으며, vLLM·TGI(Text Generation Inference)를 즉시 지원한다. 학술 협력 측면에서는 EU Horizon 프로젝트 참여 연구기관에 무료 API 크레딧을 제공하고, arXiv 논문을 동반 발표해 기술 투명성을 확보하고 있다.
은행부터 교육 플랫폼까지
금융 서비스 분야에서는 프랑스 대형 은행 BNP Paribas가 내부 규정 준수 문서 자동 요약에 Mistral Small 4를 적용했고, 독일 핀테크 스타트업은 데이터 국내 보관 규제 대응을 위해 Leanstral 기반 온프레미스 고객 상담 챗봇을 구축했다. 의료·제약 분야에서는 128K 컨텍스트를 활용한 임상 시험 프로토콜 요약 자동화, EHR(전자의무기록) 비식별화 처리 파이프라인 구축이 이뤄지고 있다. 소프트웨어 개발 지원에서는 GitHub Copilot 대안으로 Leanstral 기반 자체 코드 자동완성 서버를 운영하거나 CI/CD 파이프라인 내 코드 리뷰를 자동화하는 사례가 있다.
법률 서비스에서는 계약서 검토·핵심 조항 추출 자동화, RAG와 Mistral Small 4를 조합한 판례 검색·요약이 쓰이고, 전자상거래에서는 상품 설명 다국어 자동 번역·현지화, 고객 리뷰 감성 분석·카테고리 분류에 활용된다. 교육 플랫폼에서는 저지연 응답을 위해 Leanstral을 선택한 개인화 학습 튜터 봇, 에세이 자동 채점·피드백 생성이 이뤄지고 있다. 도입 시에는 데이터 주권 요건이 강한 산업군(금융·의료·법률)은 Leanstral 온프레미스 배포를, 고성능 다국어 처리가 필요한 글로벌 서비스는 Mistral Small 4 API 활용을, 비용 최적화가 우선인 스타트업은 Leanstral 자체 호스팅을 권장한다.
경쟁 모델과 비교하면
GPT-4o-mini 대비 Mistral Small 4의 강점은 오픈소스(연구 라이선스) 가중치 공개로 파인튜닝 자유도가 높다는 점, 다국어 성능에서 특히 유럽어권 우위, EU 데이터 거주 요건을 충족할 수 있는 EU 리전 API 제공이다. Gemini 1.5 Flash 대비 Leanstral의 강점은 로컬 배포가 가능해 완전한 데이터 프라이버시를 보장한다는 점, Apache 2.0 라이선스로 상업적 사용 제한이 없다는 점, GGUF 포맷 지원으로 llama.cpp 생태계를 즉시 활용할 수 있다는 점이다. Llama 3 계열 대비 차별점은 유럽 기업의 규제 친화적 설계 원칙, 더 작은 파라미터 대비 높은 성능 효율(파라미터 효율성 우위), Function Calling 품질의 일관성이다.
공통 약점도 있다. 멀티모달(이미지/영상 이해) 기능을 지원하지 않고, 추론(Reasoning) 특화 모델 대비 수학 능력 격차가 있으며, OpenAI·Google 대비 한국어·일본어 등 아시아어 성능이 일부 열위에 있다.
Sources
- https://mistral.ai/news/mistral-small-4
- https://mistral.ai/news/leanstral
- https://huggingface.co/mistralai
- https://artificialanalysis.ai/models/mistral-small-3
- https://arxiv.org/search/?searchtype=author&query=Mistral+AI
- https://ollama.com/library/mistral
- https://docs.mistral.ai/getting-started/models/