Voxtral — 전사를 넘어 음성을 이해하는 모델

Mistral AI의 음성 이해 모델 Voxtral의 전사·질의응답·함수 호출 기능과 아키텍처, Whisper 대비 비교, vLLM 로컬 배포와 Mistral API 활용 시나리오를 정리한다.

2026-08-14 · 최초 발행 2026-03-29

음성 AI 분야에서 오픈소스 생태계의 판도가 바뀌고 있다. Mistral AI가 공개한 Voxtral은 단순한 음성-텍스트 변환(STT)을 넘어 음성 이해(Speech Understanding)까지 가능한 멀티모달 언어 모델로, Apache 2.0 라이선스로 완전 공개돼 상업적 활용이 자유롭다. 기존 Whisper large-v3보다 낮은 오류율을 기록하면서도 최대 40분 길이의 오디오를 의미 분석하고 질의응답까지 수행한다는 점에서 실무 음성 AI 파이프라인의 새로운 기준점이 되고 있다.

받아 적기에서 이해하기로

Voxtral은 Mistral AI가 2026년 3월 공개한 음성 특화 언어 모델(Speech Language Model)이다. 기존 음성 모델이 전사(transcription)에 집중했던 것과 달리, Voxtral은 음성 입력을 직접 이해하고 추론하는 엔드투엔드 방식을 채택했다. 2026년 3월 Apache 2.0 라이선스로 출시됐고 Hugging Face에서 무료로 내려받을 수 있으며, 로컬(vLLM) 또는 Mistral API(분당 $0.001)로 서빙할 수 있다. Whisper 대비 고정밀 전사에 음성 이해를 통합한 모델로 포지셔닝된다.

모델 파라미터 대상 환경 특징
Voxtral Small 24B 클라우드/서버 최고 정확도, 배치 처리 최적화
Voxtral Mini 3B 엣지/온디바이스 저지연, 경량 배포

전사부터 함수 호출까지

고정밀 음성 전사는 최대 30분 길이 오디오를 단일 처리하며, Whisper large-v3 대비 낮은 WER(Word Error Rate), 자동 구두점 삽입과 화자 구분, 배경 소음에 강한 로버스트 설계를 갖췄다.

음성 이해 및 질의응답은 최대 40분 오디오를 의미 분석해 오디오 내용 기반 질의응답(Audio QA)을 수행하고, 핵심 내용 추출·요약을 생성하며 감정·톤 분석까지 지원한다.

다국어 지원에서는 영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 힌디어 등을 지원하고 언어를 자동 감지하지만, 한국어는 현재 미지원이며 추후 업데이트가 예정돼 있다.

함수 호출(Function Calling)에서는 음성 기반 API 호출을 자동화하고 워크플로우 트리거와 연동하며, 음성 명령으로 외부 서비스를 직접 제어할 수 있다.

오디오가 토큰이 되고, 토큰이 응답이 되기까지

Voxtral은 오디오 인코더와 언어 모델 디코더를 결합한 Audio-LLM 구조를 채택했다.

전사 모드이해 모드함수 호출음성 입력(최대 40분)오디오 인코더(Whisper 기반)오디오 토큰임베딩Mistral LLM디코더출력 유형텍스트 전사(최대 30분)질의응답요약/분석API 호출워크플로우

STT→NLU 파이프라인을 단일 모델로 처리하는 통합 처리, 긴 오디오에서도 맥락을 유지하는 컨텍스트 보존, 오디오 신호를 LLM 친화적 토큰으로 바꾸는 효율적 토크나이징이 핵심 설계 원칙이다.

Whisper와 나란히 놓으면

한계 극복성능 확장Voxtral Small (24B)최고 정확도배치 최적화함수 호출Voxtral Mini (3B)STT + 이해30-40분 처리추론/QA 가능Whisper large-v3STT 전용15분 제한텍스트만 출력
항목 Whisper large-v3 Voxtral Mini Voxtral Small
모델 유형 STT 전용 음성 이해 음성 이해
파라미터 ~1.5B 3B 24B
최대 입력 길이 ~10분 30-40분 30-40분
질의응답 불가 가능 가능
함수 호출 불가 제한적 완전 지원
라이선스 MIT Apache 2.0 Apache 2.0
WER (영어) 기준값 기준값 이하 기준값 이하

회의록에서 고객 지원까지

회의 녹음을 Voxtral Small에 넣으면 전사·요약·액션아이템 추출을 단일 파이프라인으로 구현할 수 있다.

회의 녹음(최대 40분)Voxtral Small전체 전사문핵심 요약(3-5줄)액션 아이템추출참석자별발언 분리회의록 문서자동 생성

음성 기반 고객 지원에서는 고객 음성 입력→Voxtral→의도 파악→함수 호출로 CRM 조회까지 이어지며, 기존 STT+NLU 2단계 파이프라인을 단일 모델로 통합한다. 콘텐츠 접근성 향상에서는 유튜브·팟캐스트 음성을 다국어 자막으로 자동 생성하거나, 강의 녹음을 챕터별 요약·Q&A로 자동 생성하는 데 쓰인다.

어떻게 띄울 것인가

로컬 배포(vLLM)는 다음처럼 실행한다.

# Voxtral Mini 로컬 실행
pip install vllm
vllm serve mistralai/Voxtral-Mini-3B-2507 --dtype bfloat16

# Voxtral Small (GPU 메모리 48GB+ 권장)
vllm serve mistralai/Voxtral-Small-24B-2507 --tensor-parallel-size 4
모델 최소 VRAM 권장 VRAM 정밀도
Voxtral Mini 8GB 16GB bfloat16
Voxtral Small 48GB 80GB bfloat16

Mistral API는 비용이 분당 $0.001이고, 인프라가 필요 없어 즉시 프로토타이핑할 수 있지만 데이터가 외부로 전송돼야 하므로 보안 민감 데이터에는 주의가 필요하다. 엣지 배포(Voxtral Mini)는 모바일·IoT 디바이스에서 직접 실행할 수 있고, Quantization(INT4/INT8)으로 메모리 요구량을 추가로 절감하며 오프라인 음성 처리 시나리오에 적합하다.

아직 남은 벽

현재 6개 언어만 지원해 한국어 서비스에는 별도 대안이 필요하고, Small 모델은 고사양 GPU 환경이 필수다. 40분 오디오는 처리 시간도 비례해서 늘어나는 레이턴시 문제가 있고, 현재는 배치 처리 중심이라 실시간 스트리밍 지원이 제한적이다.

Voxtral은 음성 AI의 패러다임을 전사(transcription)에서 이해(understanding)로 전환하는 분기점에 해당하는 모델이다. Apache 2.0 라이선스로 완전 공개된 만큼, 자체 음성 처리 파이프라인을 구축하려는 기업과 개발자에게 매력적인 선택지가 된다. Voxtral Mini(3B)는 엣지 환경에서도 실용적으로 쓸 수 있고, Voxtral Small(24B)은 서버 환경에서 Whisper 대비 우월한 정확도와 확장된 기능을 제공한다. 다만 현재 한국어 미지원과 실시간 스트리밍 제한은 국내 서비스 적용 시 사전 검토가 필요한 요소다.

VoxtralMistral AISpeech UnderstandingvLLM함수 호출