Microsoft MAI 모델과 Azure 멀티 프로바이더 AI 아키텍처
Microsoft MAI 모델의 음성·이미지 역량, Azure Foundry 기반 멀티 프로바이더 구성과 엔터프라이즈 거버넌스 설계 원칙을 정리한다.
2026-08-15 · 최초 발행 2026-04-22
자체 모델 개발과 Azure 플랫폼 전략이 만나는 지점
2026년 4월 2일 Microsoft는 MAI-Transcribe-1, MAI-Voice-1, MAI-Image-2를 Microsoft Foundry로 공식 출시했다. 제품군 확장에 그치지 않고, OpenAI 의존도를 낮추면서 Azure 위에 자체 AI 역량을 쌓으려는 움직임으로 볼 수 있다. 엔터프라이즈 고객이 여러 모델 공급자를 함께 쓰려는 흐름도 이 전략의 배경이다.
Microsoft-OpenAI 파트너십이 2025년에 재협상되면서, Microsoft가 독자적인 범용 모델을 개발할 수 없다는 조항은 삭제됐다. Mustafa Suleyman이 이끄는 Microsoft AI Superintelligence 팀은 2027년까지 “진정한 AI 자립(true self-sufficiency)”을 목표로 내세웠다. 이번 MAI 모델은 첫 공개 산출물이며, 장기적으로는 OpenAI GPT-4o와 경쟁할 프론티어급 범용 LLM 개발을 목표로 한다.
기업의 모델 운용 방식도 달라지고 있다. 2026년 현재 5개 이상의 AI 모델을 동시에 배포하는 기업 비율은 2024년 29%에서 37%로 증가했다. Anthropic의 기업 시장점유율은 12%에서 32%로 늘었고, OpenAI는 50%에서 25~34%로 하락했다. Microsoft는 자체 모델을 추가해 Azure 생태계의 선택지를 넓히려 한다.
음성 인식 워크로드를 겨냥한 MAI-Transcribe-1
MAI-Transcribe-1은 Microsoft AI Superintelligence 팀이 개발한 음성-텍스트 변환(STT) 파운데이션 모델이다. FLEURS(Few-shot Learning Evaluation of Universal Representations of Speech) 벤치마크에서 Microsoft 제품 사용 기준 상위 25개 언어의 평균 단어 오류율(WER) 3.8%를 기록해 전 세계 1위를 차지했다. OpenAI Whisper-large-v3보다 25개 언어 전 구간에서 앞선다.
배치 전사 처리에서는 기존 Azure Fast 음성 인식보다 2.5배 빠르다. 대용량 미디어 파일과 콜센터 녹취처럼 처리량이 큰 환경에서 TCO에 직접 영향을 주는 특성이다.
25개 언어에서 엔터프라이즈급 정확도를 보장하며, GPU 비용은 경쟁 대비 약 50% 낮다. 시간당 가격은 $0.36 USD이고 Azure Speech LLM Speech API를 통해 바로 사용할 수 있다. 동영상 자막, 회의록, 접근성 도구, 콜 분석, 콘텐츠 제작 워크플로, 음성 에이전트가 주요 적용 대상이다.
짧은 응답 시간과 화자 일관성을 내세운 MAI-Voice-1
MAI-Voice-1은 텍스트-음성 변환(TTS) 파운데이션 모델이다. 단일 GPU에서 1초 이내에 60초 분량의 자연스러운 음성을 생성한다. 실시간 대화형 AI 에이전트와 동적 오디오 콘텐츠 파이프라인에서 발생하는 레이턴시 병목을 줄이는 데 초점이 맞춰져 있다.
사전 정의 음성 라이브러리에는 700개 이상의 프리셋 보이스가 포함된다. Azure Speech의 Personal Voice 기능은 10초 샘플 오디오를 바탕으로 특정 화자의 목소리를 재현하는 커스텀 보이스 생성을 지원한다. 장편 오디오북이나 팟캐스트처럼 수십 분에 이르는 콘텐츠에서도 화자 정체성(speaker identity)을 유지하며, 감정적 뉘앙스와 표현력도 다룬다.
문자 100만 자당 가격은 $22 USD다. Microsoft Copilot, Bing, Azure Speech에 통합되어 있으며, 보이스 에이전트 개발 플랫폼의 핵심 컴포넌트로 사용된다.
텍스트가 포함된 이미지 생성에 초점을 둔 MAI-Image-2
MAI-Image-2는 텍스트-이미지 생성 파운데이션 모델이다. Arena.ai 리더보드에서 상위 3위 모델 패밀리로 데뷔했다.
Foundry와 Copilot의 실제 프로덕션 트래픽 기준으로 이전 세대보다 최소 2배 빠르게 이미지를 생성한다. 인포그래픽과 다이어그램 안의 텍스트 삽입 정확도는 115포인트 향상됐다. 마케팅 자료, 비즈니스 프레젠테이션, 데이터 시각화처럼 글자가 포함된 결과물이 필요한 작업에서 차이가 드러나는 부분이다.
영화적 비주얼, 복잡한 장면 배치, 세밀한 디테일 표현에서도 이전 버전을 넘어선다. WPP는 최초 엔터프라이즈 파트너로 MAI-Image-2를 대규모 도입했고, 이 모델은 PowerPoint 디자이너와 Copilot 창작 도구에도 통합됐다. 가격은 텍스트 입력 100만 토큰당 $5 USD, 이미지 출력 100만 토큰당 $33 USD다.
모달리티별 전문 모델을 Azure 워크로드에 연결하는 방식
MAI 제품군은 범용 LLM 하나에 모든 기능을 담기보다, 음성 인식(STT), 음성 합성(TTS), 이미지 생성을 독립 모델로 나누는 도메인 특화 파운데이션 모델 접근을 택했다. 범용 멀티모달 단일 모델이 태스크별 최적화를 희생할 수 있는 반면, 전문 모델은 해당 벤치마크와 워크로드에 맞춰 설계할 수 있다. MAI-Transcribe-1의 FLEURS 1위는 이 선택과 연결된다.
성능 지표도 학술 벤치마크보다 엔터프라이즈 TCO를 향한다. GPU 비용 50% 절감과 배치 처리 2.5배 향상은 콜센터, 미디어 자막, 회의 시스템처럼 고빈도 처리 작업을 고려한 결과다.
Microsoft Foundry 카탈로그, Azure Speech API, Azure AI Services와의 네이티브 통합을 전제로 해 기존 Azure 워크로드에 별도 인프라 없이 적용할 수 있다. 배포 방식은 서버리스(Serverless)와 프로비저닝(Provisioned)을 모두 지원한다. Microsoft Foundry의 Foundation Model Fine-tuning 기능을 사용하면 도메인 데이터로 추가 사전훈련(Continued Pre-training)과 파인튜닝도 가능하다. 의료, 법률, 금융 분야의 언어·음성 패턴을 반영한 커스텀 모델을 만드는 경로다.
Azure 안에서 모델을 조합하는 멀티 프로바이더 구조
MAI 모델 출시와 함께 Microsoft는 Azure를 단일 AI 공급사의 플랫폼이 아니라 멀티 프로바이더 AI 오케스트레이션 플랫폼으로 구성하고 있다.
Microsoft Foundry 카탈로그에는 1,900개 이상의 모델이 있다. MAI 자체 모델, OpenAI GPT 시리즈, Anthropic Claude(Microsoft 365 Copilot 통합), Meta Llama, Mistral, Phi 소형 언어모델이 포함된다. Microsoft는 2025년 9월 Anthropic Claude Sonnet 4를 Microsoft 365 Copilot에 통합하며 이 다변화 방향을 드러냈다.
이 구조의 중심에는 모델 라우팅이 있다. Excel 계산에는 Claude가, PowerPoint 생성에는 GPT 또는 MAI-Image-2가 더 나은 성능을 보이는 경우 해당 모델로 자동 라우팅하는 방식이다.
OpenAI가 AWS와 $380억 규모의 멀티클라우드 협약을 체결했어도, 상태 비저장(stateless) OpenAI API 제공의 독점 클라우드 지위는 Azure가 유지한다. OpenAI와 제3자가 공동 개발하는 API 제품도 Azure에 독점 공급된다. Azure는 계속해서 OpenAI 생태계의 공식 배포 채널 역할을 맡는다.
멀티클라우드 AI 인프라를 구성한 기업은 단일 공급사와 비교해 30~40% 유리한 계약 조건을 협상할 수 있다는 시장 데이터가 있다. Microsoft는 고객이 Azure 안에서 여러 모델을 조합하게 하되 클라우드 이탈 없이 유지하도록 플랫폼을 설계하고 있다.
모델 선택을 통제하는 Azure 거버넌스
모델 공급자가 늘어날수록 거버넌스의 복잡성도 커진다. Microsoft Foundry는 MAI와 외부 파트너 모델 모두에 통합된 배포, 모니터링, 비용 관리, 접근 제어 인터페이스를 제공한다. 모델 출처와 무관하게 Azure RBAC, Azure Policy, Azure Monitor 스택을 적용하는 단일 제어 평면(Control Plane)이다.
서버리스 배포는 글로벌(Global), 데이터존(Data Zone), 리전(Regional) 처리 범위를 제공한다. 데이터 레지던시 요구사항에 맞춰 처리 위치를 선택하거나 제한할 수 있으며, GDPR과 각국의 데이터 주권 규정 대응에 사용할 수 있다.
MAI 모델은 Microsoft 책임 AI(Responsible AI) 원칙 아래 모델 카드(Model Card)와 함께 출시됐다. MAI-Transcribe-1 모델 카드는 2026년 4월 2일 공개됐고, 학습 데이터, 성능 제한, 잠재적 편향을 명시한다.
비용 관리에서는 표준(Standard), 프로비저닝(Provisioned), 배치(Batch) 배포 유형을 워크로드 패턴에 맞게 선택한다. 배치 중심 워크로드에는 MAI-Transcribe-1 배치 API를 활용하고, 실시간 반응이 필요한 서비스에는 프로비저닝 엔드포인트를 사용하는 식이다.
Microsoft는 2026 회계연도 말까지 Azure AI 서비스, Copilot 구독, MAI 모델 API를 포함한 AI 관련 수익 $250억 달성을 목표로 하고 있다. MAI 모델군과 멀티 프로바이더 구성은 이 목표를 뒷받침하는 제품·플랫폼 전략이다.
Sources
- https://techcommunity.microsoft.com/blog/azure-ai-foundry-blog/introducing-mai-transcribe-1-mai-voice-1-and-mai-image-2-in-microsoft-foundry/4507787
- https://microsoft.ai/news/today-were-announcing-3-new-world-class-mai-models-available-in-foundry/
- https://microsoft.ai/news/state-of-the-art-speech-recognition-with-mai-transcribe-1/
- https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe
- https://techcrunch.com/2026/04/02/microsoft-takes-on-ai-rivals-with-three-new-foundational-models/
- https://venturebeat.com/technology/microsoft-launches-3-new-ai-models-in-direct-shot-at-openai-and-google
- https://www.theregister.com/2026/04/02/microsoft_models_homegrown_ai_models/
- https://tech-insider.org/microsoft-mai-in-house-ai-models-openai-2026/
- https://windowsnews.ai/article/microsoft-unveils-mai-foundation-models-speech-voice-and-image-ai-for-enterprise-independence.410139
- https://microsoft.ai/pdf/MAI-Transcribe-1-Model-Card.pdf