Microsoft MAI를 Foundry에 배포하는 법: 하이브리드 전략과 거버넌스 통합

MAI-Transcribe-1·MAI-Voice-1·MAI-Image-2를 Microsoft Foundry에서 운용하는 하이브리드 라우팅 전략, Entra ID·Purview 거버넌스 통합, 가격 비교와 활용 사례를 정리한다

2026-08-14 · 최초 발행 2026-04-17

중저비용 대량 워크로드는 MAI로, 최고 성능이 필요한 추론은 OpenAI나 Claude로 — 그리고 MAI가 장애를 일으키면 자동으로 외부 모델로 넘어간다. Microsoft AI는 2026년 4월 2일 Microsoft Foundry에서 세 가지 자체 파운데이션 모델 — MAI-Transcribe-1(음성 인식), MAI-Voice-1(음성 생성), MAI-Image-2(이미지 생성) — 을 퍼블릭 프리뷰로 공개했다. 130억 달러 규모 OpenAI 파트너십에 대한 의존도를 낮추고, Azure 스택에 자체 파운데이션 모델을 내재화하려는 전략적 움직임이다.

Foundry에 모인 MAI 모델들

MAI 시리즈는 Microsoft AI가 개발한 멀티모달 자체 파운데이션 모델군으로, OpenAI 단일 공급자 체제에서 벗어나 Azure에 내장된 자체 멀티모달 스택을 구축하는 것이 목적이다. 전사·음성·이미지 영역에서 비용 효율과 성능을 동시에 확보하면서 OpenAI 의존도를 줄이며, Microsoft Foundry와 MAI Playground를 통해 즉시 이용할 수 있다.

MAI-Transcribe-1(음성 인식)은 25개 언어를 지원하고 평균 3.8% WER을 기록하며 GPU 비용을 기존 대비 약 50% 절감했고 시작 가격은 시간당 $0.36이다. MAI-Voice-1(음성 생성)은 60초 음성을 단일 GPU에서 1초 이내 생성하며 $22/1M chars이다. MAI-Image-2(이미지 생성)는 Arena.ai 3위로 데뷔했고 입력 $5/1M 토큰·출력 $33/1M 토큰이다. 공개 시점은 Microsoft Foundry 상위 제품 리프레시와 맞물려, Azure 스택 전체의 엔드투엔드 멀티모달 역량 강화로 이어진다.

세 모델을 더 뜯어보면, MAI-Transcribe-1은 FLEURS 벤치마크에서 상위 25개 언어 평균 WER 3.8%로 OpenAI Whisper-large-v3를 전 25개 언어에서, Google Gemini 3.1 Flash를 25개 중 22개 언어에서 상회했다. MAI-Voice-1은 60초 분량 고충실도 음성을 단일 GPU에서 1초 이내 생성하며 감정·뉘앙스·화자 동일성이 장문에서도 유지되고 자연스러운 프로소디를 낸다. MAI-Image-2는 Microsoft의 최고 성능 텍스트-투-이미지 모델로 Arena.ai 리더보드에서 3위로 초기 등장했고 Foundry 내 엔터프라이즈 콘텐츠 생성 파이프라인에 통합됐다.

콜센터 전사부터 배지 디자인까지 이어지는 파이프라인

Microsoft Foundry오디오텍스트 음성텍스트 이미지입력 소스모달리티 분기MAI-Transcribe-1MAI-Voice-1MAI-Image-2전사 텍스트합성 오디오생성 이미지후속 파이프라인: 요약·번역에이전트 음성 응답마케팅·디자인 자산

음성 데이터를 텍스트로 변환해 LLM 파이프라인에 투입하는 Transcribe → 요약·번역, 텍스트 응답을 자연스러운 음성으로 변환해 UX를 강화하는 Voice → 에이전트 응답, 프롬프트 기반 시각 자산을 대량 생성하는 Image → 콘텐츠 자산으로 파이프라인이 이어진다.

Entra ID와 Purview가 물려 있는 통합 구조

거버넌스Azure 애플리케이션Microsoft Foundry APIMAI 모델 라우터MAI-Transcribe-1MAI-Voice-1MAI-Image-2OpenAI / 기타 외부 모델Entra ID 인증Purview 데이터 보호Defender 보안

Foundry가 내부·외부 모델을 단일 엔드포인트로 노출하고, Entra ID·Purview·Defender와 자연스럽게 통합되며, 엔터프라이즈 규정 준수가 기본 탑재된다.

MAI 우선, 실패하면 외부 모델로

하이브리드 전략은 다섯 갈래로 짜여 있다. 중저비용 대량 워크로드는 MAI 시리즈를 우선 라우팅(Transcribe, Voice, Image 기본)하고, 최고 성능이 필요한 추론은 OpenAI 최신 모델이나 Anthropic Claude를 선택한다. 온디바이스·에지 환경에는 MAI 경량 변형이나 Phi 시리즈를 쓰고, 멀티모달 조합은 Transcribe → GPT → Voice 파이프라인으로 엔드투엔드 음성 에이전트를 구축한다. MAI 모델 장애 시에는 외부 모델로 자동 폴백한다.

Whisper·Google STT와 나란히 놓은 가격표

항목 MAI-Transcribe-1 Whisper API Google Speech-to-Text
시간당 가격 $0.36 경쟁가 경쟁가
지원 언어 25 다수 다수
WER(평균) 3.8% 4.5%+ 4%+
GPU 효율 기존 대비 50% 절감 기준 기준

Transcribe-1의 가격·성능 조합은 대량 음성 데이터 처리 파이프라인의 ROI를 크게 바꾼다.

실제로 어떻게 쓰이나

글로벌 콜센터 자동 전사·요약 사례는 25개 언어 고객 상담을 통합 품질 관리 플랫폼에서 분석하는 것이 도입 배경이었고, Transcribe-1로 다국어 전사 → LLM으로 감정·토픽 분석 → Voice-1로 응답 녹음 순으로 적용했다. 결과는 지연 시간 단축, 언어 커버리지 확대, GPU 비용 절감이었다.

엔터프라이즈 마케팅 비주얼 생성 사례는 캠페인별 수천 장의 지역 맞춤 비주얼이 필요한 것이 도입 배경이었고, Image-2로 브랜드 가이드라인 기반 배치 생성 → Foundry로 거버넌스 적용 순으로 진행했다. 결과는 외부 SaaS 의존 축소, 제작 파이프라인 내재화였다.

도입 전에 확인할 것

퍼블릭 프리뷰이므로 프로덕션 전환 전 SLA 조건을 재확인해야 하고, 25개 언어 중심이므로 그 외 언어 워크로드는 외부 모델을 병행해야 한다. Image-2 생성물의 브랜드·상표 필터링 정책을 설계해야 하고, Transcribe → LLM → Voice 체인의 엔드투엔드 지연을 관리해야 하며, MAI 시리즈의 향후 버전 전환 시 프롬프트·파인튜닝 자산 이식 계획도 필요하다.

MAI-Transcribe-1, MAI-Voice-1, MAI-Image-2의 동시 공개는 Microsoft가 애플리케이션 레이어에 그치지 않고 파운데이션 모델 레이어까지 내재화하려는 의지를 분명히 보여준다. 엔터프라이즈는 Foundry 단일 스택에서 OpenAI·Anthropic·MAI를 혼용할 수 있게 되면서, 모달리티별로 가장 합리적인 선택을 할 수 있는 시대에 진입한다.

Sources

Microsoft MAIMicrosoft Foundry하이브리드 AI 배포Entra IDAI 거버넌스