Windows가 AI 추론 런타임이 되는 방식 — Phi-4-Silicon과 NPU 번들의 구조
Microsoft Build 2026이 공개한 Windows AI Runtime의 HAIEnv·MXC 구조와 Phi-4-Silicon NPU 최적화로 완성되는 온디바이스 AI 에이전트 플랫폼을 분석한다
2026-08-12 · 최초 발행 2026-06-04
Microsoft Build 2026에서 공개된 Windows AI Runtime은 Windows 11 2026 Update(v25H2)를 기점으로 OS 자체를 AI 추론 플랫폼으로 바꿔놓는다. 3.8B 파라미터의 Phi-4-Silicon이 NPU에 번들되면서, 이메일 요약이나 일정 협상 같은 작업이 클라우드 호출 없이 로컬에서 완결된다. 발표 데모에서는 네트워크 케이블을 뽑은 상태로 Visual Studio 실시간 코드 번역, Teams 회의 요약, 자연어 파일 검색이 그대로 작동했다.
Windows AI Runtime이 나온 배경
Copilot+ PC 출시 이후 Microsoft는 온디바이스 AI 추론 기반을 꾸준히 확장해왔지만, 클라우드 API 호출 방식은 네트워크 의존성·응답 지연·프라이버시 리스크라는 세 가지 구조적 한계를 안고 있었다. Windows AI Runtime은 이 한계를 OS 레벨에서 정면으로 다룬다.
런타임은 업그레이드된 DirectML API, OS가 직접 관리하는 로컬 모델 카탈로그, 그리고 HAIEnv(Host AI Environment) 시스템 서비스 세 축으로 짜여 있다. HAIEnv는 Llama 3.1 8B, Phi-4, Mistral NeMo 같은 단일 다운로드 모델을 여러 앱이 공유하도록 조율해, 앱마다 별도 모델을 메모리에 올리는 낭비를 없앤다.
최소 요구 사항은 NPU 40 TOPS다. Qualcomm Snapdragon X Elite, Intel Lunar Lake, AMD XDNA 기반 PC가 지원 범위에 포함된다.
Phi-4-Silicon: NPU에 맞춰 다듬은 소형 모델
Phi-4-Silicon은 Microsoft Research가 NPU 파이프라인에 맞게 설계한 3.8B 파라미터 소형 언어 모델(SLM)이다. 상위 라인업으로 Phi-4-mini-silicon(2B)과 이미지 태스크용 Phi-4-vision-silicon(7B)이 함께 제공된다.
양자화 설계에는 QuaRot(Quantization with Rotation) 기법이 쓰였다. 회전 변환으로 이상값(outlier)을 먼저 제거한 뒤 4비트 양자화를 수행하는 방식이라, 정확도를 유지하면서 메모리 풋프린트를 크게 줄인다. 그 결과 첫 토큰 레이턴시가 47% 줄고 디코딩 속도는 4.7배 빨라졌다고 보고됐다.
추론 쪽에서는 현세대 NPU가 행렬-벡터 곱과 텐서 연산을 병렬 처리하는 전용 엔진을 내장하고 있다는 점이 결정적이다. FP4(4비트 부동소수점) 연산을 네이티브로 지원하는 Transformer Engine이 정밀도를 동적으로 조정해 성능-정확도 트레이드오프를 최적화한다. 소프트웨어 양자화·프루닝과 결합하면 GPU 대비 에너지 소비를 최대 143배까지 절감한 사례도 나왔다.
통합 파이프라인이 작동하는 방식
Windows Copilot Runtime SDK는 클라우드와 로컬 모델을 태스크와 연결 상태에 따라 동적으로 혼합하는 통합 API 그래프를 제공한다. 개발자는 연결성과 무관하게 동일한 API 인터페이스를 사용하고, 런타임이 최적 실행 경로를 자동으로 결정한다.
v25H2부터는 "Orchestrator"라는 코드명의 시스템 서비스가 로컬·클라우드 에이전트를 통합 관리한다. 실행 중인 에이전트의 우선순위를 조율하고, HAIEnv를 통해 모델 인스턴스를 앱 간에 공유하며, 배터리 효율을 고려한 추론 스케줄링을 수행하는 역할이다.
프라이버시와 샌드박싱은 **Microsoft Execution Containers(MXC)**가 담당한다. AI 에이전트 전용으로 설계된 정책 기반 실행 레이어로, 개발자는 에이전트가 접근할 수 있는 파일·네트워크·시스템 리소스·앱의 범위를 선언적으로 정의하고 Windows가 런타임에 이를 강제한다. 격리 수준은 의도와 리스크에 따라 동적으로 조합할 수 있는데, Unix의 파일 퍼미션 모델을 AI 에이전트 실행 컨텍스트로 확장한 것에 가깝다. 의료 기록·재무 스프레드시트·법률 계약서 같은 민감 데이터가 로컬 모델로 처리되므로 외부 서버로 전송되지 않는다는 점이 이 구조의 핵심 이점이다.
개발자 생태계 쪽에서는 Windows Copilot Runtime API에 추론당 과금이 없다는 점이 눈에 띈다. 모델이 사용자 하드웨어에서 실행되므로 토큰 과금 없이 무제한 로컬 추론이 가능하고, 로컬 AI 기능을 앱에 통합하는 진입 장벽이 그만큼 낮아진다.
경쟁 NPU 지형과 엣지 전환 비용
| 플랫폼 | NPU 성능 | 최적화 모델 | 추론 방식 |
|---|---|---|---|
| Windows AI Runtime | 40+ TOPS (Snapdragon X Elite) | Phi-4-Silicon (3.8B) | DirectML, NPU/GPU/CPU |
| Apple Silicon (M4) | 38+ TOPS Neural Engine | Core ML 모델 | ANE 전용 |
| Qualcomm Snapdragon 8 Elite | 45% 향상된 Hexagon NPU | Gemini Nano, 자체 모델 | Hexagon SDK |
| Intel Lunar Lake | NPU + Arc GPU 통합 | OpenVINO 기반 | DirectML, OpenCL |
2026년 기준 Copilot+ PC의 최소 NPU 요건은 40 TOPS, Apple Silicon은 38 TOPS Neural Engine이다. Qualcomm Snapdragon 8 Elite가 Hexagon NPU로 AI 성능 45% 개선을 달성하면서 모바일과 PC의 NPU 성능 격차가 빠르게 좁혀지고 있다.
클라우드 AI에서 엣지로 넘어가는 데는 비용이 따른다. 모델 양자화와 NPU 최적화 작업이 필요하고, 정확도 손실을 최소화하면서 모델 크기를 압축해야 한다. 그러나 장기적으로는 API 호출 비용 제거, 응답 레이턴시 감소, 오프라인 가용성, 프라이버시 강화라는 이점이 명확하다. Microsoft가 Phi-4-Silicon을 OS에 번들함으로써 이 전환 비용의 초기 진입 허들을 플랫폼 차원에서 제거했다는 점이 Build 2026의 핵심 전략이다.
엣지 AI는 단순한 클라우드 대체가 아니라 새로운 사용 패턴을 만든다. 오프라인 상황에서도 작동하는 AI 기능, 민감 데이터의 로컬 처리, 응답 지연 없는 인터랙티브 AI가 그것이다. Windows AI Runtime은 PC를 에이전트 실행 호스트로 전환함으로써 엣지에서의 개인 AI 에이전트 생태계를 열었다. Nvidia RTX Spark 같은 별도 AI 가속기와의 결합도 지원하는 설계는, 향후 더 복잡한 멀티모달 추론을 온디바이스에서 처리할 확장 경로를 열어둔다.
40 TOPS NPU를 기본 최소 요건으로 설정한 것은 엣지 AI 하드웨어 생태계의 하한선을 끌어올리는 효과도 가져온다. 개발자와 엔터프라이즈 모두에게 로컬 AI 통합의 진입 장벽이 낮아진 시점에서, 온디바이스 AI 에이전트 시장의 경쟁이 본격화됐다.
Sources
- Microsoft Build 2026: Windows Becomes the AI Runtime with Local Models and RTX Spark
- Windows AI Models at Build 2026: Free On-Device Inference Is Now a First-Class Build Target
- Build 2026: How Microsoft Plans to Turn Windows 11 Into a Local AI Powerhouse for Developers
- Build 2026: Microsoft Turns Windows, Copilot, and Azure Into an AI Agent Platform
- Microsoft Build 2026 Developer Preview: Windows Agent Runtime, Multi-Model Copilot, and the Agentic Stack
- Build 2026: Furthering Windows as the trusted platform for development
- NPU Comparison 2026: Intel vs Qualcomm vs AMD vs Apple
- Build Personal AI Agents on Windows PCs with New Tools from Microsoft and NVIDIA
- Phi-Silica and Specialized Models - Microsoft Edge AI for Beginners