로컬 LLM 도구 전체 지도: 실행 런타임부터 RAG 플랫폼까지
로컬에서 AI 모델을 실행하고 서비스하는 도구를 실행 런타임·GUI 앱·프로덕션 서빙·웹 UI·이미지 생성·멀티모달·RAG까지 7개 계층으로 나눠 실무 관점에서 정리한다.
2026-08-12 · 최초 발행 2026-04-02
로컬에서 AI 모델을 실행하고 서비스하는 도구는 개인 PC에서 명령 한 줄로 모델을 띄우는 CLI 런타임부터, 다중 사용자를 처리하는 프로덕션 서빙 엔진, ChatGPT 스타일 웹 UI, 이미지 생성, 음성·영상 멀티모달, 사내 문서 기반 RAG 플랫폼까지 목적별로 뚜렷하게 나뉜 계층 구조를 이루고 있다. 이 글은 각 계층에서 실제로 쓰이는 도구와 어떤 상황에 어떤 조합이 맞는지를 정리한다.
전체 구조
로컬 AI 도구 생태계는 크게 7개 계층으로 나뉜다.
1. 로컬 LLM 실행 런타임 — 개인용, 개발용
"내 PC에서 바로 모델 실행"하는 가장 기본 계층이다. CLI 중심으로 동작하며 개인 챗봇, 코드 어시스턴트, 로컬 RAG, 오프라인 문서 분석, 에이전트 실험에 쓰인다.
| 도구 | 특징 | 추천 상황 |
|---|---|---|
| Ollama | 가장 빠른 시작, 모델 허브 통합 | 처음 시작하는 사용자 |
| llama.cpp | 가장 범용적, 낮은 메모리 사용 | 다양한 하드웨어 환경 |
| MLX | Apple Silicon 최고 성능 | Mac 사용자 |
| MLC-LLM | 모바일/웹 확장 용이 | 크로스 플랫폼 배포 |
Mac mini M4 Pro 등 Apple Silicon 환경에서는 MLX가 속도 면에서 강세를 보인다. Ollama는 몇 줄의 명령으로 실행 가능해 진입 장벽이 가장 낮다.
2. GUI 기반 로컬 AI 앱 — 비개발자, 데스크탑 친화
CLI가 부담스러울 때 쓰는 데스크탑 앱 계층이다. 모델 검색·다운로드, 프롬프트 테스트, 파라미터 튜닝, 로컬 API 서버, 대화 히스토리 관리를 GUI로 제공한다.
- LM Studio: 강의용 테스트, 모델 비교, 프롬프트 연구에 최적. GUI를 선호하거나 개발팀 데모 환경에 편하다
- GPT4All: 오프라인 완전 지원, 다양한 모델 지원
- Jan: 오픈소스 기반, 커스터마이징 용이
강의 제작용 테스트 환경으로는 LM Studio의 접근성이 가장 좋다.
3. 고성능 LLM 서빙 — 프로덕션, SaaS, 백엔드
서비스 운영을 위한 추론 엔진 계층이다. 초고속 배치 추론, 동시 사용자 처리, 긴 컨텍스트, KV 캐시 최적화, 멀티 GPU, API 서버 최적화가 핵심 기능이다.
| 도구 | 주요 특징 | 적합 상황 |
|---|---|---|
| vLLM | PagedAttention, 높은 처리량 | FastAPI 백엔드, B2B SaaS |
| SGLang | 구조화 생성, 빠른 추론 | 실시간 챗봇, 복잡한 프롬프트 |
| TensorRT-LLM | NVIDIA GPU 최적화 | GPU 서버 환경 |
| LocalAI | OpenAI API 호환 | 기존 OpenAI 코드 마이그레이션 |
실서비스 표준 구조는 vLLM + FastAPI + Redis Queue 조합이다. 다중 사용자, 대량 요청, 실시간 챗봇, AI 콘텐츠 자동화 플랫폼에 적합하다.
4. 웹 UI — ChatGPT 스타일 인터페이스
런타임 위에 붙는 프론트엔드 UI 계층이다. ChatGPT 스타일 대화, 다중 모델 지원, 파일 업로드, 코드 인터프리터 플러그인, 사용자 권한, 팀 협업 기능을 제공한다.
Ollama + Open WebUI 조합은 개인용 로컬 ChatGPT 구축에 가장 인기가 있고, vLLM + Open WebUI는 고성능 서비스에 WebUI를 붙일 때, SGLang + LibreChat은 고급 기능이 필요할 때 쓴다. 사내 문서 챗봇 구축에도 이 조합이 잘 맞는다.
5. 이미지 생성 UI — Diffusion 워크플로우
Stable Diffusion, FLUX, SDXL 계열 이미지 생성 도구 계층이다.
| 도구 | 특징 | 추천 상황 |
|---|---|---|
| ComfyUI | 노드 기반 워크플로우, 확장성 | 전문 워크플로우, 자동화 파이프라인 |
| AUTOMATIC1111 | 가장 많은 확장 플러그인 | 확장성 중시 |
| Fooocus | 간단한 UI, 빠른 시작 | 초보자 |
| InvokeAI | 직관적 UI, 전문 기능 | 균형잡힌 사용 |
초보자는 Fooocus, 전문 워크플로우와 강의 교안 이미지 자동화에는 ComfyUI가 우세하다. IT 강의용 교안 이미지 파이프라인이라면 ComfyUI + SVG/HTML 템플릿 자동 생성 조합의 생산성이 가장 높다.
6. 멀티모달, 음성, 비디오
텍스트 LLM 외에 음성, 자막, 영상 처리까지 로컬에서 처리하는 영역이다.
- WhisperX: 고정밀 자막 생성, 화자 분리 지원
- Kokoro TTS: 경량 고품질 TTS
- XTTS / Supertonic v2: 자연스러운 음성 합성
- Piper: 빠른 경량 TTS
- ComfyUI: 이미지 생성 워크플로우
유튜브 자동화라면 아래 흐름으로 스크립트→음성/이미지→자막→합성까지 로컬에서 이어붙일 수 있다.
7. 로컬 RAG, 문서 AI, 에이전트 플랫폼
회사 문서, 운영 매뉴얼 기반 챗봇 구축에 가장 중요한 계층이다.
| 도구 | 특징 | 추천 상황 |
|---|---|---|
| Dify | 빠른 서비스화, 워크플로우 빌더 | 빠른 프로토타입 → 서비스 전환 |
| RAGFlow | 정확한 문서 검색, 고품질 RAG | 정확도 우선 문서 검색 |
| AnythingLLM | 개인용 빠른 구축 | 개인 또는 소규모 팀 |
| PrivateGPT | 완전 오프라인, 보안 우선 | 보안 민감 환경 |
| Flowise | 시각적 LLM 파이프라인 빌더 | 비개발자 파이프라인 구축 |
목적별로 스택을 고르면
개인 생산성이 목표라면 Ollama(실행) + LM Studio(GUI 테스트) + Open WebUI(인터페이스) 조합으로 충분하다. SaaS나 서비스 운영이라면 vLLM 또는 SGLang(서빙) + FastAPI(API) + Redis Queue(비동기 처리)로 넘어간다. 강의 콘텐츠 자동화는 Ollama/vLLM(스크립트) + WhisperX(자막) + Supertonic(음성) + ComfyUI(이미지) + FFmpeg(영상)를 엮고, 사내 문서 챗봇은 Dify 또는 RAGFlow(RAG 엔진) + Open WebUI(인터페이스)로 구성한다.
결국 계층을 구분해서 접근하는 게 핵심이다. Mac Apple Silicon 환경이라면 MLX + Ollama + Open WebUI로 시작하고, 서비스 수준으로 확장할 때 vLLM으로 전환하는 경로가 가장 무리 없다.