Vane: 검색 쿼리 하나도 밖으로 안 나가는 셀프호스팅 AI 검색 엔진
SearXNG와 로컬 LLM을 결합한 오픈소스 프라이버시 검색 엔진 Vane의 아키텍처, v1.12 랭체인 제거, Perplexity 대비 차별점을 정리한다.
2026-08-12 · 최초 발행 2026-03-15
검색 엔진이 쿼리를 수집해 광고 타겟팅에 쓰고 AI 학습 데이터로도 판매하는 구조는 이제 새삼스러운 이야기가 아니다. Vane는 이 구조에 정면으로 맞서는 오픈소스 프로젝트로, 완전히 자신의 하드웨어 위에서 동작하며 어떤 쿼리도 외부로 새어나가지 않는다. GitHub 스타 3만 2,000개를 넘긴 이 프로젝트는 2026년에도 활발히 개발되고 있고, 클라우드 AI 서비스의 대안을 찾는 개발자들 사이에서 표준 참조 구현처럼 언급되고 있다.
Perplexity를 로컬로 옮긴다는 목표
ItzCrazyKns가 2024년 4월 시작한 Vane는 Perplexity AI 같은 "AI 답변 엔진" 경험을 완전히 로컬 환경에서 재현하는 것을 목표로 삼는다. 가치 제안은 세 가지로 정리된다 — 유료 AI 검색 서비스 없이 동일한 경험을 얻을 것, 빅테크로 데이터를 전송하지 않을 것, SearXNG 기반 익명화 메타검색으로 쿼리를 비공개로 유지할 것.
단순히 LLM에 웹 검색을 붙인 수준이 아니다. 검색 결과 취합, 임베딩 기반 재순위, LLM 응답 생성, 소스 인용까지 전체 파이프라인을 갖춘 완전한 AI 답변 엔진이다. TypeScript로 작성되었고, 50명의 컨트리뷰터가 2026년 3월 현재도 활발히 유지보수하고 있다.
프라이버시를 지탱하는 기반
Vane의 프라이버시 보장은 SearXNG 메타검색 레이어와 로컬 LLM 추론 레이어라는 두 기술 위에 서 있다.
SearXNG는 최대 245개의 검색 서비스로부터 결과를 집계하는 오픈소스 메타검색 엔진이다. 이 레이어를 거치는 모든 쿼리는 익명화되어, 각 검색 서비스는 쿼리의 출처를 추적할 수 없고 Vane 사용자 정보도 전혀 기록되지 않는다. Tor 네트워크 위에서 실행하면 온라인 익명성을 한 단계 더 확보할 수 있다.
로컬 LLM 추론 레이어는 Ollama를 통해 Llama, Mistral, Gemma 같은 모델을 완전히 오프라인으로 구동한다. 외부 API 키 설정 없이 다운로드 이후 100% 오프라인 동작이 가능하다. 물론 OpenAI, Anthropic Claude, Google Gemini, Groq 같은 클라우드 모델도 선택적으로 붙일 수 있어, 사용자가 자신의 상황에 맞는 프라이버시-성능 트레이드오프를 직접 정할 수 있다.
검색 래퍼를 넘어서는 기능들
Vane는 검색 목적에 따라 세 가지 모드를 제공한다. 빠른 답변이 필요할 때는 Speed Mode, 일상적인 검색은 Balanced Mode, 심층 리서치는 Quality Mode다. 응답 시간은 Groq 백엔드를 쓸 때 34초, 다른 제공자를 쓸 때 56초 수준이다.
검색 소스도 웹 일반, 토론(Reddit, HackerNews 등), 학술 논문 중에서 고를 수 있다. 기술 질문에는 토론 모드가, 연구 목적에는 학술 모드가 유용하다는 것이 프로젝트의 설명이다. 날씨·계산기·주식 시세처럼 즉시 확인이 필요한 정보는 LLM 응답 생성 없이 위젯(Widgets)이 바로 카드로 보여준다. 텍스트 답변 외에 이미지·비디오 검색 결과도 통합되어 나온다.
파일 QA 기능으로 문서를 업로드해 그 내용을 직접 질의할 수 있고, 로컬 파일을 클라우드 서비스에 올리지 않고도 AI 기반 문서 분석이 가능하다. 도메인 스코프 검색으로 특정 사이트나 문서 모음 안에서만 검색 범위를 좁힐 수도 있다. v1.12에서 새로 들어온 세션 매니저는 각 세션에 고유 ID를 부여하고 30분간 기록을 유지해, 페이지가 새로고침되거나 스트림이 끊겨도 세션 ID로 복원할 수 있다. 검색 히스토리는 브라우저 로컬에만 저장되며 서버에는 남지 않는다.
v1.12: 랭체인을 걷어낸 개편
2025년 12월 출시된 v1.12는 Vane의 구조적 변화 중 가장 큰 릴리즈다. 가장 눈에 띄는 변경은 LangChain 의존성의 완전한 제거다. Vane는 LangChain을 걷어내고 자체 커스텀 구현으로 교체했는데, 스트리밍·생성·제공자별 기능에 대한 저수준 제어권을 확보하기 위해서였다. 팀은 LangChain의 추상화가 오히려 성능 최적화와 제공자별 특수 기능 활용을 방해한다고 판단했다. 자체 기본 클래스와 제공자 클래스에는 streamText, streamObject, generateText, generateObject 메서드가 구현되어 있고, XML 파싱 대신 함수 호출과 부분 스트리밍을 쓴다.
같은 릴리즈에서 방향(DIR), 제안, 비디오, 오디오 전용 에이전트가 추가되어 검색 목적별로 에이전트가 분리되었고, Framer Motion 애니메이션·테마 일관성 수정·구문 강조 포함 코드 블록 렌더링·설정 화면의 버전 번호와 GitHub 링크 표시 같은 UI 개선도 이뤄졌다. 메시지와 청크 타입이 명확히 정의되어 데이터 흐름의 안정성도 높아졌다.
설치는 Docker 한 줄
Docker가 설치된 환경이라면 단 한 번의 명령으로 전체 스택을 실행할 수 있다. 사전 빌드된 이미지가 제공되어 소스 컴파일 없이 바로 쓸 수 있다. 기본 설정은 Ollama로 로컬 LLM을 구동하는 완전 오프라인 모드이며, 설정 파일에서 제공자를 전환하거나 여러 제공자를 동시에 등록할 수 있다. SearXNG 빌드·시작 오류는 v1.12에서 수정되어 전체 시스템 안정성이 이전 버전보다 크게 향상되었다.
하드웨어 요구사항은 쓰는 모델 크기에 따라 달라진다. 7B 파라미터 모델(Llama 3, Mistral 7B 등)은 8GB RAM과 중급 GPU로 충분하고, 1B~3B급 소형 모델은 CPU만으로도 동작한다.
프라이버시 검색이라는 좁은 시장
2026년 현재 프라이버시 우선 AI 검색 분야는 몇 갈래로 나뉜다. DuckDuckGo, Brave Search 같은 클라우드 기반 서비스는 추적 없는 검색을 내세우지만 검색 처리 자체는 외부 서버에서 이뤄지고, AI 기능이 늘면서 서로 점점 비슷해지고 있다. VaneSpark PocketGem은 클라우드 추론 없이 Android 기기에서 RAG와 MCP를 지원하는 온디바이스 모바일 AI 어시스턴트로, 모바일 환경에서는 Vane에 가장 가까운 대안이다.
| 구분 | Vane | DuckDuckGo | Perplexity |
|---|---|---|---|
| 셀프호스팅 | 가능 | 불가 | 불가 |
| 완전 오프라인 | 가능 | 불가 | 불가 |
| 소스 코드 공개 | MIT | 비공개 | 비공개 |
| 로컬 LLM 지원 | 지원 | 미지원 | 미지원 |
| 구독료 | 없음 | 없음 | 월 20달러~ |
셀프호스팅 서버 환경에서 Perplexity에 가장 가까운 경험을 제공하는 오픈소스 솔루션은 사실상 Vane가 유일하다는 것이 이 프로젝트의 포지셔닝이고, 3만 2,000개가 넘는 GitHub 스타는 그 수요를 보여준다.
실제로 쓸 때 마주치는 한계
검색 결과가 많거나 멀티스텝 검색이 복잡해지면 LLM 컨텍스트 창을 초과하는 오류가 발생할 수 있다. GitHub 이슈에서 활발히 논의되는 알려진 문제다. 로컬 LLM 모드에서 좋은 성능을 내려면 적절한 하드웨어가 필요한데, 저사양 환경에서는 클라우드 API 쪽이 더 나은 경험을 주지만 그 경우 쿼리가 외부로 나간다. 클라우드 서비스와 달리 업데이트·보안 패치·새 버전 적용은 사용자 책임이고, LLM이 생성하는 답변의 정확성도 결국 사용하는 모델 성능에 크게 좌우된다 — 소형 로컬 모델은 대형 클라우드 모델보다 답변 품질이 낮을 수 있다.
이런 제약을 감안해도 Vane는 검색 데이터 주권, 구독료 없는 AI 답변 엔진, 유연한 LLM 제공자 선택이라는 세 가치를 하나의 프로젝트로 실현한다는 점에서 프라이버시를 타협하지 않으면서 최신 AI 검색 경험을 원하는 개발자와 팀에게 실질적인 선택지다.
Sources
- https://github.com/ItzCrazyKns/Vane
- https://newreleases.io/project/github/ItzCrazyKns/Perplexica/release/v1.12.0
- https://agentnativedev.medium.com/open-source-perplexity-perplexica-is-self-hosted-ai-search-with-citations-8eed0fb2f092
- https://www.reddit.com/r/selfhosted/comments/1jhtczl/perplexica_an_ai_powered_search_engine/
- https://blocksurvey.io/privacy-guides/privacy-focused-search-engines
- https://www.vanespark.com/