벡터 DB 없이 LLM 추론만으로 문서를 찾는 법
VectifyAI의 PageIndex가 청킹·임베딩·벡터 DB 없이 시맨틱 트리와 LLM 추론만으로 문서를 검색하는 원리, FinanceBench 벤치마크, 활용 시나리오를 정리한다.
2026-08-14 · 최초 발행 2026-04-11
기존 RAG 파이프라인은 문서를 청킹하고, 임베딩하고, 벡터 DB에 저장한 뒤 유사도 검색으로 관련 정보를 찾는 여러 단계를 거친다. VectifyAI가 개발한 PageIndex는 이 단계를 통째로 걷어내고, LLM의 추론 능력만으로 문서 구조를 사람처럼 탐색해 정보를 찾는 Vectorless RAG 프레임워크다. FinanceBench에서 98.7%의 정확도를 달성하며 기존 벡터 기반 RAG 대비 우수한 성능을 입증했다.
청킹이 만드는 문맥 손실과 튜닝 부담
문서를 고정 크기 청크로 나누면 문맥이 끊기고, 청크 경계에서 표·그래프·수식 같은 구조적 요소가 잘리는 문제가 생긴다. 벡터 유사도 검색은 의미적 유사성에 의존하는 탓에 정확한 사실 검색에는 취약하고, 임베딩 모델·벡터 DB·리랭커 등 여러 컴포넌트가 얽히면서 파이프라인이 복잡해진다. 청크 크기와 오버랩 비율 같은 하이퍼파라미터 튜닝에는 상당한 엔지니어링 비용이 들고, 검색 결과의 추적 가능성이 낮아 디버깅도 어렵다.
문서를 시맨틱 트리로 바꾸는 발상
PageIndex는 문서를 시맨틱 트리(Semantic Tree) 구조로 변환해 LLM이 사람처럼 문서를 탐색하는 방식을 구현한다. 문서의 자연스러운 구조(장·절·항)를 그대로 보존하는 트리 인덱싱을 쓰고, 각 노드에 제목과 요약 정보를 담아 LLM이 추론할 근거를 준다. 청킹 없이 문서 전체의 계층적 구조를 트리로 표현한 뒤, LLM이 루트에서 시작해 관련 브랜치를 따라 내려가며 검색하고 불필요한 브랜치는 가지치기(pruning)해 검색 효율을 높인다. 최종적으로는 완전한 섹션 단위로 정보를 반환해 문맥을 보존한다.
인덱싱과 검색이 나뉘는 방식
PageIndex는 인덱싱 단계와 검색 단계로 동작한다. 인덱싱 단계에서는 PDF 문서를 페이지 단위로 파싱하고, 목차(Table of Contents) 구조를 자동 추출하며, 각 섹션에 대한 요약을 LLM으로 생성해 계층적 트리로 인덱스를 구축한다. Vision 모드에서는 차트·표 같은 시각적 요소를 이미지로 캡처해 트리 노드에 포함한다. 검색 단계에서는 사용자 질의와 함께 시맨틱 트리 구조를 LLM에 전달하고, LLM이 노드 제목과 요약을 읽고 관련성을 추론해 상위 노드에서 하위 노드로 순차적으로 탐색한다. 관련 없는 브랜치를 가지치기해 검색 범위를 좁힌 뒤, 최종 노드의 전체 텍스트를 컨텍스트로 반환한다.
기존 벡터 RAG와 갈리는 지점
| 항목 | 기존 벡터 RAG | PageIndex |
|---|---|---|
| 문서 분할 | 고정 크기 청킹 | 자연 구조 보존 |
| 검색 방식 | 벡터 유사도 | LLM 추론 |
| 인프라 | 벡터 DB 필수 | 벡터 DB 불필요 |
| 문맥 보존 | 청크 단위(문맥 손실) | 섹션 단위(문맥 보존) |
| 설명 가능성 | 낮음 | 높음(추론 경로 추적 가능) |
| FinanceBench 정확도 | 약 79% | 98.7% |
FinanceBench에서 확인된 성능
PageIndex는 FinanceBench에서 98.7%의 정확도로 최고 성능(state-of-the-art)을 달성했으며, 금융 보고서·규제 문서·학술 논문 같은 구조화된 문서에서 특히 강력한 성능을 보인다. 2026년 3월 기준 GitHub 스타 23,000개 이상, 포크 2,000개 이상을 기록했고, VectifyAI의 금융 특화 모델 Mafin 2.5와 결합하면 최고 성능을 낸다.
금융 보고서부터 대용량 문서까지, 맞는 자리
연간 보고서·10-K·10-Q 같은 금융 보고서 분석, 법률 문서 및 규제 문서 검색, 학술 논문·기술 매뉴얼 탐색, LLM 컨텍스트 윈도우를 초과하는 대용량 문서 처리, 검색 결과의 출처 추적이 중요한 업무 환경이 PageIndex가 강점을 보이는 시나리오다.
차트와 이미지까지 읽어내는 Vision RAG
PageIndex는 텍스트 기반 RAG뿐 아니라 Vision RAG도 지원한다. 문서 내 차트·복잡한 그리드·이미지 등을 시각적으로 처리하고, OCR 텍스트에만 의존하지 않고 페이지의 전체 레이아웃을 인식한다. 멀티모달 LLM과 결합해 시각적 요소가 포함된 문서에서도 정확한 검색을 수행하며, 헤더와 데이터 간의 관계를 레이아웃 수준에서 파악한다. 벡터 DB와 청킹이라는 기존 RAG의 핵심 구성 요소를 제거하고도 98.7%의 정확도를 달성했다는 점에서, PageIndex는 Vectorless RAG라는 새로운 접근의 가능성을 보여준다.