Agentic RAG의 런타임 컨텍스트 조립과 하이브리드 검색 설계

Agentic RAG가 쿼리를 분해하고 하이브리드 검색, 다층 메모리, 자기 교정으로 런타임 컨텍스트를 조립하는 구조를 설명한다.

2026-08-14 · 최초 발행 2026-05-22

2026년의 기업 검색은 고정된 벡터 DB에서 유사 문서를 가져오는 단계에 머물지 않는다. 에이전트가 질문을 나누고 여러 소스를 탐색하며 결과가 부족하면 검색 방식을 바꾸는 컨텍스트 아키텍처로 이동하고 있다. Agentic RAG 시장은 2024년 38억 달러에서 2034년 1,650억 달러로 연평균 45.8% 성장할 전망이다. 이 흐름의 중심에는 하이브리드 검색과 에이전트의 자율 검색이 있다.

기존 RAG가 벡터 유사도 검색 결과를 생성 모델에 전달했다면, Agentic RAG는 복잡한 질문을 검색 가능한 단위로 분해한다. 이어 다중 소스를 동적으로 조회하고, 중간 결과를 평가하며, 필요한 경우 자기 교정 루프를 돌린다.

검색 결과를 가져오는 대신 검색 과정을 조율한다

Agentic RAG 파이프라인에는 검색과 생성뿐 아니라 에이전트 조율, 전략 선택, 결과 평가가 들어간다. 2026년 업계 분석에서는 RAG 실패의 73%가 LLM이 아니라 검색 레이어에서 발생한다고 본다. 청킹과 검색 품질을 먼저 손보는 작업이 가장 높은 ROI를 제공하는 이유다.

하이브리드 검색은 BM25 키워드 매칭과 벡터 유사도를 Reciprocal Rank Fusion(RRF)으로 합친다. 어느 한 방식만 사용할 때보다 검색 정밀도를 일관되게 높이는 접근이다. 검색된 문서는 크로스 인코더가 쿼리와 한 쌍으로 읽고 관련도를 다시 계산할 수 있다. 이 단계는 RAG 파이프라인에서 단일 최고 ROI 개선 요소로 꼽히며, 정밀도 1030% 향상과 레이턴시 50100ms 추가라는 특성을 갖는다.

청크를 만드는 방식도 검색 성능을 좌우한다. RAG 실패의 80%가 청킹 레이어에서 발생한다는 분석이 있으며, 계층적 청킹은 작은 자식 청크가 일치했을 때 더 큰 부모 섹션을 전달해 문맥의 완결성을 보완한다.

복잡한 질문은 한 번의 검색으로 끝나지 않는다. 에이전트는 중간 결과를 토대로 후속 쿼리를 만들고 연쇄 검색을 수행한다. 결과가 충분한지도 자체 평가한다. 부족하다고 판단하면 쿼리를 다시 쓰거나 검색 범위를 넓히고, 필요에 따라 소스를 전환한다.

YesNo충분불충분사용자 쿼리쿼리 분석 에이전트의도·복잡도 판단단순 쿼리?직접 벡터 검색쿼리 분해서브쿼리 생성병렬 하이브리드 검색BM25 + 벡터 RRF크로스 인코더리랭킹품질 평가자기 교정컨텍스트 조립생성재검색 전략쿼리 재작성최종 응답

복잡한 질문을 검색 가능한 작업으로 바꾸는 과정

Azure AI Search의 에이전틱 검색 모드는 복잡한 쿼리를 서브쿼리로 자동 분해한다. 각 서브쿼리를 병렬로 실행한 뒤 결과를 하나의 응답으로 통합하는 방식이다.

먼저 질문이 사실 확인인지, 절차 요청인지, 분석이나 비교인지 파악해 검색 전략을 나눈다. 원본 쿼리는 서로 독립적으로 검색할 수 있는 하위 질문으로 변환한다. 병렬 실행은 서브쿼리 처리에 따른 레이턴시를 줄이고, 결과 병합 단계에서는 의미적 일관성을 기준으로 검색 결과를 결합한다.

이 과정에서 출처 연결이 끊겨서는 안 된다. 응답의 각 세그먼트가 어느 원본 문서와 청크에서 나왔는지 매핑을 유지해야 한다.

실행 시점에 여러 메모리와 저장소를 엮는다

Agentic RAG의 컨텍스트는 단일 벡터 DB에 고정되지 않는다. 현재 대화, 진행 중인 작업 상태, 축적된 지식과 이력을 서로 다른 메모리 계층에 두고 런타임에 필요한 부분을 모은다.

에이전트 런타임단기 메모리현재 세션 컨텍스트작업 메모리진행 태스크 상태장기 메모리지식 베이스·이력인메모리 캐시최근 검색 결과벡터 DB임베딩 저장소그래프 DB엔티티·관계 저장문서 스토어원본 청크 저장하이브리드 검색레이어리랭킹·필터링동적 컨텍스트 조립

인메모리 캐시는 최근 검색 결과와 임베딩을 보관해 반복 쿼리의 처리 시간을 줄인다. 벡터 DB에는 텍스트 청크의 임베딩을 저장하고, 근사 최근접 이웃(ANN) 알고리즘으로 검색한다.

그래프 DB는 엔티티 사이의 관계를 담는다. 다중 홉 추론이 필요할 때 관계 경로를 탐색하는 저장소다. 문서 스토어에는 원본 청크와 메타데이터를 두어 검색 결과와 함께 완전한 문서 컨텍스트를 반환할 수 있게 한다. 각 저장소에서 모은 후보는 리랭킹과 필터링을 거쳐 동적으로 조립된다.

정적 인덱스 밖의 최신 데이터를 포함하는 방법

실시간 데이터가 중요한 기업 환경에서는 정적 인덱스만으로 충분하지 않다. 2026년의 Agentic RAG는 스트리밍 파이프라인과 연결해 변하는 데이터를 컨텍스트에 반영한다.

변경 데이터 캡처(CDC)는 원천 데이터가 달라졌을 때 재인덱싱을 시작한다. 증분 임베딩 업데이트를 적용하면 전체 인덱스를 다시 만들지 않고 변경된 문서만 갱신할 수 있다. 신선도 관리가 필요한 데이터는 TTL 기반 캐시 만료로 유효 기간을 다룬다. 인덱스에 없는 실시간 API 데이터는 MCP 서버를 통한 에이전트 도구 호출로 컨텍스트에 합칠 수 있다.

기존 RAG와 갈라지는 지점

구분 기존 RAG Agentic RAG
검색 전략 고정(단일 벡터 검색) 동적(하이브리드·그래프·도구 호출)
쿼리 처리 원본 쿼리 직접 사용 자율 쿼리 분해·재작성
다중 홉 미지원 연쇄 검색 지원
자기 교정 미지원 품질 평가 후 재검색
외부 도구 통합 제한적 MCP 기반 완전 통합
처리 지연 낮음(단순 파이프라인) 중간~높음(추론 비용)
답변 품질 단순 질문 우수 복잡한 다단계 질문 우수

차이는 검색 횟수보다 의사결정 주체에 있다. 기존 RAG는 미리 정해진 경로로 원본 쿼리를 처리한다. Agentic RAG에서는 에이전트가 질문의 복잡도와 중간 결과를 보고 다음 검색 경로를 선택한다.

이 구조는 여러 문서와 데이터 소스를 가로질러야 하는 업무에 맞는다. 법률·컴플라이언스 분야에서는 판례와 규정을 다중 홉으로 검색해 일관된 법적 의견을 생성한다. 금융 분석에서는 시장 데이터, 공시, 뉴스를 동적으로 결합해 종합 분석 보고서를 만든다.

기술 지원에서는 제품 문서와 이슈 트래커, 코드베이스를 횡단 검색해 트러블슈팅 정보를 구성한다. 의료 연구에서는 임상 데이터베이스, 논문, 약물 정보를 통합 검색해 근거 기반 임상 지원에 활용한다.

추론 비용을 검색 경로에서 통제한다

Agentic RAG는 기존 RAG보다 추론 비용이 높다. 다중 홉 추론과 자기 교정 루프가 LLM 호출 횟수를 늘리기 때문이다.

모든 요청을 동일한 파이프라인에 넣을 필요는 없다. 티어드 검색을 사용하면 단순 쿼리는 기존 RAG로 보내고, 복잡한 쿼리만 Agentic RAG로 라우팅할 수 있다. 반복되는 유사 쿼리는 시맨틱 캐시에 저장해 LLM 호출을 줄인다.

리랭커에는 전체 검색 결과가 아니라 상위 K개만 전달할 수 있다. 모델 배치도 나눌 수 있다. 쿼리 분해와 품질 평가 같은 중간 단계에는 소형 모델을 쓰고, 최종 생성에는 대형 모델을 사용하는 방식이다.

시장 확산을 이끄는 기술 변화

Agentic RAG 시장이 2024년 38억 달러에서 2034년 1,650억 달러로 성장하는 배경에는 자율 에이전트의 확산이 있다. 기업 업무 자동화에서 에이전트가 맡는 범위가 넓어질수록 복잡한 검색 능력에 대한 수요도 커진다.

검색 대상 역시 텍스트에 머물지 않는다. 멀티모달 RAG는 이미지, 코드, 테이블 등 여러 형태의 기업 지식을 함께 다룬다. 데이터 공급 방식은 정적 문서 인덱스에서 실시간 기업 데이터 스트림 통합으로 확장되고 있다.

MCP 표준화는 에이전트가 연결할 수 있는 RAG 소스를 다각화한다. LLM 비용 하락은 여러 검색과 판단 단계를 거치는 다중 홉 추론의 경제성을 개선한다.

Agentic RAG를 도입한다는 것은 벡터 DB를 교체하는 일이 아니다. 하이브리드 검색, 적응형 청킹, 크로스 인코더 리랭킹, 자기 교정 루프를 하나의 검색 체계로 묶고, 다층 메모리에서 실행 시점의 컨텍스트를 조립하는 아키텍처 전환에 가깝다. 기존 RAG가 놓치던 복잡한 다단계 질문을 처리하려면 검색 품질과 비용 경로를 함께 설계해야 한다.

Sources

에이전틱 RAG하이브리드 검색컨텍스트 아키텍처다중 홉 추론리랭킹