LLM 에이전트 기억을 압축하는 정보량 기반 선별 저장 설계

LLM 에이전트 장기 기억에서 정보량을 기준으로 노이즈를 선별하고, 다중뷰 인덱싱·원본 참조·임계값 운영을 결합하는 설계를 다룬다.

2026-09-02 · 최초 발행 2026-08-04

저장 전에 기억의 밀도를 높이는 방식

UNC Chapel Hill 연구진이 발표한 LLM 에이전트 장기 기억 프레임워크 SimpleMem은 비정형 상호작용을 다중뷰 인덱싱된 압축 기억 단위로 증류하는 시맨틱 구조 압축(Semantic Structured Compression)을 제시했다.

대화 이력에는 인사, 확인, 반복 표현처럼 정보량이 낮은 발화가 많이 섞인다. 반면 이후 질의에서 다시 필요한 사실은 일부에 집중된다. 이 차이를 저장 단계에서 다루면 검색 정확도와 토큰 비용을 함께 개선할 여지가 생긴다.

기존 기억 관리는 두 방향으로 치우치기 쉬웠다. 전체 이력을 보존하면 중복이 누적되고, 매번 추론으로 노이즈를 거르면 토큰 소비가 커진다. SimpleMem의 접근은 시맨틱 무손실 압축을 전제로 정보 밀도를 높이고 토큰 소비를 줄이는 쪽이다. 강력한 기준선인 Mem0 대비 26.4% 개선을 기록하면서 추론 토큰 소비를 30배 줄였다.

다만 정보량이 낮은 발화가 항상 불필요한 것은 아니다. 관계의 맥락이나 선호 표현처럼 단순한 정보량 지표만으로 저장 가치를 판별하기 어려운 내용도 있다. 따라서 선별 저장은 필터 하나가 아니라 정보량 산정, 임계값, 다중뷰 인덱스, 중복·모순 처리, 원본 참조를 묶은 기억 체계로 다뤄야 한다.

기억 단위를 만들고 다시 검증하는 경로

발화마다 정보량을 추정해 저장 가치를 판단한다. 인사, 확인, 반복 표현은 낮은 값을 받을 수 있지만, 예외 규칙으로 관계 맥락과 선호 표현을 보호해야 한다.

임계값은 저장량과 검색 품질을 조절하는 손잡이다. 초기에는 보수적으로 낮게 두고 관측 결과를 반영해 올리는 편이 안전하다. 상담 이력과 기술 작업 이력은 정보 분포가 다르므로 업무 유형별로 임계값을 분리한다.

같은 사실은 여러 세션에서 반복될 수 있다. 이 경우 하나의 사실로 병합하되 최초 관측 시점과 최종 확인 시점을 함께 남긴다. 중복 반환을 줄이면 검색 결과를 컨텍스트에 넣는 예산도 아낄 수 있다. 새 사실이 기존 기억과 충돌할 때는 조용히 덮어쓰지 않고 표시해야 한다. 시간 순서를 근거로 자동 갱신할 항목과 사람의 확인이 필요한 항목을 나눈다.

다중뷰 인덱스는 동일한 사실을 주제, 시간, 개체 같은 여러 관점에서 찾게 한다. 단일 벡터 인덱스는 질의 표현이 달라질 때 회수에 실패할 수 있다. 대신 뷰가 많아질수록 저장·갱신 비용도 늘어나므로, 회수율 개선폭을 측정해 뷰 수를 결정한다.

압축 단위에는 원본 발화 위치로 돌아가는 링크를 남긴다. 이는 과잉 압축에 대한 안전망이며, 원본 보존 기간은 압축 단위 보존 기간과 분리해 설정할 수 있다.

⤢✕미만이상중복신규모순정상감지상호작용 발생엔트로피 기반 정보량 산정임계값 이상?저장 제외 (원본에만 기록)시맨틱 구조 압축기존 사실과 중복?병합 (최초 · 최종 시점 유지)기존 사실과 모순?표시 후 갱신 판단다중뷰 인덱싱 (주제 · 시간 ·개체)원본 참조 링크 부착회수율 · 정밀도 계측과잉 삭제 감지?

임계값은 운영 과정에서 관리한다

반복 상호작용이 많고 과거 사실을 자주 참조하는 업무부터 적용하는 편이 맞다. 단발성 질의에서는 기억 계층이 주는 이득이 작다. 개인정보가 포함된 업무라면 저장 전에 처리 근거를 먼저 확인해야 한다.

초기 임계값은 표본 대화를 수작업으로 라벨링해 필요한 사실이 어느 지점에서 잘려 나가는지 확인하며 정한다. 처음부터 저장량을 강하게 줄이기보다, 저장 비용을 감수하고 낮게 시작한 뒤 관측 결과로 높인다.

과잉 삭제는 검색 실패 뒤 원본을 조회해 답을 찾은 비율로 감시할 수 있다. 이 비율이 올라가면 필터가 과하다는 신호다. 사용자가 이미 말한 내용을 다시 묻는 빈도도 함께 본다. 반대로 과소 삭제도 별도 지표로 추적해야 한쪽 방향으로만 최적화되는 문제를 피할 수 있다.

압축 기억은 장기 보존하고 원본은 중기로 관리하는 이원 정책을 기본으로 둘 수 있다. 원본을 삭제하기 전에는 압축 품질을 재검증하는 절차가 필요하다. 대표 질의 집합을 만들고 정기적으로 회수율을 측정하며, 이 질의 집합은 실제 사용 로그를 바탕으로 갱신한다.

대화 성격이 바뀌면 정보 분포도 바뀐다. 임계값은 분기 단위로 재검토한다. 삭제 요청은 압축 단위와 인덱스 모두에 반영되어야 하며, 모순 사실의 갱신 권한과 이력 보존 규칙도 함께 정해야 한다.

전량 보존과 압축 기억을 함께 두는 선택

구분 정보량 기반 선별 저장 전량 저장
검색 정확도 노이즈 감소로 개선 중복·노이즈로 저하
저장 비용 낮음 높음
정보 손실 위험 존재 없음
임계값 관리 필요 불필요
조회 지연 짧음 김
감사 대응 원본 병행 필요 자체 완결

선별 저장은 노이즈를 줄여 검색 정확도, 저장 비용, 조회 지연, 토큰 예산 효율을 개선한다. 그러나 저장 시점에는 미래에 무엇이 필요할지 알 수 없으므로, 잘라낸 정보가 나중에 필요해질 위험과 임계값 관리 부담이 남는다.

전량 저장은 정보 손실이 없고 감사 대응이 자체 완결되며 조절 변수가 없어 운영이 단순하다. 대신 중복과 노이즈가 누적되어 검색 결과의 신호 대 잡음비가 낮아지고 저장량은 선형 이상으로 늘어난다. 원본은 별도 계층에 보관하고 압축 기억만 검색 경로에 두면, 선별 저장의 이득을 취하면서 필요한 경우 원본 조회로 손실을 회수할 수 있다.

다중뷰 인덱싱은 주제·시간·개체처럼 서로 다른 접근 경로를 제공한다. 질의 표현이 학습 데이터와 달라져도 회수할 가능성을 높이고, 시간 범위 질의처럼 벡터 유사도만으로 풀기 어려운 요구도 처리한다. 그 대가로 인덱스 구축·갱신과 뷰 간 결과 병합 로직이 필요하다. 단일 벡터 인덱싱은 구현과 갱신이 단순하지만, 표현 차이가 크거나 구조적 조건이 붙은 질의에서는 회수 실패가 발생할 수 있다.

저장 시점 압축은 한 번 만든 결과를 여러 번 재사용하므로 총 연산량이 적고 조회 지연도 짧다. 반면 압축 기준은 미래 질의를 모르는 상태에서 정해지므로 세부 정보가 이미 사라질 수 있다. 조회 시점 요약은 질의 맥락에 맞춰 정보를 남기고 원본도 보존하지만, 매 조회마다 원본을 처리해야 해 지연이 길어지고 토큰 소비가 조회 횟수에 비례해 늘어난다. 장기 실행 에이전트에서는 조회 빈도가 높아질수록 이 비용이 누적되므로, 저장 시점 압축을 기본으로 두고 정밀 확인에만 원본을 끌어오는 구성이 비용 구조상 유리하다.

검색 품질과 데이터 계보로 보는 기억 관리

정보량 기반 선별은 형식지를 많이 쌓는 일보다 유효 지식을 추출하는 일에 초점을 둔다. 보존량과 활용도가 비례하지 않는다는 전제 위에서, 중복 병합과 모순 탐지는 지식 베이스의 일관성을 관리하는 기능이 된다.

과잉 삭제와 과소 삭제를 각각 감시하는 이중 지표는 품질 측정이 한 방향으로 쏠리는 문제를 막는다. 압축된 기억에서 원본으로 되돌아가는 링크는 데이터 계보(lineage)를 확보하는 최소 요건이다.

다중뷰 인덱싱은 질의 표현의 다양성에 대응하는 색인 전략이다. 회수율과 구축 비용 사이의 상충을 조정해야 하며, 대표 질의 집합을 이용한 정기 측정은 검색 품질의 회귀를 찾는 방법이 된다.

기억 시스템이 향하는 방향

에이전트 메모리 프레임워크의 평가 기준은 저장 용량에서 토큰당 정확도로 옮겨가는 흐름이다. 정보량 기반 선별은 대화형 서비스의 기본 저장 계층 기능으로 편입되는 방향에 있다.

모순 사실 탐지는 기억 시스템의 필수 요건으로 요구되고, 갱신 이력 보존도 규범화되는 흐름이다. 기억 삭제 요청의 처리 범위 역시 압축 단위와 인덱스까지 포함하도록 확대되고 있다.

SimpleMem의 시맨틱 구조 압축은 비정형 상호작용을 다중뷰 인덱싱된 기억 단위로 증류해 정보 밀도를 높인다. 필터는 한 번 설정하고 끝나는 값이 아니라, 과잉 삭제와 과소 삭제를 동시에 관찰하면서 조정해야 하는 운영 변수다. 원본 발화로 돌아갈 수 있는 링크를 남겨야 압축 과정에서 생기는 손실도 사후에 회수할 수 있다.

Sources

LLM 에이전트에이전트 메모리시맨틱 압축정보 검색다중뷰 인덱싱