에이전트 메모리, 검색보다 영향도 조절이 중요한 이유
MemCalib의 평가 방식을 바탕으로 에이전트가 메모리를 과신하거나 무시하는 문제를 원자 명제 단위에서 점검하는 방법을 설명한다.
2026-09-26
메모리를 찾은 뒤에도 판단은 남는다
에이전트에 메모리를 공급할 때 검색과 필터링만으로 응답 품질을 보장할 수는 없다. 전달된 메모리에는 현재 질문과 무관하거나 오래된 내용이 남을 수 있다. 유용한 내용이라도 응답의 일부를 뒷받침해야 하는지, 핵심 결론을 결정해야 하는지에 따라 쓰임이 다르다.
MemCalib 논문은 이 문제를 메모리가 응답에 미치는 영향도로 다룬다. 평가 단위는 메모리 블록 전체가 아니라 블록 안의 원자 명제다. 한 블록에 함께 담긴 명제라도 어떤 것은 무시하고, 어떤 것은 제한적으로 참고하고, 어떤 것은 결론에 반영해야 할 수 있기 때문이다.
질문을 기준으로 명제마다 목표 영향도를 정한다
메모리 사용을 점검하려면 먼저 현재 사용자 질문을 놓고 각 명제의 목표 수준을 정해야 한다. MemCalib의 구분은 다음과 같다.
| 목표 수준 | 응답에서 기대하는 역할 |
|---|---|
| Ignore | 답변에 그 명제의 흔적을 남기지 않는다. |
| Bound | 필요한 부분에 한정해 근거로 쓴다. |
| Control | 중요한 결론, 제약 또는 권고를 결정하는 데 반영한다. |
그다음 실제 응답에서 각 명제가 어느 수준으로 쓰였는지 판정해 목표와 비교한다. 실제 영향도가 목표보다 크면 과사용, 작으면 과소사용이다. 이 방식이라면 관련 없는 과거 정보가 현재 근거를 밀어낸 경우와, 적용해야 할 선호나 제약을 빠뜨린 경우를 서로 다른 오류로 볼 수 있다.
MemCalib은 원자 명제별 응답 문구 판정 기준을 마련하고, 이를 사용하는 LLM 판정자로 실제 영향도를 Ignore, Bound, Control 중 하나로 분류한다. 자체 평가에 이 관점을 적용한다면 “메모리를 사용했는가”만 표시하는 대신 질문, 제공된 명제, 명제별 목표 영향도, 실제 응답과 판정 결과를 함께 살펴야 한다.
전체 점수와 오류의 방향을 함께 본다
MemCalib은 과사용과 과소사용의 심각도 및 적어도 한 번 오류가 발생한 응답의 비율을 각각 보고한다. 전체 성능은 Sample Calibration Score(SCS)와 Exact Calibration(Exact)으로 확인한다. 실무에서 중요한 점은 전체 점수가 올랐더라도 어느 방향의 오류가 늘었는지 따로 확인하는 것이다.
논문의 1,500건 테스트 세트에서는 평가 대상 모델 전반에서 목표 영향도와 실제 영향도가 어긋났다. 모델 크기만으로 결과를 예상할 수도 없었다. Qwen3-8B가 Qwen3.5-35B-A3B보다 SCS와 Exact 모두에서 앞섰다. 따라서 더 큰 모델을 채택하거나 교체할 때도 메모리 사용의 적절성을 별도로 평가해야 한다.
이 결과는 arXiv:2609.24259에 보고된 실험에 관한 것이다. 해당 논문의 코드·데이터 공개 경로는 MemCalib 저장소다.
후처리 학습은 양쪽 오류의 변화를 확인한다
논문은 GRPO와 OPSD를 포함한 후처리 학습에서 한 방향의 오류가 줄어드는 동안 반대 방향의 오류가 늘어나는 현상을 보고하고, 이를 calibration seesaw라고 부른다. 메모리를 더 적극적으로 쓰게 만든 결과라면 과소사용만 볼 것이 아니라 과사용도 확인해야 한다. 반대 방향으로 조정했을 때도 마찬가지다.
MemCalib-RL은 목표·실제 영향도의 조합을 구분하고, 원자 명제를 제거한 반사실적 비교를 이용해 응답 토큰에 학습 신호를 배분한다. 논문의 Qwen3-8B, Ministral-3-8B-Instruct, Qwen3.5-35B-A3B 실험에서는 비교한 방법 중 MemCalib-RL만이 세 모델 모두에서 과사용과 과소사용을 함께 줄였다. 다만 논문은 토큰 수준의 신호 귀속이 항상 정확하지 않을 수 있다는 한계도 밝힌다.
에이전트 메모리를 개선할 때 확인할 질문은 단순히 “더 많이 사용했는가”가 아니다. 현재 질문에 비춰 각 명제가 응답을 얼마만큼 바꿨어야 하고, 실제로 얼마만큼 바꿨는가를 확인해야 한다.