Agent 记忆中 RAG 难题,浙大 MemGate 盘活了
RAG 的死穴:相似不等于相关
Retrieval-Augmented Generation(RAG)是当前 Agent 记忆系统的标准范式:把历史交互向量化存入记忆库,当新任务到来时,通过向量相似度检索最相关的记忆片段,注入到 LLM 的上下文中。这个流程看起来合理,但相似度检索本身就是一个危险的操作——它不加区分地返回任何在向量空间中相近的内容,不管这些内容是否与当前任务真正相关,更不管它们是否包含敏感信息或已被污染的指令。
举个例子:一个客服 Agent 在处理用户 A 的订单查询时,向量检索可能返回了用户 B 的历史对话记录——因为两人问了类似的商品问题。这不只是隐私泄露的问题,用户 B 的历史中可能包含一个精心构造的 jailbreak 攻击提示,或者是针对完全不同业务场景的工具调用序列。Agent 把这些”相似但无关”的记忆当作参考,轻则答非所问,重则被引导执行危险操作。这就是 RAG 的跨域泄露和工具调用漂移问题。
MemGate:给记忆检索装上一道”安检门”
浙江大学和上海 AI 实验室提出的 MemGate,用了一个极其优雅的思路解决这个问题。它不是去改进向量检索算法本身,而是在向量记忆库和骨干 LLM 之间插入了一个仅 9M 参数、35.1MB 大小的轻量级插件。这个小模型充当了”记忆准入控制器”的角色:当向量检索返回一批候选记忆时,MemGate 会根据当前任务的需求,生成一个 query-conditioned gate mask,对候选记忆的向量维度进行选择性抑制和保留。
这个设计的精妙之处在于,它不是二元的”通过/拒绝”判断,而是维度级别的精细调控。一个候选记忆可能在 768 个维度中有 700 个维度对当前任务有用,但有 68 个维度包含了危险或无关的语义信息。传统的相似度阈值过滤会整体保留或丢弃这条记忆,而 MemGate 可以精确地压制那 68 个危险维度,保留剩下的有效信息。效果是惊人的:跨域泄露从 27% 降至 3.5%,jailbreak 攻击成功率从 16.8% 降至 4.4%,工具调用漂移从 77-91% 降至 25-29%——而记忆的实用价值(F1 分数)不仅没有下降,反而有所提升。
“小模型守门”:Agent 安全架构的新范式
MemGate 带来的不只是几个百分点的指标提升,它暗示了一种新的 Agent 安全架构范式。当前主流的安全方案大致有两类:一是在输入/输出端加安全过滤器(类似传统 WAF 的思路),二是在系统提示中约束 Agent 行为。前者的粒度太粗,后者容易被越狱绕过。MemGate 提供了第三条路:在 Agent 的内部信息流中设置专门的安全组件,这些组件小而专精,不参与推理只负责准入控制,就像操作系统中的权限管理模块。
9M 参数的体量意味着 MemGate 可以在消费级设备上运行,推理开销几乎可以忽略不计。论文已经在 arxiv.org/pdf/2606.06054 上公开,这种”小模型守门、大模型干活”的分工模式,很可能成为下一代 Agent 架构的标准配置。当 Agent 的记忆系统越来越庞大、交互历史越来越复杂时,靠系统提示来约束行为就像用篱笆拦洪水——真正需要的是一道精密的闸门。
- 标题: Agent 记忆中 RAG 难题,浙大 MemGate 盘活了
- 作者: lxiol
- 创建于 : 2026-07-30 00:00:00
- 更新于 : 2026-07-30 23:28:59
- 链接: https://blog.lxiol.cn/2026/07/30/memgate-trustworthy-memory-search/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。