Agent memory 正在从向量库回到认知架构

lxiol

原文链接:https://mp.weixin.qq.com/s/mBKeOM4KdJrG1ASX8itwXw

如果只看标题,《AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents》像是一篇“把脑科学和 Agent 放在一起讲”的综述。

如果只看标题,《AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents》像是一篇“把脑科学和 Agent 放在一起讲”的综述。

但它真正有价值的地方,不是又给 agent memory 列了一张表,而是把一个工程上经常被简化的问题重新摆正了:记忆不是把历史塞进向量库,也不是把上下文窗口拉长。记忆是一个从编码、存储、检索、更新到遗忘的生命周期系统。

这对现在的 Agent 很关键。大模型本身是无状态的,每次推理都像从一个干净房间重新开始。长 context 能缓解这个问题,但它不等于长期记忆:成本会随长度上升,中间信息容易被忽略,历史也不会自动变成经验。

上下文不是长期记忆

上下文不是长期记忆

这篇论文的核心判断是:如果 Agent 要从“会调用工具的聊天模型”变成“能积累经验的行动系统”,memory 不能再作为外挂组件存在,而要成为 agent architecture 的一部分。

一、论文到底讲了什么

论文从三个层次定义 memory:认知神经科学里的记忆、LLM 里的记忆,以及 autonomous agents 里的记忆。

在 LLM 层面,作者把记忆拆成三类:参数记忆、工作记忆和显式外部记忆。参数记忆来自训练权重,更新成本高;工作记忆主要对应 context window,适合短期任务状态;显式外部记忆则是向量库、知识图谱、memory bank 这一类外部存储。

但到了 Agent 层面,问题发生了变化。Agent memory 不只是“查资料”。它要支撑身份连续性、偏好适配、跨任务经验复用、长程规划,以及失败后的策略更新。所以论文特别区分了 RAG 和 agent memory:RAG 主要面向静态知识查询,agent memory 则嵌在行动轨迹里,会随着 agent 的操作、反馈和反思不断变化。

这一区分很重要。很多系统把“加一个 vector DB”就叫 memory,本质上只是给模型接了一个资料柜;而 Agent 需要的是一个会被写入、整理、召回、修正和遗忘的经验系统。

RAG 更像查资料,Agent memory 更像长经验

RAG 更像查资料,Agent memory 更像长经验

二、脑科学给 Agent 的启发不是“拟人化”

论文里最有意思的部分,是它没有停留在“人脑有短期记忆和长期记忆,所以 Agent 也应该有”这种类比,而是具体讨论了生物记忆的机制。

短期记忆并不是一个单独盒子。论文总结了 sensory-frontoparietal network、持续神经活动和 activity-silent synaptic state 等机制:高优先级信息可以保持在活跃状态,暂时不在注意焦点里的信息则可能以静默方式保存,之后再被重新激活。

长期记忆也不是把所有细节原样存进某个仓库。海马体更像索引器:它把分散在新皮层中的记忆痕迹重新激活,通过 replay 和 consolidation,让经验逐渐转化成更稳定、更抽象的结构。

索引、回放与整合

索引、回放与整合

这对 Agent 工程的启发很直接:memory system 不应该只是“保存原始 transcript”。更合理的架构是把快速推理引擎和动态持久记忆解耦:LLM 负责当下推理,memory layer 负责记录、索引、压缩、整合和再利用历史经验。

换句话说,真正重要的不是“记住更多”,而是“把经历变成可用经验”。

三、论文给出的分类:内容是什么,作用范围到哪里

作者提出了一个比较实用的二维分类。

第一维是 nature:memory 存的到底是什么。论文把 agent memory 分成 episodic memory 和 semantic memory。前者是具体经历,比如一次任务里调用了哪些工具、走了哪些路径、哪里失败了;后者是抽象知识,比如事实、概念、规则和稳定偏好。

第二维是 scope:memory 的作用范围到哪里。inside-trial memory 只在一次任务轨迹中有效,类似当前任务的临时工作区;cross-trial memory 则跨任务、跨会话持久存在,可以积累通用策略和个人偏好。

Agent memory 的两个维度

Agent memory 的两个维度

这个分类比“短期/长期记忆”更贴近工程实现。因为对 Agent 来说,一段信息是否重要,不只取决于时间长短,还取决于它能不能在未来任务中复用。

一次网页自动化任务里的 DOM 细节,可能只在本次任务里有用;但“这个网站登录后经常弹出二次确认”就是跨任务经验。一次代码修复里的具体报错日志可能很快过期;但“这个项目测试前必须先启动某个服务”就是可复用的 procedural memory。

四、我看了一下代码:有仓库,但不是代码实现

Hugging Face 页面上确实挂了 GitHub 链接:AgentMemory/Huaman-Agent-Memory。我把仓库 clone 到本地后做了结构检查。

结论很明确:这个仓库目前更像论文阅读列表和资料索引,不是可运行的代码实现。仓库只有 README.mdtable_of_content.mdLICENSE,没有 Python 文件、Notebook、package.json、requirements.txt、pyproject.toml、Makefile 之类的可运行入口。

GitHub API 显示它当前没有主语言,仓库体积也很小。

所以这里没有 benchmark 可以跑,也没有 demo 可以启动。能做的核验是:确认论文链接、目录结构、阅读列表内容、GitHub star/fork 信息,以及它不是一个实现仓库。这个结论也应该写清楚,否则很容易被 Hugging Face 上的 “GitHub” 标签误读为“作者开源了方法代码”。

有仓库,但这次不是代码实现

有仓库,但这次不是代码实现

五、X 上的讨论集中在哪里

我用 X 搜索了论文标题、arXiv 编号和仓库名。整体看,讨论是正面的,尤其在 Agent 和 cognitive architecture 圈子里,它被当成一篇“把 memory 问题讲清楚”的综述。

最集中的观点有三类。

第一类是对 naive memory 的不满。很多讨论都指向同一个问题:现在不少 Agent 的 memory 只是 context stuffing、向量检索或完整聊天记录回放。这些东西能提供 recall,但很难形成 learning。它们缺少筛选、压缩、整合、遗忘和安全边界。

第二类是对脑科学机制的工程化转译。比如海马体索引、新皮层整合、replay、consolidation、forgetting curve、hot/warm/cold memory tier,这些词在讨论里反复出现。大家关心的不是把 Agent 拟人化,而是用这些机制提醒工程师:记忆管理本身应该是一个策略系统。

第三类是对 skill library 的兴趣。论文把 procedural memory 和 agent skills 放到未来方向里,这点很贴近当前 Agent 工程。因为一个长期运行的 Agent,最终不应该每次都重新规划同样的操作,而应该把稳定成功路径沉淀成可调用技能。

批评并不多,更多是实现层面的谨慎:持久记忆会带来隐私、安全、投毒、冲突更新和 memory bloat 问题。也就是说,大家并不是反对这条路线,而是在问:如何把它做成可审计、可删除、可纠错的工程系统。

X 上的讨论:正面,但谨慎

X 上的讨论:正面,但谨慎

六、我的判断:memory 的难点不在存储,而在治理

这篇论文最值得带走的一句话,可能不是文中的某个术语,而是它隐含的架构判断:Agent memory 的核心问题不是容量,而是治理。

存储本身已经不难。文本、向量、图、数据库、日志系统都能存。难的是:什么时候写入?写成原文还是摘要?哪些经历值得跨会话保留?冲突信息如何合并?旧记忆什么时候衰减?敏感信息如何避免被错误召回?经验什么时候应该变成 skill,而不是永远躺在 memory bank 里?

记忆系统需要筛选、遗忘、技能和审计

记忆系统需要筛选、遗忘、技能和审计

这也是为什么简单 RAG 解决不了 Agent memory。RAG 更像“查书”;Agent memory 更像“形成经验”。查书强调相关性,形成经验还要处理时间、重要性、可靠性、复用性、安全性和行动后果。

从这个角度看,未来 Agent 的竞争点可能不只是模型本身,而是 runtime 里的 memory policy:它如何把一次次任务压缩成可复用经验,又如何避免把错误经验、隐私信息和过期上下文变成系统负债。

记忆治理:筛选、遗忘和安全

记忆治理:筛选、遗忘和安全

七、这篇论文适合怎么读

如果你想找一个新算法或开源实现,这篇不是。它是一篇综述,价值在于搭框架。

更适合的读法是把它当作 agent memory 的设计清单:

  • 你的系统区分 working memory 和 persistent memory 吗?
  • 你的 memory 是原始日志、摘要、图结构、参数化知识,还是 skill?
  • 你有没有区分一次任务内有效的信息和跨任务可复用的信息?
  • 你有没有 memory update、conflict resolution 和 forgetting 机制?
  • 你有没有考虑 memory extraction、poisoning、privacy leakage 这类安全问题?
  • 你有没有办法把高频成功轨迹沉淀成 procedural memory?

如果这些问题答不上来,那么系统里即使有一个叫 memory 的模块,也可能只是一个更长的缓存。

这篇论文提醒我们:Agent 的长期能力不是来自“它记得很多”,而是来自“它知道哪些经历应该变成经验,哪些经验应该影响未来行动”。这正是 memory 从向量库问题,重新回到认知架构问题的原因。

参考资料

关于本文

本文由 Zero 协助完成。

生成与校验流程

  • 原文采集:读取 Hugging Face Papers 页面、arXiv 摘要与 arXiv HTML 正文。
  • 论文/资料核对:梳理论文的 memory definition、utility、categorization、storage、management 和 security 线索。
  • 代码/数据核验:clone 官方 GitHub 仓库,检查 README、目录、文件类型与可运行入口,确认该仓库目前不是代码实现仓库,因此没有可执行测试项。
  • 社交讨论核对:在 X 上搜索论文标题、arXiv 编号和仓库名,整理主要正向反馈与工程层面的谨慎意见。
  • 配图生成/封面制作:使用 Codex builtin image_gen 生成 1 张封面和 8 张正文配图;未使用 Python/PIL/SVG/Canvas/后期叠字;对中文标签做了视觉审核,其中一张因「巩固」字形不稳定,改为语义接近且更稳定的「整合」后重画。
  • 草稿校验:将 Markdown 转换为微信公众号草稿,并通过浏览器预览检查正文和图片加载。

Zero 是什么:一个在 macOS 上自主执行任务的 AI Agent 系统,具备浏览器自动化、本地工具链、多 Agent 协作、长期记忆等能力。本文从论文检索、代码核验、文章写作、配图生成到公众号草稿创建,均在与 Zero 的同一次对话中通过多轮交互完成——每一轮我提出方向或修改意见,Zero 负责执行、生成、校验和迭代。

Zero 项目地址https://github.com/V1ki/zero

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: Agent memory 正在从向量库回到认知架构
  • 作者: lxiol
  • 创建于 : 2026-06-30 17:16:38
  • 更新于 : 2026-06-30 17:16:38
  • 链接: https://blog.lxiol.cn/2026/06/30/Agent-memory-正在从向量库回到认知架构/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。