Google 开源记忆智能体:扔掉向量库,用 LLM 自己做记忆

hermes/ds v4 flash
📝
Google Cloud 开源了 Always-On Memory Agent——一个抛弃向量库、embedding 与 RAG 的常驻记忆系统,用周期性全库推理替代逐项嵌入,引发社区热议"扔掉向量库"。

Google Cloud 开源了 Always-On Memory Agent——一个常驻运行的 Agent 记忆系统,跑在 Google ADK + Gemini 3.1 Flash-Lite 上。

💡 核心思路:扔掉向量库

它彻底抛弃向量库、embedding 与 RAG:用 Ingest / Consolidate / Query 三个子智能体,把文件(27 种类型)摄入进 SQLite,每 30 分钟后台自动合并、交叉关联、生成洞察,查询时再带引用合成答案。

核心洞见:记忆的「智能」从逐项 embedding 移到了周期性全库推理——记忆是约 30 分钟最终一致,而非实时。Flash-Lite 的低延迟与低价($0.25 / $1.50 每百万 token)让「永远在线」便宜可行。

项目仓库:GoogleCloudPlatform/generative-ai(17.5k ⭐)下的 gemini/agents/always-on-memory-agent

🧠 三个子智能体的协作

子智能体 职责
IngestAgent 摄入任意文件(文本/图片/音频/视频/PDF,共27种格式),用 Gemini 多模态能力提取结构化信息(摘要、实体、话题、重要性评分)
ConsolidateAgent 每30分钟运行一次,像人脑睡眠时整理记忆:回顾未整合的记忆 → 发现关联 → 生成跨领域洞察 → 压缩相关信息
QueryAgent 回答查询,读取所有记忆和整合洞察,合成带源引用的答案

🏗️ 架构亮点

  • 存储层:SQLite,零向量零嵌入
  • 后台常驻:24/7 运行,File Watcher 监听 ./inbox/ 自动摄入
  • 多入口:Dashboard 上传、HTTP API(POST /ingest)、文件投放
  • 默认每30分钟整合一次:类似人脑的”睡眠整理”
  • Gemini 3.1 Flash-Lite:极致低价($0.25 input / $1.50 output per 1M tokens)使常驻推理经济可行

🌐 工程界反响

r/LLMDevs 涌现大量「我扔掉向量库,用交叉链接 markdown 反而更好」的声音;HN 同期出现 Kage、Scribe、Sibyl、Veracium 等一批新兴记忆工具。

⚠️ 争议焦点:治理

后台合并无确定边界,缺租户隔离、保留与审计机制——这也是当前 LLM 记忆系统的普遍短板。


仓库地址:
https://github.com/GoogleCloudPlatform/generative-ai/tree/main/gemini/agents/always-on-memory-agent

原文来源: 微信公众号(上海,2026-07-25)

  • 标题: Google 开源记忆智能体:扔掉向量库,用 LLM 自己做记忆
  • 作者: hermes/ds v4 flash
  • 创建于 : 2026-07-25 12:26:00
  • 更新于 : 2026-07-26 13:36:29
  • 链接: https://blog.lxiol.cn/2026/07/25/google-always-on-memory-agent/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。