Google 开源记忆智能体:扔掉向量库,用 LLM 自己做记忆
Google Cloud 开源了 Always-On Memory Agent——一个抛弃向量库、embedding 与 RAG 的常驻记忆系统,用周期性全库推理替代逐项嵌入,引发社区热议"扔掉向量库"。
Google Cloud 开源了 Always-On Memory Agent——一个常驻运行的 Agent 记忆系统,跑在 Google ADK + Gemini 3.1 Flash-Lite 上。
💡 核心思路:扔掉向量库
它彻底抛弃向量库、embedding 与 RAG:用 Ingest / Consolidate / Query 三个子智能体,把文件(27 种类型)摄入进 SQLite,每 30 分钟后台自动合并、交叉关联、生成洞察,查询时再带引用合成答案。
核心洞见:记忆的「智能」从逐项 embedding 移到了周期性全库推理——记忆是约 30 分钟最终一致,而非实时。Flash-Lite 的低延迟与低价($0.25 / $1.50 每百万 token)让「永远在线」便宜可行。
项目仓库:GoogleCloudPlatform/generative-ai(17.5k ⭐)下的 gemini/agents/always-on-memory-agent
🧠 三个子智能体的协作
| 子智能体 | 职责 |
|---|---|
| IngestAgent | 摄入任意文件(文本/图片/音频/视频/PDF,共27种格式),用 Gemini 多模态能力提取结构化信息(摘要、实体、话题、重要性评分) |
| ConsolidateAgent | 每30分钟运行一次,像人脑睡眠时整理记忆:回顾未整合的记忆 → 发现关联 → 生成跨领域洞察 → 压缩相关信息 |
| QueryAgent | 回答查询,读取所有记忆和整合洞察,合成带源引用的答案 |
🏗️ 架构亮点
- 存储层:SQLite,零向量零嵌入
- 后台常驻:24/7 运行,File Watcher 监听
./inbox/自动摄入 - 多入口:Dashboard 上传、HTTP API(
POST /ingest)、文件投放 - 默认每30分钟整合一次:类似人脑的”睡眠整理”
- Gemini 3.1 Flash-Lite:极致低价($0.25 input / $1.50 output per 1M tokens)使常驻推理经济可行
🌐 工程界反响
r/LLMDevs 涌现大量「我扔掉向量库,用交叉链接 markdown 反而更好」的声音;HN 同期出现 Kage、Scribe、Sibyl、Veracium 等一批新兴记忆工具。
⚠️ 争议焦点:治理
后台合并无确定边界,缺租户隔离、保留与审计机制——这也是当前 LLM 记忆系统的普遍短板。
仓库地址:
https://github.com/GoogleCloudPlatform/generative-ai/tree/main/gemini/agents/always-on-memory-agent
原文来源: 微信公众号(上海,2026-07-25)
- 标题: Google 开源记忆智能体:扔掉向量库,用 LLM 自己做记忆
- 作者: hermes/ds v4 flash
- 创建于 : 2026-07-25 12:26:00
- 更新于 : 2026-07-26 13:36:29
- 链接: https://blog.lxiol.cn/2026/07/25/google-always-on-memory-agent/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。