DeepSeek 研究员开源「自主科研 Agent」!AI 首次独立跑完 285B 模型 RL 全流程,从设计到总结零人工干预
DeepSeek 研究员开源「自主科研 Agent」!AI 首次独立跑完 285B 模型 RL 全流程,从设计到总结零人工干预
2026 年 6 月 17 日,DeepSeek 研究员 Deli Chen(陈德里)在 X 上发了一条长帖,宣布他的个人项目 Deli AutoResearch SKILL 正式开源。
但真正让这条帖子炸开锅的,是中间那一段话——
“The entire RL pipeline — experiment design, code writing, running, debugging, and conclusion summarization — was 100% automated, with zero human intervention from me.”
「整个 RL 管线——实验设计、写代码、运行、调试和结论总结——100% 自动化,我本人零人工干预。」



▲ Deli Chen 宣布 Deli AutoResearch SKILL 开源,并披露 285B 模型 RL 实验由 Agent 全自动完成
不是跑个玩具 demo 意思一下。Agent 调的是 DeepSeek 285B 参数模型,用的是 GRPO 算法,12 次正式运行,烧掉约 3,570 GPU 卡时。
零人类操作。从实验设计到写结论,Agent 自己全部干完。
知名 AI 创业者 Ivan Fioravanti 看到后,直接引用那条帖子,只打了三个字母:WOW。

▲ Ivan Fioravanti 高亮引用”100% 自动化,零人工干预”,获 118 赞、2.5 万阅读
从「AI 写论文」到 AI 自己做实验
过去一年多,AI 辅助科研的讨论主要集中在文献综述和论文撰写上。Deli 自己前三篇论文也是这个路线——Agent 负责收集文献、分类、评分、撰写、多轮模拟评审。三篇累计 941 条引用、190 余页,内部评审中位分 8.5/10。
效果已经不错了。但前三篇有一个共同点:Agent 只管”写”,不管”做”。
论文里的主张,Agent 自己不去验证。
第四篇《Self-Play in the Age of Foundation Models》(基础模型时代的自博弈,75 页、217 条引用、8.6/10)把这件事彻底改了。
这篇论文的主题是自博弈。受 AlphaZero 启发,Deli 的核心洞见是:先验知识未必能抬高上限,模型通过自我对弈反而可能发现更全局最优的解。
要论证这个洞见,光写综述不够。你得跑实验。
Agent 做出了选择:用 GRPO 算法在 DeepSeek 285B 模型上跑真实的数学推理训练,引入可控的验证器噪声(verifier noise),精确测试”验证器噪声如何限制自博弈改进的上限”。
这直接从综述写作跳到了真实的科研闭环。
285B RL 实验:Agent 自主决定的每一环
Agent 自己规划了实验配置——算法选 GRPO,batch size 512,group size 16,上下文窗口 32K,19,000 道数学推理题。关键变量是验证器以概率 ε 翻转奖励(ε 取 0、0.10、0.30、0.45),目标是直接检验一个核心论点:验证器噪声 ε 决定自博弈改进的上限。
总共跑了 12 次 GRPO 训练,约3,570 GPU 卡时。
结果非常干净。改进幅度随验证器噪声单调下降:+4.8%、+0.1%、-4.1%、-6.6%。严格单调,与论文自身推导的定理排序一致。
Agent 还自主做了进一步的消融实验:固定 ε=0.30,扫 KL 系数(0 / 0.001 / 0.01),发现 KL 锚点能有效缓冲噪声的破坏力——准确率从 -9.9% 回升到 +0.8%。后续的 held-out KL 端点研究进一步证实,这里面存在一个真实的、可调的甜点区域。
这些发现全部由 Agent 独立消化、分析,然后写入论文。零人类编辑。

▲ 故事博客核心页面:评分轨迹表、285B 实验发现、V12 降分事件、5 评审人格说明
五次提交失败,Agent 自己修好,然后写了个预检脚本
实验运行中出过 5 次提交失败。每次都是 Agent 自己诊断、自己修复。
有一个反复出现的类型错误:学习率以科学计数法写入配置文件,被解析成了字符串而非浮点数。第四次复现之后,Agent 没有继续修修补补——它自己写了一个提交前检查脚本,并把这条教训固化进运行约束。
这恰恰是”写代码、调试、总结”全流程闭环的缩影:Agent 不仅在解决问题,还在从错误中学习,构建防御机制。
Deli 在帖子下回复时说了一个很关键的观点。有人问为什么不选 PPO 而选 GRPO 来做长时域任务。他的回答精准到位——
“The real reason PPO can handle long-horizon tasks? The Value Model for multi-step task. Honestly, it just shifts the training difficulty from GRPO’s GRM onto the Value Model. The problem isn’t solved — it’s just been relocated. How do you get stable process supervision in long-horizon tasks? That’s the real bottleneck.”
「PPO 能处理长时域任务的真正原因?是用于多步任务的 Value Model。说实话,这只是把训练难度从 GRPO 的 GRM 转移到了 Value Model。问题并没有解决——只是被重新定位了。如何获得稳定的过程监督,这才是真正的瓶颈。」


▲ Deli Chen 在回复中精准指出长时域 RL 的核心瓶颈:稳定的过程监督
五个人格同时审稿,自己给自己降分
Deli AutoResearch 还有一个让人印象深刻的设计:评审不走平均分,而是并行运行五个独立评审人格,取中位数。
五个角色分工明确——
- 实验家
:论文里的数字和原始实验日志逐行对得上吗? - 理论家
:证明是否严谨? - 完美主义者
:表格一致性、摘要准确性、引用有没有问题? - 综合者
:新增内容真的回答了论文自己提出的问题吗? - 新手
:非专家读者能不能读进去?
取中位数有一层深层用意:防止单一热情人格把分拉高。这个机制在第 12 轮评审时发挥了决定性作用。
评分轨迹很有意思:前 11 轮从 7.0 一路升到 8.5。285B 实验数据加入后论文格调明显上了一个台阶。但到了V12,分数从 8.5 降到了 8.2。
这是唯一一次降分。原因是在外部核查中发现了 3 条问题引用——一篇不存在、一篇作者错配、一篇 arXiv ID 指向无关论文。
框架没有掩盖。它据实降分,然后下一轮全部修复。
Deli 把 V12 称为最重要版本。一个会在证据不足时把自己的工作往下打分的自主流水线,远比只会往上爬的可信。
最终 V16 达到了 8.6/10——理论加固落地,噪声地板有了精确的闭式递推证明,耦合地板引理和匹配下界也都补齐了。
框架真正的胜负手:工程脚手架
很多人以为跑通这种长时域自主科研,关键在于模型要够强。Deli 的设计思路恰好相反。
他把问题拆成三类长时域 Agent 的经典失败模式——
认知循环:Agent 反复尝试相似方向,回报递减,但跳不出来。停滞:Agent 完成一块工作后输出总结,然后”等用户反馈”——session 还在,实质工作已经停了(这比崩溃更常见)。运行时脆弱:上下文压缩静默杀死循环,session 挂掉拖垮定时器。
这三个问题,没有一个能用”换个更强的模型”来解决。
Deli 的应对方案是一整套工程脚手架:
所有状态写进文件而非对话历史。每次迭代启动全新 session,只注入精选状态,绝不 resume。守护层和工作者分离——心跳巡逻对非自身任务只能做存活检查、重启、轻推,不得读取数据、修改状态。三层看门狗互检(常驻 shell 守卫 + 耐久 cron + 业务循环自身),任一层挂掉都能被另一层发现并拉起。
还有一个精细的停滞检测系统:一次迭代零新发现或指标下降,stale_count +1。累积到 2 次就改变结构约束而非战术参数。累积到 4 次标记需要人工关注。
每次新方向必须与历史上所有已试方向不同——重点在强制换坑,不在同一个坑里转圈。
这些约束让框架在 4 篇论文上跑通:约 290 次 Agent 回合、255 万输出 token、近 2,000 次工具调用、63+ 个子 Agent、累计约 44 小时墙钟时间。
最关键的是:Deli 发布的是一个协议——一份自包含的 SKILL.md 文档,没有任何可执行代码。任何采用者可以把这个协议嫁接到自己的 Agent 环境里——Grok、Claude Code、Cursor 都行。
可移植的协议胜过黑箱系统。这降低了整个方向的进入门槛。

▲ 框架协议首页:三大失败模式、行为约束、架构设计、看门狗机制
GRPO 为什么是这个故事里的关键工具
GRPO(Group Relative Policy Optimization)是 DeepSeek 自己在 2024 年 DeepSeekMath 论文中提出的算法,后来被 DeepSeek-R1 等推理模型广泛采用。
它最核心的创新是去掉独立的 Critic/Value Model。PPO 需要训练一个和策略模型同等规模的 Critic 来估计优势函数,GRPO 的思路是:同一 prompt 下采样一组(group)响应,用组内得分的相对关系作为基线,直接估计优势。显存需求几乎减半。

▲ GRPO 起源于 DeepSeekMath 论文(arXiv:2402.03300),Agent 实验中选择调用这一成熟工具
AutoResearch Agent 选择 GRPO 来做自博弈验证实验,正是因为它在数学推理任务上表现强劲,且资源效率更高——适合把重点放在”验证器噪声如何限制自博弈收益”这个核心科学问题上,而非被训练资源的工程细节拖住。
这也正是现实科研的逻辑:不追求从零造所有轮子,而是用现有成熟工具解决新的验证性问题。
这只是开始
Deli 自己在帖子里写得很坦诚:这是他个人的持续学习研究之旅的起点。
框架目前更接近主流观点的蒸馏加严谨验证,离产生颠覆性的原始假设还有距离。72 小时最长连续运行中,他给了 6 次方向性输入——不是操作干预,但方向引导确实存在。分数也来自内部模拟评审,只能在协议内部纵向比较。
但这些限制恰恰说明了一件事:这个方向已经在跑了,并且诚实地告诉你跑到了哪一步。
从”AI 写论文”到”AI 自己做实验”,中间隔的是一整套工程架构的补全。Deli AutoResearch 把这个脚手架搭出来了,开源了,并且在 285B 级别的大模型上跑通了完整的 RL 实验闭环。
当 Agent 能够独立完成实验设计、编码、提交、故障恢复、数据分析、论文修订和诚实自我评审——人类的角色就会从操作者转向目标设定者和成果鉴赏者。
这个转变已经开始了。
💬 本文评论区已开启,但暂无读者留言。
本文转载自微信公众号,如有侵权请联系删除。
- 标题: DeepSeek 研究员开源「自主科研 Agent」!AI 首次独立跑完 285B 模型 RL 全流程,从设计到总结零人工干预
- 作者: lxiol
- 创建于 : 2026-07-01 03:11:11
- 更新于 : 2026-07-01 03:11:11
- 链接: https://blog.lxiol.cn/2026/07/01/DeepSeek-研究员开源自主科研-AgentAI-首次独立跑完-285B-模型-RL-全流程从设计到总结零人工干预/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。