Agent Forge:五分钟搭一个 Agentic RL 自进化可视化网站
训练 Agent 的人,最缺的是「看见」
做 Agentic RL 训练,最痛苦的不是训练本身,而是看不见:成功率高不高、奖励涨没涨、Agent 到底哪里做错了、新版本是真进步还是只涨了少数题目——全凭猜。
小red同学开源的 Agent Forge(XiaoRed5/Agentic-RL-Most-Detailed-Intro 下的 agent-forge 子项目)就是干这个的:一个 Agentic RL 自进化可视化平台,把训练全过程变成看得见的仪表盘。配合千问 AI 平台的 qianwenai-deploy skill,一句话 5 分钟就能部署上云。
六大功能模块
1️⃣ 训练总览
一眼看到:成功率、平均奖励分、工具调用成功率、花费、耗时,以及最近一版是否比上一版更好。训练状态不再靠翻日志。
2️⃣ Agent 行动回放
点开一次任务,像看监控录像一样查看完整链路:
用户提问 → Agent 思考步骤 → 调用了什么工具 → 工具返回什么 → 最终回答
哪一步出错,用红色标出来。逐步还原任务理解、计划、工具调用与最终回答,还能发现重复调用、异常重试、错误工具选择与遗漏约束。
3️⃣ Agent 错题本
把失败分成容易理解的类别,而不是笼统的「没答对」:
- 理解错任务
- 计划不合理
- 选错工具
- 工具调用失败
- 重复循环
- 编造信息
- 做到一半提前结束
成功案例加入训练样本,失败案例进入修复队列——这就是「自进化」的数据闭环。
4️⃣ 版本擂台
让两个 Agent 同时完成一批任务,对比:谁成功率高、谁更省钱、谁速度更快、谁调用工具更少、哪些题进步了、哪些题退步了。
判断新版本是真进步,还是只涨了少数题目。发布判断的核心:确认新增能力没有牺牲旧能力。实例:v2.8 总体更优(14 项提升 2 项持平、节省 14.2% 成本),但营销策划回退 3 分——原因是新版对创意开放性限制过强。看见进步,也不放过退化。
5️⃣ 训练数据工作台
把优秀案例和失败案例放在一起,让人进行标注、修改和筛选,然后导出成下一轮训练数据。这是 RL 训练里最贵的人工环节,被做成了工作台。
6️⃣ 奖励分析
- Reward 曲线
- 回合长度
- 任务完成率
- 无效工具调用次数
- Agent 是否在「钻评分规则的空子」
- 不同能力类别的得分变化
最后一条尤其重要——RL 训练的经典难题就是 reward hacking(钻规则空子),能可视化出来才有机会治。
一句话部署上云
安装方法:
1 | # 1. 打开 codex / claude code / 任何 agent CLI |
AI 会自动执行 14 步部署流程:环境检查 → Git URL 处理 → 项目分析 → 存量检测 → 数据库识别 → 生成模板 → 创建资源栈 → 自动询价(确认后创建) → 服务验证。示例报价:杭州单机 2 核 2G ≈ ¥0.198/小时(约 ¥144.54/月),临时 OSS 预计不足 ¥0.01。部署完还能一句话「删除这次部署」释放资源。
价值:Agentic RL 的「评测-可视化-回流」闭环
Agent Forge 本质是把 RL 训练从黑盒变成透明闭环:
| 环节 | 传统 | Agent Forge |
|---|---|---|
| 训练过程 | 盯 loss 曲线 | 训练总览 + 奖励分析 |
| 失败归因 | 猜 | 错题本 7 类归因 + 行动回放 |
| 版本比较 | 拍脑袋 | 版本擂台(成功率/成本/速度/工具数) |
| 数据回流 | 手工整理 | 数据工作台标注导出 → 下一轮训练 |
这与之前沉淀的 [[agent-evaluation-methodology]] 评测方法论完全呼应——评测不是上线前抽查,而是嵌入训练循环的持续闭环。Agent Forge 给出了一个可落地的可视化实现。
仓库:https://github.com/XiaoRed5/Agentic-RL-Most-Detailed-Intro
部署 skill:https://github.com/QianWen-AI/qianwenai-deploy
- 标题: Agent Forge:五分钟搭一个 Agentic RL 自进化可视化网站
- 作者: lxiol
- 创建于 : 2026-08-01 00:00:00
- 更新于 : 2026-08-01 04:26:38
- 链接: https://blog.lxiol.cn/2026/08/01/agent-forge-agentic-rl-visualization/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。