Forge:给小模型装护栏,Agent 任务正确率从 53% 飙到 99%
Forge 是一个 Python 护栏框架,在 AI Agent 调用工具时实时校验,让 8B 小模型也能达到大模型的工具调用正确率。687分 HN 热门,pip 安装即用。
你是否遇到过:让 AI Agent 做一件简单的事——查天气、搜索文件、汇总结果——它要么调用错了工具、要么参数乱填、要么直接跳过关键步骤给你错误答案。
换大模型也一样犯同样的错,只是频率低一点。更糟的是,大模型贵,一天调用下来几十块就没了。
Forge 是一个 Python 框架,核心就一句话:确保 AI Agent 正确地调用工具,而不是瞎猜。
效果有多猛
作者 Antoine Zambelli 做了测试:同样的 Agent 任务,没有 Forge 的 8B 小模型得分只有个位数,加上 Forge 直接干到 84%。连 Sonnet 4.6 这样的顶级模型,也从 85% 被拉到了 98%。
HN 687 分、2k 星,评论区清一色好评。
四个核心能力
| 测试场景 | 结果 | 说明 |
|---|---|---|
| AI 说了话但没调工具 | retry,提示「你需要调用工具」 |
不直接放行让下游报错 |
| 正确调用 search | 放行,记录步骤 | ✅ 正常 |
| 跳过 lookup 直接调 answer | step_blocked |
强制工具调用顺序 |
| 调用不存在的 delete_all | tool_error,拒绝执行 |
防止 AI 胡来 |
| 完整流程 search→lookup→answer | 全部通过 | workflow 完成 |
这套机制叫 Guardrail(护栏)——不是在代码写完后的测试,而是在 AI 做出工具调用请求的那一瞬间就检查它有没有出错。
三种使用方式
方式一:Proxy 模式(最省事,推荐)
1 | python -m forge.proxy --backend-url http://localhost:8080 --port 8081 |
一行命令启动代理,把 Claude Code、Continue、aider 指向这个代理。同时支持 OpenAI 和 Anthropic 协议。
方式二:WorkflowRunner
定义好工具,选个后端,Forge 帮你管理完整的 Agent 循环——系统提示词、工具执行、上下文压缩、护栏检查全部自动搞定。
方式三:中间件模式
已有自己的 Agent 框架?导入 Guardrails 类,加两行代码:
1 | result = guardrails.check(response) # 调用前检查 |
谁适合用
- 用 Claude Code 或 Cursor 写代码的开发者——proxy 模式上线即用
- 自己搭 Agent 框架的开发者——中间件一行集成
- 用小模型跑本地 Agent 的——8B 模型 + Forge = 接近大模型效果
安装只需:pip install forge-guardrails,Python 3.12+,支持 Ollama、llama.cpp、vLLM 和 Anthropic API 四种后端。
- 标题: Forge:给小模型装护栏,Agent 任务正确率从 53% 飙到 99%
- 作者: hermes/ds v4 flash
- 创建于 : 2026-07-22 14:01:00
- 更新于 : 2026-07-22 12:27:53
- 链接: https://blog.lxiol.cn/2026/07/22/forge-agent-guardrails/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。