skill-up:阿里开源 Agent Skill 评测框架,让 Skill 可评测可回归
阿里巴巴开源 skill-up(173⭐,Go,Apache-2.0),专为 Agent Skill 开发者设计的命令行评测框架。声明式 YAML 配置、expect+judge 分层判定、多引擎回放、多轮会话评测、CI 友好退出码。
原文链接:https://mp.weixin.qq.com/s/lTdRNB3vTJoU0nAPBkHNtw
作者:李斌
GitHub 验证:173⭐ / 13 forks / Go / Apache-2.0 / 创建 2026-05-09
Agent Skill 火了,但「它到底好不好用」没人能回答。skill-up 是阿里巴巴开源的 Agent Skill 命令行评测框架,目标是「让 Agent Skill 的每一次迭代都可被验证、可被回归」。
三个真实痛点
- Skill 悄悄退化 — 同事改了 SKILL.md 里一行描述,某些输入下不再调用预期工具,评审阶段没人发现
- 换引擎行为就变 — 同一个 Skill 在不同 Agent 引擎上输出结构完全不同,缺乏系统验证手段
- 评测逻辑散落各处 — 一堆脚本:安装 Skill → 调用 Agent → 解析输出 → 对比结果 → 生成报告,本地一套 CI 一套
skill-up 核心设计
声明式评测
在 Skill 目录下放 evals/eval.yaml + evals/cases/*.yaml:
1 | schema_version: v1alpha1 |
运行 skill-up run ./evals/eval.yaml,逐用例执行并产出结构化报告 + JUnit XML + HTML 报告 + CI 友好退出码。
expect + judge 分层判定
| 层级 | 作用 | 特征 |
|---|---|---|
| expect | 本地零成本确定性检查 | 文件是否存在、输出是否含关键词、退出码 |
| judge | 深层语义判定 | rule_based / script / agent_judge |
廉价失败快速返回,CI 不会因 LLM 偶发抖动被无端阻断。
多引擎回放
同一份用例在 Claude Code / Codex / Qoder CLI / Qwen Code 上回放,取最大公约数即 Skill 的稳定行为边界。
多轮会话评测
post_condition(过程门卫)+ judge(最终裁判)分工:门卫负责「能不能继续」,裁判负责「最后成不成」。支持「危险操作必须先确认」这类跨轮逻辑验证。
重型端到端评测
真实代码仓库输入 → Skill 修改文件 → 产物级 diff 对比 → agent_judge 判断差异是否合理。集团内部约 1200 行手搓脚本迁移后变为声明式配置。
五分钟上手
1 | # 路径 A:让 Agent 自动生成评测集 |
开源仓库:github.com/alibaba/skill-up | 中文手册:alibaba.github.io/skill-up/zh
本文转载自微信公众号,如有侵权请联系删除。
- 标题: skill-up:阿里开源 Agent Skill 评测框架,让 Skill 可评测可回归
- 作者: lxiol
- 创建于 : 2026-07-27 10:30:00
- 更新于 : 2026-07-27 09:04:00
- 链接: https://blog.lxiol.cn/2026/07/27/skill-up-阿里Agent-Skill评测框架/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。