skill-up:阿里开源 Agent Skill 评测框架,让 Skill 可评测可回归

lxiol
📝
阿里巴巴开源 skill-up(173⭐,Go,Apache-2.0),专为 Agent Skill 开发者设计的命令行评测框架。声明式 YAML 配置、expect+judge 分层判定、多引擎回放、多轮会话评测、CI 友好退出码。

原文链接:https://mp.weixin.qq.com/s/lTdRNB3vTJoU0nAPBkHNtw
作者:李斌
GitHub 验证:173⭐ / 13 forks / Go / Apache-2.0 / 创建 2026-05-09

Agent Skill 火了,但「它到底好不好用」没人能回答。skill-up 是阿里巴巴开源的 Agent Skill 命令行评测框架,目标是「让 Agent Skill 的每一次迭代都可被验证、可被回归」。

三个真实痛点

  1. Skill 悄悄退化 — 同事改了 SKILL.md 里一行描述,某些输入下不再调用预期工具,评审阶段没人发现
  2. 换引擎行为就变 — 同一个 Skill 在不同 Agent 引擎上输出结构完全不同,缺乏系统验证手段
  3. 评测逻辑散落各处 — 一堆脚本:安装 Skill → 调用 Agent → 解析输出 → 对比结果 → 生成报告,本地一套 CI 一套

skill-up 核心设计

声明式评测

在 Skill 目录下放 evals/eval.yaml + evals/cases/*.yaml

1
2
3
4
5
schema_version: v1alpha1
engine:
name: claude_code # 支持 claude_code/codex/qodercli/qwen_code
cases:
files: [evals/cases/create_plan.yaml]

运行 skill-up run ./evals/eval.yaml,逐用例执行并产出结构化报告 + JUnit XML + HTML 报告 + CI 友好退出码。

expect + judge 分层判定

层级 作用 特征
expect 本地零成本确定性检查 文件是否存在、输出是否含关键词、退出码
judge 深层语义判定 rule_based / script / agent_judge

廉价失败快速返回,CI 不会因 LLM 偶发抖动被无端阻断。

多引擎回放

同一份用例在 Claude Code / Codex / Qoder CLI / Qwen Code 上回放,取最大公约数即 Skill 的稳定行为边界。

多轮会话评测

post_condition(过程门卫)+ judge(最终裁判)分工:门卫负责「能不能继续」,裁判负责「最后成不成」。支持「危险操作必须先确认」这类跨轮逻辑验证。

重型端到端评测

真实代码仓库输入 → Skill 修改文件 → 产物级 diff 对比 → agent_judge 判断差异是否合理。集团内部约 1200 行手搓脚本迁移后变为声明式配置。

五分钟上手

1
2
3
4
5
6
7
# 路径 A:让 Agent 自动生成评测集
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a claude-code -y
# 然后在 Skill 目录说「评测当前 Skill」

# 路径 B:纯 CLI
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bash
skill-up run

开源仓库:github.com/alibaba/skill-up | 中文手册:alibaba.github.io/skill-up/zh

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: skill-up:阿里开源 Agent Skill 评测框架,让 Skill 可评测可回归
  • 作者: lxiol
  • 创建于 : 2026-07-27 10:30:00
  • 更新于 : 2026-07-27 09:04:00
  • 链接: https://blog.lxiol.cn/2026/07/27/skill-up-阿里Agent-Skill评测框架/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。