SKill测评:谁才是真正的Skill之王?
·
背景
2026年,Skill 的热度不减,已成为 AI 辅助编程领域的标配。在日常研发中,无论是沉淀个人经验,还是将团队的优秀范本标准化,将知识“蒸馏”为 Skill 已是大家的常规操作。但随之而来的问题是:一个 Skill 的“好坏”,究竟由谁定义?评判它的标准又是什么?
带着这个困惑,我近期翻阅了大量技术资料,也一直在寻找一套可量化的评测体系。巧合的是,阿里近期开源了一款名为 Skill-Up 的测评工具——它专门面向 Agent Skill 开发者,支持在 Claude Code、Codex、Qoder CLI 等真实 Agent Engine 环境中验证 Skill 的功能正确性,并可将失败用例转化为精准的修复指引,同时支持本地与 CI 环境的持续回归。
于是,就有了下面这次实践。
Skill-up是什么
skill-up 是一个面向 Agent Skill 的命令行评测工具。
具体目录结构如下
my-skill/
SKILL.md # 你的 Skill 定义
evals/ # 评测目录
eval.yaml # 评测入口配置
cases/ # 用例目录
basic-test.yaml # 一个评测用例
edge-case.yaml # 另一个评测用例
fixtures/ # 测试资源(可选)
repos/ # 仓库模板
scripts/ # 评估脚本
安装方式
使用 Skill-upper,也是推荐的方式
# Codex,全局安装
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a codex -y
也可以使用命令行安装,那你将可以使用纯命令运行,也很爽
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bash
关键命令
# 运行所有用例
skill-up run ./evals/eval.yaml
# 只运行匹配的用例
skill-up run ./evals/eval.yaml --include-case-name "basic-*"
# 排除特定用例
skill-up run ./evals/eval.yaml --exclude-case-name "*-old" --exclude-case-name "*-deprecated"
# 指定 Engine 和模型
skill-up run ./evals/eval.yaml --engine codex --model openai/gpt-4
# 临时覆盖用例并行数
skill-up run ./evals/eval.yaml --parallelism 4
# 启用基线对比
skill-up run ./evals/eval.yaml --baseline
# 生成多种格式报告
skill-up run ./evals/eval.yaml --format json --format html --format junit
# 连续运行 3 轮,产物分别写入 iteration-1/ 到 iteration-3/
skill-up run ./evals/eval.yaml --iteration 3
# 自动检测模式(直接消费 Anthropic evals.json)
skill-up run --auto
skill-up run --auto --engine codex
skill-up run ./my-skill/ --auto
如此代表安装成功

通过codex也能唤起

创建并运行第一组评测

Demo测评的报告结果

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐



所有评论(0)