Waza:微软开源的 AI Skill 质量检查器
Skill 写完了,你怎么知道它真的好用?光看 SKILL.md 写得顺不顺还不够。规范有没有问题、测试有没有覆盖、工具调用是否符合预期……都需要跑起来验证。
微软开源的 Waza,是一套面向 AI Agent Skill 的命令行评测工具。它既可以检查 Skill 本身是否准备完整,也可以通过评测任务实际运行 Skill,再用评分器验证输出、文件变化、工具调用、Skill 调用等行为。
Waza 里有两类检查值得说下。waza check 负责提交准备检查:检查 Frontmatter、Token 预算、是否存在 eval.yaml、是否符合 Agent Skills 规范,以及一些结构和可维护性问题。任务效果通过 waza run 执行评测,再由评分器给出分数、是否通过和具体反馈。
还有一个挺实用的 waza spec verify:它会检查 SKILL.md 里声明的能力和使用边界,有没有对应的测试任务覆盖。也就是说,既要检查“Skill 写得对不对”,也要检查“该测的东西到底测没测”。
已有 Skill,可以先用 waza new eval my-skill 生成评测骨架,补上测试任务、测试数据和评分规则,再运行 waza run my-skill。后面 Skill 或模型有调整,继续跑同一套评测,就能比较不同版本或模型的结果,也可以接进 CI 做回归检查。
Waza 更适合已经开始认真维护 Skill 的个人开发者和 Agent 工程团队。它解决的问题很直接:别只凭感觉判断 Skill 好不好用,把测试跑出来,再看结果。
使用上需要注意,默认评测链路需要 GitHub Copilot 使用权限,也可以配置自定义的 Copilot SDK 模型提供方。
开源项目 waza skill Agent AI工程 开发者工具 评测工具 GitHub 微软开源





