在本课程中,你将解释什么是评估以及为什么在分享或依赖 skill 之前它很重要,并通过 skill-creator 运行轻量级评估。
当你构建一个 skill 或将它们打包成 plugin 时,你本质上是在构建一个其他人将使用的小型产品。就像你会交给同事的任何东西——模板、电子表格模型、清单——在它离开你的办公桌之前值得试驾一下。
当你使用你构建的 skill 时,你知道如何绕过任何问题或失败。你确切地知道该问什么、给它什么文件,以及答案应该是什么样子。队友没有这些。他们可能措辞略有不同,给出略有不同的输入,或者遇到边缘情况——一种不寻常但真实的情况,比如请求刚好超出 skill 设计范围之外。这就是 skill 倾向于出错的地方,使用它的人不会知道为什么。
使用评估(evaluations 的缩写)测试 skill 是你在别人遇到之前捕获这些错误的方式。评估只是一次试用:一个真实的请求进去,你查看输出,然后告诉 Claude 修复什么。没有代码,没有测试脚本——只有你对结果是否足够好以署你名字的判断。
当你使用 skill-creator(Claude 内置的创建 skills 的助手)构建 skill 时,它会将评估作为过程的一部分引导你完成。
Skill-creator 想出两个或更多有人可能会用于你的 skill 的真实提示。对于每个提示,它产生一对输出:
第二个是对比点。它的存在是为了让你并排看到你的 skill 实际上产生了什么差异——不仅仅是 "这个输出可以吗",而是 "这个输出是否比 Claude 自己做的更好"。
审查每一对并用普通英语在审查页面上提供反馈。当你阅读每一对时,你实际上只是在回答两个问题:
一旦你提交反馈,Claude 会根据你所说的内容为你修改 skill。
你的反馈就是修复。一旦你提交,Claude 会更新 skill——重写指令、调整示例、收紧它要求的内容——你可以再次运行相同的提示以查看更改是否有效。
一次更改一件事。如果第一轮显示 skill 太啰嗦 且 缺少一个部分,选择更重要的那个,修复它,重新运行,然后再回来审查。你将能够判断什么真正推动了改进。如果在修订后你仍然对输出不满意,再次运行它——这是一个循环,不是一个一次性的门槛。大多数 skills 在一两次轮次后就准备好了。发布 skill 的标准——给自己、给队友——不是完美的评估。而是你关心的案例比基线有意义地更好,并且你已经命名了你尚未处理的案例。
如果输出在第一次就看起来很好呢?你完成了。评估不是需要跳过的障碍——它们是当你需要信心时使用的,而不是仪式。
逐步完成一个模拟评估审查——三个提示,每个都有使用 skill 和不使用 skill 的输出并排。对于每一对:选择你实际会发送的版本,并写一行你会给 Claude 的反馈。这就是整个循环。
在下一课中,你将从 "这对我有用" 转向 "这对团队有用" — 将个人工作流转变为共享基础设施的模式和选择。
登录 参与讨论