AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🤝 Claude Cowork 入门›课程›验证 Skills 用于插件
✅
Claude Cowork 入门 • 高级⏱️ 8 分钟阅读

验证 Skills 用于插件

验证 plugins 的 skills

在本课程中,你将解释什么是评估以及为什么在分享或依赖 skill 之前它很重要,并通过 skill-creator 运行轻量级评估。

为什么这很重要

当你构建一个 skill 或将它们打包成 plugin 时,你本质上是在构建一个其他人将使用的小型产品。就像你会交给同事的任何东西——模板、电子表格模型、清单——在它离开你的办公桌之前值得试驾一下。

当你使用你构建的 skill 时,你知道如何绕过任何问题或失败。你确切地知道该问什么、给它什么文件,以及答案应该是什么样子。队友没有这些。他们可能措辞略有不同,给出略有不同的输入,或者遇到边缘情况——一种不寻常但真实的情况,比如请求刚好超出 skill 设计范围之外。这就是 skill 倾向于出错的地方,使用它的人不会知道为什么。

使用评估(evaluations 的缩写)测试 skill 是你在别人遇到之前捕获这些错误的方式。评估只是一次试用:一个真实的请求进去,你查看输出,然后告诉 Claude 修复什么。没有代码,没有测试脚本——只有你对结果是否足够好以署你名字的判断。

评估系统如何工作

当你使用 skill-creator(Claude 内置的创建 skills 的助手)构建 skill 时,它会将评估作为过程的一部分引导你完成。

Skill-creator 想出两个或更多有人可能会用于你的 skill 的真实提示。对于每个提示,它产生一对输出:

  • 一个 Claude 使用你的 skill 的版本
  • 一个 Claude 不使用 你的 skill 回答相同提示的版本

第二个是对比点。它的存在是为了让你并排看到你的 skill 实际上产生了什么差异——不仅仅是 "这个输出可以吗",而是 "这个输出是否比 Claude 自己做的更好"。

审查每一对并用普通英语在审查页面上提供反馈。当你阅读每一对时,你实际上只是在回答两个问题:

  • skill 版本是我会使用的那个吗?如果是,很好——注意是什么让它更好,这样 skill 继续这样做。
  • 如果不是,什么缺失或不对?要具体。"语气太正式" 或 "跳过了执行摘要" 给了 Claude 可以采取行动的内容;"这不太对" 则没有。

一旦你提交反馈,Claude 会根据你所说的内容为你修改 skill。

迭代 skill

你的反馈就是修复。一旦你提交,Claude 会更新 skill——重写指令、调整示例、收紧它要求的内容——你可以再次运行相同的提示以查看更改是否有效。

一次更改一件事。如果第一轮显示 skill 太啰嗦 且 缺少一个部分,选择更重要的那个,修复它,重新运行,然后再回来审查。你将能够判断什么真正推动了改进。如果在修订后你仍然对输出不满意,再次运行它——这是一个循环,不是一个一次性的门槛。大多数 skills 在一两次轮次后就准备好了。发布 skill 的标准——给自己、给队友——不是完美的评估。而是你关心的案例比基线有意义地更好,并且你已经命名了你尚未处理的案例。

如果输出在第一次就看起来很好呢?你完成了。评估不是需要跳过的障碍——它们是当你需要信心时使用的,而不是仪式。

立即尝试

逐步完成一个模拟评估审查——三个提示,每个都有使用 skill 和不使用 skill 的输出并排。对于每一对:选择你实际会发送的版本,并写一行你会给 Claude 的反馈。这就是整个循环。

下一步

在下一课中,你将从 "这对我有用" 转向 "这对团队有用" — 将个人工作流转变为共享基础设施的模式和选择。

第 24 课,共 28 课已完成 0%
←冲突解决

讨论

登录 参与讨论