AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🌿 AI 萌芽›课程›评估指标
📊
AI 萌芽 • 中级⏱️ 15 分钟阅读

评估指标

评估指标 - 你的人工智能真的好吗?

您已经训练了一个模型。损失下降了。但这真的“好”吗?答案完全取决于你如何衡量它——选择错误的指标可能会给你带来危险的误导性信心。本课程涵盖每个人工智能从业者必须了解的指标。

准确性陷阱

准确度 = 正确预测 ÷ 总预测。听起来很合理——直到你遇到类别不平衡。

想象一个欺诈检测模型。在 10,000 笔交易中,只有 50 笔是欺诈交易。一个简单地预测每笔交易“不是欺诈”的模型可以实现 99.5% 的准确度 - 同时发现零欺诈。完全没用,但准确性看起来很棒。

这就是为什么对于现实世界的人工智能来说,仅靠准确性是不够的。

🤯

在罕见疾病的医学筛查中,始终预测“健康”的模型准确率可以超过 99.9%。这就是为什么医生和数据科学家依赖敏感性(召回率)作为筛选测试的主要指标。

混淆矩阵

在深入研究更好的指标之前,我们需要混淆矩阵 - 一个 2×2 的表来分解每个预测:

| |预测为阳性 |预测为负 | |---|---|---| | 实际上是积极的 |真阳性 (TP) |假阴性 (FN) | | 实际上是负面的 |误报 (FP) |真阴性 (TN) |

具体示例 - 对 1,000 封电子邮件进行垃圾邮件过滤(100 封垃圾邮件,900 封合法邮件):

| |预测垃圾邮件 |预测合法 | |---|---|---| | 实际上是垃圾邮件 | 80(TP)| 20(FN)| | 实际上合法 | 30(FP)| 870(田纳西州)|

从这个表中,我们可以得出每个分类指标。

垃圾邮件过滤器的混淆矩阵,具有四个象限颜色编码:绿色表示 TP 和 TN,红色表示 FP 和 FN,并附有精确度和召回率公式
混淆矩阵是所有分类指标的基础。

精确度 - “在我标记的所有内容中,有多少是正确的?”

Precision = TP ÷ (TP + FP) = 80 ÷ (80 + 30) = 72.7%

在我们的垃圾邮件过滤器中:在所有标记为垃圾邮件的电子邮件中,72.7% 实际上是垃圾邮件。另外 27.3% 是被错误捕获的合法电子邮件 - 误报。

**当精度最重要时:**当误报代价高昂时。将重要客户电子邮件发送到垃圾邮件的垃圾邮件过滤器是一个严重的问题。

回想一下 - “在所有积极的事情中,我发现了多少?”

Recall = TP ÷ (TP + FN) = 80 ÷ (80 + 20) = 80%

该模型捕获了 100 封实际垃圾邮件中的 80 封 - 它“召回”了其中的 80%。另外 20 个因漏报而漏掉了。

**当回忆最重要时:**当错过阳性病例时是危险的。在癌症筛查中,未能检测到肿瘤(假阴性)可能会夺去生命。

🧠小测验

一家医院想要一个模型来筛查危险疾病。他们应该优先考虑哪个指标?

精确率与召回率的权衡

精确率和召回率朝相反的方向发展。收紧垃圾邮件阈值会捕获更少的合法电子邮件(精确度上升),但会允许更多垃圾邮件通过(召回率下降)。放松它会捕获更多垃圾邮件(召回率上升),但会捕获更多优质电子邮件(精确度下降)。

天下没有免费的午餐 - 您必须决定哪些错误对于您的特定用例来说代价更高。

F1 分数 - 调和平均值

当您需要一个平衡精度和召回率的数字时,请使用 F1 分数:

F1 = 2 × (Precision × Recall) ÷ (Precision + Recall)
第 10 课,共 16 课已完成 0%
←嵌入与向量数据库

讨论

登录 参与讨论

对于我们的垃圾邮件过滤器:F1 = 2 × (0.727 × 0.80) ÷ (0.727 + 0.80) = 0.762 - 约 76.2%。

调和平均值惩罚极端不平衡。如果精确率或召回率非常低,F1 就会急剧下降。

🤔
Think about it:

内容审核系统的精确度为 95%,但召回率仅为 30%。 F1分数仅为46%。这告诉您有关系统现实世界行为的哪些信息?您会部署它吗?

ROC 曲线和 AUC

ROC 曲线(接收者操作特征)绘制了每个可能的分类阈值下的真阳性率与假阳性率。它显示了模型在所有阈值(而不仅仅是一个阈值)上区分类别的效果如何。

AUC(曲线下面积)将其总结为一个数字:

  • AUC = 1.0 - 完美分离。
  • AUC = 0.5 - 并不比随机猜测(对角线)更好。
  • AUC < 0.5 - 比随机更差(你的标签可能会被翻转!)。

AUC 与阈值无关,因此非常适合在决定特定操作点之前比较模型。

🧠小测验

AUC 0.5 意味着什么?

文本生成指标

分类指标不适用于生成文本的语言模型。不同的任务需要不同的措施。

BLEU 分数

BLEU(双语评估研究)测量生成的翻译与参考翻译的重叠程度,计算匹配的 n-gram(单词序列)。分数范围为 0 到 1。

BLEU 广泛应用于机器翻译,但有很大的局限性:它奖励单词重叠,而不是意义。尽管含义相似,“猫坐在垫子上”和“猫躺在地毯上”的得分却很差。

困惑

困惑度衡量语言模型对新文本的惊讶程度。越低越好 - 困惑度为 20 意味着模型平均在 20 个同样可能的下一个单词中进行选择。一个好的模型具有较低的复杂性,因为它可以很好地预测文本。

GPT-4 对英文文本的困惑度非常低,反映出其强大的语言理解能力。

🤯

BLEU 指标于 2002 年推出,并迅速成为机器翻译评估的标准。尽管存在已知的缺陷,但它在近二十年中仍然占据主导地位,因为没有简单的替代方案能够始终与人类判断更好地相关。

生产中的 A/B 测试

离线指标是必要的,但还不够。最终的测试是A/B 测试:将两个模型版本部署到不同的用户组并衡量现实世界的结果。

  • 新的推荐模式是否会提高点击率?
  • 改进的聊天机器人是否减少了支持请求升级?
  • 更新后的垃圾邮件过滤器收到的“非垃圾邮件”纠正是否较少?

由于用户的行为不可预测,生产指标通常与离线指标有所不同。

🧠小测验

为什么具有出色离线指标的模型在 A/B 测试中表现不佳?

何时使用哪个指标

|场景|主要指标 | |----------|--------------| |平衡分类|准确度,F1 | |类别不平衡 |准确率、召回率、AUC | |医疗检查 |召回率(灵敏度)| |垃圾邮件过滤 |精度+召回率平衡 | |机器翻译 |蓝色、流星| |语言模型质量 |困惑| |生产影响| A/B 测试结果 |

🤔
Think about it:

您正在构建自动驾驶汽车的行人检测系统。假阴性意味着没有看到行人;误报意味着刹车出现阴影。您优化哪个指标,您愿意接受什么权衡?

要点

  • 准确性因不平衡数据而产生误导 - 始终检查混淆矩阵。
  • 精度衡量阳性预测的正确性; 回忆衡量完整性。
  • F1 平衡两者; AUC 对所有阈值进行评估。
  • 文本生成使用 BLEU 和 perplexity 而不是分类指标。
  • A/B 测试是衡量现实世界模型影响的黄金标准。

📚 进一步阅读

  • Google ML 速成课程 - 分类指标 - 精度、召回率和 ROC 曲线的交互式演练
  • 迈向数据科学 - 超越准确性 - 实用指南,包含指标选择的真实示例