您已经训练了一个模型。损失下降了。但这真的“好”吗?答案完全取决于你如何衡量它——选择错误的指标可能会给你带来危险的误导性信心。本课程涵盖每个人工智能从业者必须了解的指标。
准确度 = 正确预测 ÷ 总预测。听起来很合理——直到你遇到类别不平衡。
想象一个欺诈检测模型。在 10,000 笔交易中,只有 50 笔是欺诈交易。一个简单地预测每笔交易“不是欺诈”的模型可以实现 99.5% 的准确度 - 同时发现零欺诈。完全没用,但准确性看起来很棒。
这就是为什么对于现实世界的人工智能来说,仅靠准确性是不够的。
在罕见疾病的医学筛查中,始终预测“健康”的模型准确率可以超过 99.9%。这就是为什么医生和数据科学家依赖敏感性(召回率)作为筛选测试的主要指标。
在深入研究更好的指标之前,我们需要混淆矩阵 - 一个 2×2 的表来分解每个预测:
| |预测为阳性 |预测为负 | |---|---|---| | 实际上是积极的 |真阳性 (TP) |假阴性 (FN) | | 实际上是负面的 |误报 (FP) |真阴性 (TN) |
具体示例 - 对 1,000 封电子邮件进行垃圾邮件过滤(100 封垃圾邮件,900 封合法邮件):
| |预测垃圾邮件 |预测合法 | |---|---|---| | 实际上是垃圾邮件 | 80(TP)| 20(FN)| | 实际上合法 | 30(FP)| 870(田纳西州)|
从这个表中,我们可以得出每个分类指标。
Precision = TP ÷ (TP + FP) = 80 ÷ (80 + 30) = 72.7%
在我们的垃圾邮件过滤器中:在所有标记为垃圾邮件的电子邮件中,72.7% 实际上是垃圾邮件。另外 27.3% 是被错误捕获的合法电子邮件 - 误报。
**当精度最重要时:**当误报代价高昂时。将重要客户电子邮件发送到垃圾邮件的垃圾邮件过滤器是一个严重的问题。
Recall = TP ÷ (TP + FN) = 80 ÷ (80 + 20) = 80%
该模型捕获了 100 封实际垃圾邮件中的 80 封 - 它“召回”了其中的 80%。另外 20 个因漏报而漏掉了。
**当回忆最重要时:**当错过阳性病例时是危险的。在癌症筛查中,未能检测到肿瘤(假阴性)可能会夺去生命。
一家医院想要一个模型来筛查危险疾病。他们应该优先考虑哪个指标?
精确率和召回率朝相反的方向发展。收紧垃圾邮件阈值会捕获更少的合法电子邮件(精确度上升),但会允许更多垃圾邮件通过(召回率下降)。放松它会捕获更多垃圾邮件(召回率上升),但会捕获更多优质电子邮件(精确度下降)。
天下没有免费的午餐 - 您必须决定哪些错误对于您的特定用例来说代价更高。
当您需要一个平衡精度和召回率的数字时,请使用 F1 分数:
F1 = 2 × (Precision × Recall) ÷ (Precision + Recall)
登录 参与讨论
对于我们的垃圾邮件过滤器:F1 = 2 × (0.727 × 0.80) ÷ (0.727 + 0.80) = 0.762 - 约 76.2%。
调和平均值惩罚极端不平衡。如果精确率或召回率非常低,F1 就会急剧下降。
内容审核系统的精确度为 95%,但召回率仅为 30%。 F1分数仅为46%。这告诉您有关系统现实世界行为的哪些信息?您会部署它吗?
ROC 曲线(接收者操作特征)绘制了每个可能的分类阈值下的真阳性率与假阳性率。它显示了模型在所有阈值(而不仅仅是一个阈值)上区分类别的效果如何。
AUC(曲线下面积)将其总结为一个数字:
AUC 与阈值无关,因此非常适合在决定特定操作点之前比较模型。
AUC 0.5 意味着什么?
分类指标不适用于生成文本的语言模型。不同的任务需要不同的措施。
BLEU(双语评估研究)测量生成的翻译与参考翻译的重叠程度,计算匹配的 n-gram(单词序列)。分数范围为 0 到 1。
BLEU 广泛应用于机器翻译,但有很大的局限性:它奖励单词重叠,而不是意义。尽管含义相似,“猫坐在垫子上”和“猫躺在地毯上”的得分却很差。
困惑度衡量语言模型对新文本的惊讶程度。越低越好 - 困惑度为 20 意味着模型平均在 20 个同样可能的下一个单词中进行选择。一个好的模型具有较低的复杂性,因为它可以很好地预测文本。
GPT-4 对英文文本的困惑度非常低,反映出其强大的语言理解能力。
BLEU 指标于 2002 年推出,并迅速成为机器翻译评估的标准。尽管存在已知的缺陷,但它在近二十年中仍然占据主导地位,因为没有简单的替代方案能够始终与人类判断更好地相关。
离线指标是必要的,但还不够。最终的测试是A/B 测试:将两个模型版本部署到不同的用户组并衡量现实世界的结果。
由于用户的行为不可预测,生产指标通常与离线指标有所不同。
为什么具有出色离线指标的模型在 A/B 测试中表现不佳?
|场景|主要指标 | |----------|--------------| |平衡分类|准确度,F1 | |类别不平衡 |准确率、召回率、AUC | |医疗检查 |召回率(灵敏度)| |垃圾邮件过滤 |精度+召回率平衡 | |机器翻译 |蓝色、流星| |语言模型质量 |困惑| |生产影响| A/B 测试结果 |
您正在构建自动驾驶汽车的行人检测系统。假阴性意味着没有看到行人;误报意味着刹车出现阴影。您优化哪个指标,您愿意接受什么权衡?