你已经知道人工智能可以识别面孔、翻译语言和推荐歌曲。但这一切的真正动力是什么? 数据。 没有数据,人工智能就像一辆没有燃料的汽车——它根本无法前往任何地方。
在本课中,我们将探讨数据集是什么样子、人工智能使用的不同类型的数据,以及为什么数据的质量非常重要。
数据集是人工智能系统学习的有组织的信息集合。将其视为一个巨大的电子表格。
ImageNet 数据集包含超过 1400 万张手工标记图像,涉及 20,000 多个类别。研究人员花费了数年时间和数千名人类注释者来构建它。
人工智能处理两大类数据:
这些数据完全适合具有行和列的表格,例如银行交易日志或医院患者记录。每个字段都有明确的类型(数字、日期、类别)。
示例: 销售数据、传感器读数、调查回复。
这是不遵循固定格式的数据。它包括图像、视频、录音、电子邮件和社交媒体帖子。全球 80% 以上的数据是非结构化的。
**示例:**手机上的照片、语音消息、新闻文章。
以下哪项是非结构化数据的示例?
人类只需看到几张图片就可以学会识别狗。人工智能通常需要数千甚至数百万个示例才能做到同样的事情。这是因为人工智能对世界没有内在的理解。每一条知识都必须来自数据。
数据越多样化、越有代表性,人工智能就越能更好地适应新情况。仅接受金毛猎犬照片训练的模型可能无法识别贵宾犬。数据的多样性带来了人工智能的稳健性。
这就是为什么公司在收集、清理和整理大型数据集方面投入巨资的原因——这通常是构建人工智能系统中最耗时和最昂贵的部分。
好消息是,一旦存在高质量的数据集,就可以重复使用和共享,从而加速全球研究。
人工智能的好坏取决于它所学习的数据。如果数据混乱、不完整或不正确,人工智能将产生不可靠的结果。这个原则被称为垃圾进,垃圾出(GIGO)。
常见的数据质量问题包括:
想象一下,您正在准备考试,但课本的一半页丢失了,而且后面的一些答案是错误的。你会表现得如何?当人工智能使用低质量的数据进行训练时,就会发生这种情况。
一些数据集已在人工智能社区中广为人知:
|数据集|它包含什么 |尺寸| |------|------------------|------| | 图像网络 |带标签的照片|超过 1400 万张图像 | | 普通爬行 |来自互联网的网页| PB 级文本 | | 维基百科 |百科全书文章|超过 6000 万篇文章 | | MNIST |手写数字 (0–9) | 70,000 张图像 |
登录 参与讨论
这些数据集是免费提供的,并已用于训练历史上一些最有影响力的人工智能模型。
MNIST 数据集包含什么?
在人工智能能够从数据中学习之前,通常需要有人对其进行标记。这意味着告诉系统每个示例代表什么。
这个过程称为注释,它通常是由人类完成的 - 有时是数千人一起工作。
许多人工智能公司使用众包平台,世界各地的工作人员可以为每个项目的数据贴上几美分的价格。这是大多数人从未见过的大规模全球努力。
数据反映了它所来自的世界——包括世界的偏见。当一个数据集过度代表一个群体或低于另一个群体时,在其上训练的人工智能将继承这些不平衡。
数据偏差的真实例子:
见不仅仅是一个技术问题——它还是一个社会问题。每个数据集都包含创建它的人的假设和盲点。
如果你训练一个人工智能来推荐餐馆,但只给它提供伦敦的数据,它会给曼彻斯特的人提供好的推荐吗?可能会出现什么问题?
使用有偏差的数据训练人工智能最可能的结果是什么?
接下来,我们将研究实际处理所有这些数据并将其转化为智能的算法。