AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🌿 AI 萌芽›课程›数据如何驱动AI
📊
AI 萌芽 • 入门⏱️ 12 分钟阅读

数据如何驱动AI

数据如何为人工智能提供动力

你已经知道人工智能可以识别面孔、翻译语言和推荐歌曲。但这一切的真正动力是什么? 数据。 没有数据,人工智能就像一辆没有燃料的汽车——它根本无法前往任何地方。

在本课中,我们将探讨数据集是什么样子、人工智能使用的不同类型的数据,以及为什么数据的质量非常重要。

什么是数据集?

数据集是人工智能系统学习的有组织的信息集合。将其视为一个巨大的电子表格。

  • 行代表个别示例(例如,一张猫的照片、一份患者记录)。
  • 列代表特征 - 正在测量的特征(例如年龄、颜色、尺寸)。
  • 标签是我们希望人工智能预测的答案(例如“猫”或“狗”)。
一个简单的数据集表,显示动物图像行,其中包含颜色和大小等特征的列,以及显示猫或狗的标签列
数据集就像一个组织良好的电子表格,其中每一行都是一个示例,每一列都是一个特征。
🤯

ImageNet 数据集包含超过 1400 万张手工标记图像,涉及 20,000 多个类别。研究人员花费了数年时间和数千名人类注释者来构建它。

数据类型

人工智能处理两大类数据:

结构化数据

这些数据完全适合具有行和列的表格,例如银行交易日志或医院患者记录。每个字段都有明确的类型(数字、日期、类别)。

示例: 销售数据、传感器读数、调查回复。

非结构化数据

这是不遵循固定格式的数据。它包括图像、视频、录音、电子邮件和社交媒体帖子。全球 80% 以上的数据是非结构化的。

**示例:**手机上的照片、语音消息、新闻文章。

🧠小测验

以下哪项是非结构化数据的示例?

为什么人工智能需要这么多数据?

人类只需看到几张图片就可以学会识别狗。人工智能通常需要数千甚至数百万个示例才能做到同样的事情。这是因为人工智能对世界没有内在的理解。每一条知识都必须来自数据。

数据越多样化、越有代表性,人工智能就越能更好地适应新情况。仅接受金毛猎犬照片训练的模型可能无法识别贵宾犬。数据的多样性带来了人工智能的稳健性。

这就是为什么公司在收集、清理和整理大型数据集方面投入巨资的原因——这通常是构建人工智能系统中最耗时和最昂贵的部分。

好消息是,一旦存在高质量的数据集,就可以重复使用和共享,从而加速全球研究。

数据质量:垃圾输入,垃圾输出

人工智能的好坏取决于它所学习的数据。如果数据混乱、不完整或不正确,人工智能将产生不可靠的结果。这个原则被称为垃圾进,垃圾出(GIGO)。

常见的数据质量问题包括:

  • 缺失值 - 空白字段会在人工智能可以学习的内容中留下空白。
  • 重复 - 同一示例多次出现,从而扭曲了模型。
  • 不正确的标签 - 一张被标记为猫的狗的照片混淆了学习过程。
  • 过时的信息 - 对 2005 年数据的培训不会反映 2025 年的趋势。
🤔
Think about it:

想象一下,您正在准备考试,但课本的一半页丢失了,而且后面的一些答案是错误的。你会表现得如何?当人工智能使用低质量的数据进行训练时,就会发生这种情况。

真实世界数据集

一些数据集已在人工智能社区中广为人知:

|数据集|它包含什么 |尺寸| |------|------------------|------| | 图像网络 |带标签的照片|超过 1400 万张图像 | | 普通爬行 |来自互联网的网页| PB 级文本 | | 维基百科 |百科全书文章|超过 6000 万篇文章 | | MNIST |手写数字 (0–9) | 70,000 张图像 |

第 1 课,共 16 课已完成 0%
←返回学习计划

讨论

登录 参与讨论

这些数据集是免费提供的,并已用于训练历史上一些最有影响力的人工智能模型。

🧠小测验

MNIST 数据集包含什么?

数据标签和注释

在人工智能能够从数据中学习之前,通常需要有人对其进行标记。这意味着告诉系统每个示例代表什么。

  • 照片被标记为“猫”或“狗”。
  • 句子被标记为“积极情绪”或“消极情绪”。
  • 医生将医学扫描注释为“健康”或“异常”。

这个过程称为注释,它通常是由人类完成的 - 有时是数千人一起工作。

🤯

许多人工智能公司使用众包平台,世界各地的工作人员可以为每个项目的数据贴上几美分的价格。这是大多数人从未见过的大规模全球努力。

数据偏差:当数据出错时

数据反映了它所来自的世界——包括世界的偏见。当一个数据集过度代表一个群体或低于另一个群体时,在其上训练的人工智能将继承这些不平衡。

数据偏差的真实例子:

  • 主要针对男性简历进行训练的招聘算法学会了惩罚女性申请人。
  • 主要针对浅肤色进行训练的面部识别系统在深色肤色上表现不佳。
  • 根据一个国家的数据进行训练的医疗人工智能错过了其他人群中常见的症状。
💡

见不仅仅是一个技术问题——它还是一个社会问题。每个数据集都包含创建它的人的假设和盲点。

🤔
Think about it:

如果你训练一个人工智能来推荐餐馆,但只给它提供伦敦的数据,它会给曼彻斯特的人提供好的推荐吗?可能会出现什么问题?

🧠小测验

使用有偏差的数据训练人工智能最可能的结果是什么?

要点

  • 数据集是人工智能学习的有组织的示例集合。
  • 数据可以是结构化(表格)或非结构化(图像、文本、音频)。
  • 数据质量直接决定AI质量——垃圾输入,垃圾输出。
  • 标签是人类的努力,它教导人工智能每个示例的含义。
  • 数据中的偏差会导致人工智能中的偏差 - 并且会产生现实世界的后果。

接下来,我们将研究实际处理所有这些数据并将其转化为智能的算法。