AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🌿 AI 萌芽›课程›训练AI模型
🏋️
AI 萌芽 • 入门⏱️ 15 分钟阅读

训练AI模型

训练人工智能模型

您现在知道神经网络通过调整权重和偏差来学习。但完整的培训过程实际上是如何进行的呢?你怎么知道模型什么时候已经学得足够了——或者太多了?在本课中,我们将走过完整的训练历程。

训练循环

训练人工智能模型遵循一个不断重复的循环:

  1. 预测 - 通过模型输入数据并获得预测。
  2. 比较 - 检查预测与正确答案的差距。
  3. 调整 - 更新权重以减少误差。
  4. 重复 - 使用下一批数据再次执行此操作。

这个循环运行数千甚至数百万次。每次重复都会使模型稍微接近正确答案。

显示训练循环的圆形图:预测、比较、调整、重复,箭头连接循环中的每个步骤
训练循环是人工智能学习的心跳——预测、比较、调整和重复。
🤯

据报道,仅训练 GPT-4 的计算能力就花费了超过 1 亿美元。训练循环在数千个专用芯片上运行了数月。

损失函数:模型有多错?

每次预测之后,我们需要一种方法来衡量模型的“错误程度”。这种测量称为损失(或成本),计算它的公式是损失函数。

  • 低损失 = 预测接近正确答案。
  • 高损失 = 预测相差甚远。

把它想象成一个飞镖靶。靶心就是正确答案。损失是从飞镖落地点到靶心的距离。训练的目标是随着时间的推移最小化该距离。

常见的损失函数包括:

  • 均方误差 (MSE) - 测量预测值与实际值之间的平均平方距离。用于预测数字。
  • 交叉熵损失 - 衡量预测概率与真实类别的匹配程度。用于分类任务。
🧠小测验

损失函数在人工智能训练中衡量什么?

Epochs:数据被浏览了多少次?

对整个训练数据集的一次完整遍历称为纪元。训练通常涉及许多时期 - 模型多次看到相同的数据,每轮都会稍微好一点。

  • Epoch 1: 该模型犯了很多错误;损失很高。
  • Epoch 10: 模型有了显着改进;损失正在下降。
  • 第 50 纪元: 改进速度减慢;该模型已接近最佳状态。
  • 纪元 200: 模型可能会开始记忆 - 这将我们带到下一个主题。
🤔
Think about it:

考试复习就像跑纪元。第一次阅读会令人困惑,但每次阅读都会加深理解。但是,如果您将相同的笔记重新阅读一百遍,您可能会记住确切的措辞,但无法真正理解概念。人工智能也有同样的问题。

过度拟合:记忆力强的学生

过度拟合是人工智能训练中最常见的问题之一。当模型对训练数据学习得“太好”(包括其噪声和怪癖)并且无法对新的、看不见的数据执行时,就会发生这种情况。

想象一下,一个学生逐字逐句地记住过去的每一篇试卷。他们在旧试卷上得分很高,但在问题稍有变化时就会表现不佳。学生还没有学过这门课——他们已经记住了答案。

过度拟合的迹象:

  • 训练准确率非常高(例如 99%)。
第 4 课,共 16 课已完成 0%
←神经网络入门

讨论

登录 参与讨论

  • 新数据的性能要差得多(例如 75%)。
  • 该模型基本上已经记住了训练示例。
  • 💡

    练的目标不是在模型已经看到的数据上获得完美的分数。它能够在以前“从未”见过的数据上表现良好。这才是学习的真正考验。

    欠拟合:不学习的学生

    相反的问题是欠拟合。当模型没有从数据中学到足够的知识时就会发生这种情况。它在训练数据和新数据上都表现不佳。

    欠拟合的原因包括:

    • 对于问题的复杂性来说,模型过于简单。
    • 训练停止得太早(没有足够的时期)。
    • 数据中的特征信息不够丰富。

    如果说过拟合就像背过去的试卷,那么欠拟合就像刚打开课本就走进考试。

    🧠小测验

    模型在训练数据上的准确度为 98%,但在新数据上的准确度仅为 60%。最有可能出现的问题是什么?

    验证和测试集

    为了检测过度拟合和欠拟合,我们将数据分为三个部分:

    |设置|目的|使用时 | |-----|---------|------------| | 训练集 |该模型从这些数据中学习 |训练期间 | | 验证集 |用于检查进度和调整设置 |训练期间 | | 测试集 |对完全看不见的数据的最终评估|训练后|

    常见的划分是 70% 训练、15% 验证和 15% 测试。模型直到最后才永远不会看到测试集 - 这是期末考试。

    🤔
    Think about it:

    验证集就像您在学习课程之间进行的练习测试。它可以告诉您您的学习情况,而不会破坏真正的考试。如果你的练习测试分数开始下降,而你的学习笔记分数却不断上升,你就知道出了问题。

    何时停止训练

    知道何时停止至关重要。训练太少,模型拟合不足。训练太多就会过度适应。最佳点是验证损失停止改善。

    一种称为“提前停止”的技术可以自动执行此操作:

    1. 监控每个 epoch 后的验证损失。
    2. 如果在一定数量的 epoch 内没有改善(称为 耐心),请停止训练。
    3. 回滚到最佳时期的权重。

    这可以防止模型超越有用的学习点并陷入记忆。

    🧠小测验

    什么是人工智能训练中的”提前停止”?

    🤯

    一些现代训练运行使用一种称为学习率调度的技术,该技术逐渐减少每一步权重的变化——就像当你接近山顶时采取更小、更小心的步骤。

    要点

    • 训练循环重复:预测→比较→调整→重复。
    • 损失函数衡量预测与事实的差距。
    • epoch 是对训练数据的一次完整遍历。
    • 过度拟合意味着记忆数据; 欠拟合意味着学习得不够。
    • 数据分为训练、验证和测试集。
    • 提前停止可以防止训练走得太远。

    在最后一课中,我们将探讨人工智能的道德维度——偏见、公平、隐私以及负责任的人工智能是什么样子。