AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🌿 AI 萌芽›课程›理解大型语言模型
🔤
AI 萌芽 • 中级⏱️ 15 分钟阅读

理解大型语言模型

理解大型语言模型 🔤

ChatGPT、Claude、Gemini、Llama — 他们无处不在。但当这些东西回复你的消息时,它们实际上在做什么呢?答案比你想象的更简单、更令人费解。

大型语言模型 (LLM) 的核心是做一件事:预测下一个标记。反复。就是这样。然而,从这个简单的过程中,就出现了编写代码、解释量子物理、创作诗歌以及进行令人惊讶的连贯对话的能力。

让我们来解压一下如何。


🔡第一:什么是代币?

在我们讨论模型本身之前,我们需要了解标记——LLM 所使用的语言单位。

令牌并不完全是一个单词。它更像是在语言中出现得足够频繁的文本块,值得将其视为一个单元。在英语中,“the”、“and”、“is”等常见单词是单个标记。更长、更罕见的单词可能会被拆分:“非凡”可能会变成“额外”+“普通”。数字和标点符号通常是它们自己的标记。

粗略的经验法则是:1 个标记 ≈ 0.75 个英语单词。

为什么不直接用文字呢?因为标记化可以处理:

  • 具有不同单词结构的多种语言
  • 代码(其中空格和符号的重要性不同)
  • 新词、名称和技术术语
  • 数学表达式

当您向 LLM 键入消息时,它会立即转换为一系列令牌 ID — 词汇表中的数字,通常包含 30,000 到 100,000 个令牌。

🤯

GPT-4 的词汇量约为 100,000 个标记。整个英语大约有 170,000 个常用单词,但法学硕士的标记词汇还同时涵盖多种语言、代码语法、表情符号和专业术语。


🎯 核心任务:预测接下来会发生什么

以下是每个法学硕士的基本培训目标:

给定一个标记序列,预测每个可能的下一个标记的概率。

在训练过程中,模型会显示数十亿个示例,例如:

  • “猫坐在___”→(可能:垫子、地板、沙发、屋顶......)
  • "defcalculate_sum(a, b):\n return ___" → (可能:a + b)
  • “法国的首都是___”→(几乎可以肯定:巴黎)

通过查看足够多的示例,该模型可以学习语言的统计模式,不仅是逐个单词,还包括含义、因果关系和上下文的深层结构。

生成文本时,模型:

  1. 查看所有之前的代币
  2. 输出整个词汇表的概率分布
  3. 从该分布中采样令牌(具有由“温度”控制的一些随机性)
  4. 将该标记附加到序列中
  5. 重复

你在法学硕士的回答中读到的每个单词都是一次生成一个标记,每个单词都由它之前的所有内容通知。


🔄 Transformer 架构

使现代 LLM 成为可能的架构称为 Transformer,由 Google 研究人员在 2017 年一篇名为“Attention is All You Need”的具有里程碑意义的论文中介绍。

在《变形金刚》出现之前,语言模型按顺序逐字处理文本,就像用手指在每个单词下面慢慢阅读一个句子一样。这很慢,并且很难将句子中相距较远的单词连接起来。

变压器同时处理所有令牌,并让每个令牌直接与其他令牌交互。这称为并行处理,这也是它们如此强大的部分原因。

但真正的魔力在于注意力机制。


👁️ 注意力:模型如何聚焦

想象一下读这句话:

“奖杯太大,无法放入手提箱。”

“它”指的是什么?奖杯。你知道这一点,因为你很快回过头来,在解释“它”时,给了“奖杯”额外的分量。

注意力机制让模型准确地做到这一点——对于每个令牌,它计算对上下文中的每个其他令牌给予多少“注意力”。它问:

“要理解这个单词,序列中哪些其他单词最相关?”

这些注意力权重是在训练过程中学习的。该模型了解到,在处理代词时,句子前面的名词值得高度关注。在处理动词时,主语值得高度关注。

多头注意力

现代变形金刚使用多头注意力——它们并行运行许多注意力计算,每个计算都寻找不同类型的关系:

  • 一个“头”可能会跟踪语法关系(主谓一致)
  • 另一个可能会跟踪共指(代词所指的内容)
  • 另一个可能会跟踪语义相似性(这些单词意味着相似的事物)

所有头的输出被组合起来,以建立对每个标记与整个上下文的关系的丰富、多维的理解。

🤯

GPT-3 在 96 层中有 96 个注意力头。这意味着在每一层处理中,都会同时计算关于单词之间关系的 96 个不同“视角”。没有人完全了解每个大脑学到了什么——这是大型神经网络的众多谜团之一。


📏 上下文窗口:它能记住多少?

上下文窗口是LLM可以一次考虑的最大令牌数量。将其视为模型的工作记忆。

早期的 GPT 模型有 2,048 个标记(约 1,500 个单词)的上下文窗口。 GPT-4o、Claude 3 和 Gemini 1.5 Pro 等现代模型具有 128,000 个或更多令牌的上下文窗口 - 足以容纳整本小说。

每层的每个注意力头都可以访问上下文窗口中的所有内容。它外面的所有东西对于模型来说都是不可见的。不像人类那样存在模糊的“褪色记忆”——这是一个硬性的切断。

这就是为什么与法学硕士的对话如果太长就会出错:最终,对话的早期部分会脱离上下文窗口。


🏋️ 培训:规模就是一切

法学硕士接受的文本数量确实惊人:

  • GPT-3 接受了约 3000 亿个令牌的训练——大约 570GB 的文本
  • GPT-4 训练细节是秘密的,但估计表明有数万亿代币
  • Llama 3接受了超过 15 万亿个文本标记的训练

训练数据来自网络爬行(Common Crawl)、书籍、维基百科、代码存储库、学术论文等等——本质上是互联网上书面文本的很大一部分。

训练计算成本非常巨大:GPT-3 的训练仅计算成本就估计达到 460 万美元。 GPT-4 被认为耗资超过 1 亿美元。

新兴能力:惊喜

随着模型变得越来越大,会发生一些奇怪的事情:它们发展出涌现能力——这些能力没有经过明确的训练,没有出现在较小的模型中,并且似乎突然大规模出现。

GPT-2(2019)几乎无法写出连贯的段落。 GPT-3 (2020) 可以写论文、解决逻辑难题以及翻译它几乎没有见过的语言。 GPT-4可以通过医学和法律考试。

这些没有明确编程。它们是从规模中脱颖而出的。

🤔
Think about it:

法学硕士从未“经历过”任何事情。它从未见过日出,感受过寒冷,也从未进行过实时对话。然而,它可以令人信服地描述这些事物,因为它已经处理了数以百万计的人类对它们的描述。这是否意味着模型“理解”这些体验,或者它正在做一些根本不同的事情?


🎛️ 从预测机到有用的助手

原始的下一个标记预测将产生一些延续您所提供的任何文本的内容——对于完成有用,但对于对话则无用。

为了使法学硕士成为有用的助手,他们要经历第二个训练阶段,称为RLHF(人类反馈强化学习):

  1. 模型针对提示生成多种可能的响应
  2. 人工评分者将响应从最好到最差进行排名 3.“奖励模型”学习预测人类偏好
  3. LLM 经过微调,可产生奖励模型高度评价的响应

这就是原始语言模型如何成为你与之交互的 ChatGPT 或 Claude——有帮助、无害且相对诚实。


🔬 法学硕士可以做什么和不能做什么

法学硕士非常擅长:

  • 生成流畅、适合上下文的文本
  • 语言之间的翻译
  • 编写和解释代码
  • 总结长文档
  • 遵循复杂的指示
  • 创意任务:故事、诗歌、头脑风暴

法学硕士仍然面临以下问题:

  • 精确的算术(它们不是计算器)
  • 可靠地知道他们不知道的事情(幻觉)
  • 训练结束后跟进活动
  • 无错误的长多步推理
  • 真正的因果推理与统计相关性

了解这些局限性并不是悲观主义——而是如何有效地利用法学硕士,构建发挥其优势同时弥补其劣势的系统。

第 11 课,共 16 课已完成 0%
←评估指标

讨论

登录 参与讨论