ChatGPT、Claude、Gemini、Llama — 他们无处不在。但当这些东西回复你的消息时,它们实际上在做什么呢?答案比你想象的更简单、更令人费解。
大型语言模型 (LLM) 的核心是做一件事:预测下一个标记。反复。就是这样。然而,从这个简单的过程中,就出现了编写代码、解释量子物理、创作诗歌以及进行令人惊讶的连贯对话的能力。
让我们来解压一下如何。
在我们讨论模型本身之前,我们需要了解标记——LLM 所使用的语言单位。
令牌并不完全是一个单词。它更像是在语言中出现得足够频繁的文本块,值得将其视为一个单元。在英语中,“the”、“and”、“is”等常见单词是单个标记。更长、更罕见的单词可能会被拆分:“非凡”可能会变成“额外”+“普通”。数字和标点符号通常是它们自己的标记。
粗略的经验法则是:1 个标记 ≈ 0.75 个英语单词。
为什么不直接用文字呢?因为标记化可以处理:
当您向 LLM 键入消息时,它会立即转换为一系列令牌 ID — 词汇表中的数字,通常包含 30,000 到 100,000 个令牌。
GPT-4 的词汇量约为 100,000 个标记。整个英语大约有 170,000 个常用单词,但法学硕士的标记词汇还同时涵盖多种语言、代码语法、表情符号和专业术语。
以下是每个法学硕士的基本培训目标:
给定一个标记序列,预测每个可能的下一个标记的概率。
在训练过程中,模型会显示数十亿个示例,例如:
通过查看足够多的示例,该模型可以学习语言的统计模式,不仅是逐个单词,还包括含义、因果关系和上下文的深层结构。
生成文本时,模型:
你在法学硕士的回答中读到的每个单词都是一次生成一个标记,每个单词都由它之前的所有内容通知。
使现代 LLM 成为可能的架构称为 Transformer,由 Google 研究人员在 2017 年一篇名为“Attention is All You Need”的具有里程碑意义的论文中介绍。
在《变形金刚》出现之前,语言模型按顺序逐字处理文本,就像用手指在每个单词下面慢慢阅读一个句子一样。这很慢,并且很难将句子中相距较远的单词连接起来。
变压器同时处理所有令牌,并让每个令牌直接与其他令牌交互。这称为并行处理,这也是它们如此强大的部分原因。
但真正的魔力在于注意力机制。
想象一下读这句话:
“奖杯太大,无法放入手提箱。”
“它”指的是什么?奖杯。你知道这一点,因为你很快回过头来,在解释“它”时,给了“奖杯”额外的分量。
注意力机制让模型准确地做到这一点——对于每个令牌,它计算对上下文中的每个其他令牌给予多少“注意力”。它问:
“要理解这个单词,序列中哪些其他单词最相关?”
这些注意力权重是在训练过程中学习的。该模型了解到,在处理代词时,句子前面的名词值得高度关注。在处理动词时,主语值得高度关注。
现代变形金刚使用多头注意力——它们并行运行许多注意力计算,每个计算都寻找不同类型的关系:
所有头的输出被组合起来,以建立对每个标记与整个上下文的关系的丰富、多维的理解。
GPT-3 在 96 层中有 96 个注意力头。这意味着在每一层处理中,都会同时计算关于单词之间关系的 96 个不同“视角”。没有人完全了解每个大脑学到了什么——这是大型神经网络的众多谜团之一。
上下文窗口是LLM可以一次考虑的最大令牌数量。将其视为模型的工作记忆。
早期的 GPT 模型有 2,048 个标记(约 1,500 个单词)的上下文窗口。 GPT-4o、Claude 3 和 Gemini 1.5 Pro 等现代模型具有 128,000 个或更多令牌的上下文窗口 - 足以容纳整本小说。
每层的每个注意力头都可以访问上下文窗口中的所有内容。它外面的所有东西对于模型来说都是不可见的。不像人类那样存在模糊的“褪色记忆”——这是一个硬性的切断。
这就是为什么与法学硕士的对话如果太长就会出错:最终,对话的早期部分会脱离上下文窗口。
法学硕士接受的文本数量确实惊人:
训练数据来自网络爬行(Common Crawl)、书籍、维基百科、代码存储库、学术论文等等——本质上是互联网上书面文本的很大一部分。
训练计算成本非常巨大:GPT-3 的训练仅计算成本就估计达到 460 万美元。 GPT-4 被认为耗资超过 1 亿美元。
随着模型变得越来越大,会发生一些奇怪的事情:它们发展出涌现能力——这些能力没有经过明确的训练,没有出现在较小的模型中,并且似乎突然大规模出现。
GPT-2(2019)几乎无法写出连贯的段落。 GPT-3 (2020) 可以写论文、解决逻辑难题以及翻译它几乎没有见过的语言。 GPT-4可以通过医学和法律考试。
这些没有明确编程。它们是从规模中脱颖而出的。
法学硕士从未“经历过”任何事情。它从未见过日出,感受过寒冷,也从未进行过实时对话。然而,它可以令人信服地描述这些事物,因为它已经处理了数以百万计的人类对它们的描述。这是否意味着模型“理解”这些体验,或者它正在做一些根本不同的事情?
原始的下一个标记预测将产生一些延续您所提供的任何文本的内容——对于完成有用,但对于对话则无用。
为了使法学硕士成为有用的助手,他们要经历第二个训练阶段,称为RLHF(人类反馈强化学习):
这就是原始语言模型如何成为你与之交互的 ChatGPT 或 Claude——有帮助、无害且相对诚实。
法学硕士非常擅长:
法学硕士仍然面临以下问题:
了解这些局限性并不是悲观主义——而是如何有效地利用法学硕士,构建发挥其优势同时弥补其劣势的系统。
登录 参与讨论