你正在发布一个使用 Claude 的应用。你选择哪个模型?如果你默认使用最智能的那个,你的 API 账单会让你惊讶。选择最便宜的那个,输出可能不够好。每个模型都有不同的权衡,选择正确的模型会影响 质量 和 成本。
Anthropic 目前提供四个模型层级,你在 API 调用中使用 model 参数在它们之间选择。
请注意,Claude Fable 5.1 自 2026 年 9 月 1 日以来已正式发布,但未在上面的视频中体现。了解更多关于 Claude Fable 5.1 和 Claude Mythos 5.1 的信息请参阅 此处。本课中的视频和终端截图是使用早期模型(Claude Opus 4.7 和 Claude Sonnet 4.6)录制的。下面的代码使用当前的模型 ID;你的延迟和 token 数量会有所不同。
claude-fable-5-1)。claude-opus-5)。claude-haiku-4-5)。claude-sonnet-5)。在编写生产代码之前,设置一个简单的 评估:一组示例输入,你通过每个模型运行并根据好输出对你的用例意味着什么进行评分。你不需要任何花哨的东西——20 或 30 个来自你实际工作负载的代表性示例就足以开始。
然后逐步升级层级:
让我们看看层级之间的区别,而不仅仅是讨论。我们将通过所有三个模型发送相同的提示并观察延迟和 token 计数:
models = ["claude-haiku-4-5", "claude-sonnet-5", "claude-opus-5"]
for model in models:
response = client.messages.create(
model=model,
max_tokens=300,
messages=[{"role": "user", "content": prompt}],
)
print(model, response.usage)
登录 参与讨论
这里有两件事在发生:
model 字段。相同的提示,相同的 max tokens——只有模型改变。response.usage 直接从 API 返回输入和输出 token,这就是你的账单计算依据。运行它,你会看到三个模型和三组数字。Opus 用时最长,读起来最精致——但对于一个两句话的定义,这种精致是浪费的。Sonnet 稍微收紧了写作。而 Haiku 通常在一秒内返回,带着非常有能力的两句话答案。老实说,这对于这种场景是完美的。
这就是全部要点:正确的模型是你实际上会发布的最便宜的模型。 对于定义,Haiku 足够了。对于起草监管回复,你会进行相同的比较并可能最终使用 Opus。评估每次都是相同的形式。
在真实的应用中,你会在同一端点内将不同类型的工作路由到不同模型。以带有文档处理路由的运营仪表板为例:
一个队列,三个模型,按任务选择。
response.usage 报告输入和输出 token,这是你账单的依据。