AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›⚙️ Claude 平台 101›课程›上下文管理
📦
Claude 平台 101 • 高级⏱️ 6 分钟阅读

上下文管理

上下文管理

你发送给 Claude 的每个请求都有一个 上下文窗口。一百万个 token 听起来很多,但一旦你发布真正的 agent,它会比你想象的更快耗尽。这就是 上下文管理 的用武之地:它是你在不丢失重要内容的情况下保持在窗口内的方法。

什么算作上下文

上下文是 Claude 在给定轮次中看到的所有内容:

  • 系统提示
  • 消息历史
  • 工具定义和工具结果
  • 附加文件和 skills
  • 思考块

它是每个 API 调用的输入。你为它支付入场费,也为它支付出场费。一旦窗口满了,请求就会失败。

所以目标不是把所有东西都放进去。目标是 放入正确的东西。

Anthropic 发布了 四种模式 用于在长时间运行的 agents 中管理上下文。三种是一流的 API 功能,一种是设计模式。

模式 1:即时上下文

不要预先加载所有内容。加载 agent 现在 需要的内容,让它在需要时通过工具拉取更多。

以合规审查 agent 为例。它不会将整本建筑规范书塞入系统提示——当它需要特定部分时,它调用 lookup_building_code 工具。这是四种中的设计模式:API 中没有特殊内容,只是关于你加载什么和何时加载的深思熟虑的选择。

模式 2:服务器端压缩

当对话运行时间较长时,Anthropic 的 服务器端压缩 将旧轮次总结为单个块。你通过在请求中添加 context_management 键并包含一个类型来选择加入:

response = client.beta.messages.create(
    betas=["compact-2026-01-12"],
    model="claude-opus-5",
    max_tokens=1024,
    context_management={
        "edits": [
            {"type": "compact_20260112"}
        ]
    },
    messages=messages,
)

当输入超过触发阈值时,API 自动总结。你不必自己跟踪对话长度。

模式 3:提示缓存

提示缓存 让你标记请求的稳定部分——系统提示、工具定义、长文档——并在调用间以极低的成本重用它们。

数学比看起来更重要。如果你的系统提示是 4,000 个 token,你每小时调用 100 次,缓存是可用账单和财务部门打电话之间的区别。

模式 4:记忆工具

有些上下文需要 跨会话 生存:用户偏好、agent 的运行笔记、上周决定了什么。推荐用于此的原语是 记忆工具。

它是这样工作的:

  • Claude 通过工具调用读写记忆目录。
  • 你在客户端实现存储后端——文件系统、数据库、加密存储,无论你想要什么。
  • Anthropic 自动注入系统指令,告诉 Claude 在开始工作前检查记忆目录。

组合模式

在生产应用中,你通常会同时使用所有四种。合规审查 agent 缓存其系统提示和工具定义,并通过 lookup_building_code 即时拉取建筑规范部分。

每种模式处理不同的失败模式:成本、窗口大小、无状态性。选择与你遇到的问题匹配的模式。

第 19 课,共 26 课已完成 0%
←提示缓存

讨论

登录 参与讨论

回顾

  • 上下文是 Claude 在一轮中看到的所有内容——它不是免费的或无限的。一旦窗口满了,请求就会失败。
  • 即时上下文:加载现在需要的内容,让工具拉取其余部分。这是四种中的设计模式。
  • 服务器端压缩:添加 context_management 键,当输入超过触发阈值时 API 自动总结旧轮次。
  • 提示缓存:标记请求的稳定部分并在调用间以极低的成本重用它们。
  • 记忆工具:Claude 通过工具调用读写记忆目录;你拥有存储后端,因此上下文跨会话生存。
  • 四种模式,一个目标。手动连接它们,或使用 Claude managed agents,默认开启缓存和压缩。