过去两年,提示词工程几乎是一个被说烂的词汇。
如何写 prompt,如何设计 few-shot 示例,如何引导模型逐步思考。
这些方法论构成了我们与模型协作的基础共识。
我们像调试代码一样调试自然语言,试图通过优化提问方式来逼近模型的正确答案。
但最近,一个新的关键词开始被频繁提及:
Context Engineering(上下文工程)。
这是一个现实问题的显性化。
当模型进入复杂系统、连接真实数据、嵌入业务流程之后,大量失效场景的根源,并非模型能力不足,而是它所处的信息结构本身就是混乱的。
但即便信息准备充分,模型依然可能无法正确吸收与应用。
问题的核心,正在从如何表达问题转向如何构建环境。
01
从写提示词到设计上下文

提示词工程解决的是语言层面的对齐问题。
- 如何提问能让模型更容易理解预期?
- 如何拆解步骤,模型减少跳步推理?
- 如何提供示例,让模型输出风格更稳定?
本质上,这是在优化人与模型之间的对话接口。
上下文工程则关注另一件事:模型在生成答案之前,应当处于怎样的信息环境之中。
举个简单的例子:
如果你让 AI 帮你回复一封邮件:
“嘿,明天有空简单碰个头吗?”
一个只依赖 prompt 的模型,只能看到这句话。
于是它给出一个看似合理的回答:
“感谢你的消息,我明天可以,请问几点?”
而一个被上下文工程武装的系统,会在生成回复之前做一系列看不见的工作:
它会查询你的实时日历,确定空闲时段;
它会调取与对方的历史沟通记录,分析惯用的语气和关系亲疏;
它会识别对方身份是同事还是客户;
它甚至会调用会议工具,生成带链接的邀请。
最终的回复可能是:
“明天下午3点我刚好有空,发了个会议链接,咱们那时候聊?”
最终生成的回复,信息密度与可执行性完全不同。
关键差异来自获得的信息维度不同。
这正是上下文工程讨论的核心:
如何为模型构建一个动态、结构化、可操作的信息场。
02
喂更多信息并不等于模型会学习
一个常见误解是:
上下文工程意味着把更多数据接入系统,把更多历史记录输入模型。
近期混元团队与复旦联合发布的《CL-bench》论文,
专门测试了模型从上下文中学习新知识的能力。
包含由资深领域专家精心制作的500个复杂上下文、1899个任务和 31607个验证标准。
划分为了四类情境。
领域知识推理
上下文提供特定领域的专业知识,例如虚构法律体系、新设计的金融工具或小众专业内容。
模型需要从上下文中学习这些领域知识,并将其应用于具体任务,如法律裁决、金融分析或专业咨询。
规则系统应用
上下文提供全新且结构清晰的规则系统,例如新的游戏机制、数学形式体系、编程语法或技术标准。
模型需要理解并正确应用这些规则,完成任务,如游戏推演、数学证明、代码实现或法规解读。
程序性任务执行
上下文提供复杂的流程或操作指南,例如产品手册、软件文档或会议组织流程。
模型需要从中学习具体步骤,并按照流程完成任务,如故障排查、操作指导或流程协调。
经验发现与模拟
上下文提供实验数据、观测记录或复杂系统的模拟环境。
模型需要从数据中归纳规律,或在模拟环境中进行分析与推理。这类任务强调归纳推理能力,是最具挑战性的类别。

CL bench的背景分类体系
测试任务有三个严格的前提条件:
- 任务所需的知识不在模型预训练参数中
- 必须从当前提供的上下文中获取
- 必须正确应用这些知识
结果耐人寻味。
研究团队评估了十个当前最先进的语言模型,
平均任务解决率仅为17.2%。
即便是表现最好的GPT-5.1(High),也只达到了23.7%。

所有模型均在推理环节进行了评估模式,
结果以平均值 ± 标准差(%)的形式报告,涵盖三次运行过程。
这意味着什么?
每个任务的上下文中都包含了解决问题的全部信息,但模型在绝大多数任务上仍然失败。
信息供给不等于信息吸收,上下文到位不等于任务做对。
CL-bench揭示了一个被长期忽视的事实:
当前的语言模型更像参数记忆调用者,而非环境适应性学习者。
它们在调用预训练阶段固化下来的静态知识方面高度成熟,
但在根据当前输入的新信息进行即时学习方面,能力远未成熟。
03
归纳推理,是当前明显的短板
论文中一个值得重视的观察是:
当上下文给出明确规则,模型按照规则进行演绎推理时,表现尚可。
但当任务要求模型:
从实验数据中发现规律;从日志中总结模式;在模拟环境中构建抽象规则
成功率大幅下降。
归纳推理要求模型构建新的结构,而非匹配既有模板。
这暴露出当前大模型的能力边界。
模型擅长生成与组合,
但在规则重组与结构构建方面仍存在波动。

04
覆盖旧知识与瞬时学习
另一个常被忽视的问题:知识冲突。
当上下文中引入新的规则,而模型预训练阶段已经学过相似却不同的规则时,模型往往会优先调用参数中已有的知识。
即使当前上下文明确给出了更新后的定义,这种参数惯性仍然可能主导推理路径。
这种现象并不源于信息不足,而更多体现为内部权重分布的影响。
模型在训练过程中形成了稳定的知识结构与优先级排序,
而上下文信息需要在推理阶段对这一结构产生覆盖或调整,
这本身就是一个具有挑战性的过程。
由此可以看到:
- 模型内部的知识体系存在固化特征
- 上下文信息需要与参数记忆竞争推理主导权
上下文工程的作用不仅仅是增加输入内容,更涉及对信息优先级的调度与重排。
它在一定程度上改变的是推理路径,而不仅仅是输入规模。

各模型中误差类型分布情况
另外,当前学习是瞬时性的。
即便模型在单次对话中成功吸收了新规则,一旦上下文窗口清空,学到的知识随之消失。
模型无法真正积累经验,无法跨任务迁移技能,无法在多轮对话中持续成长。
当前的上下文学习本质上是临时工作记忆,而非长期知识固化。
这也解释了为什么记忆机制正在成为2026年的研究热点。
如果不能把上下文中的学习结果固化下来,模型永远只是个短期推理器。
05
结语

提示词工程提升了表达控制能力。
上下文工程提升了环境组织能力。
上下文学习能力决定模型是否能够在复杂系统中持续运行。
这三者叠加在一起,构成了 AI 下半场的核心问题。
当AI走出实验室,进入真实世界的业务系统,它面对的不再是静态的标准考题,而是不断变化的规则、实时更新的状态、层层迭代的任务。
如果上下文学习显著提升,人类在AI系统中的角色将发生变化。
竞争的焦点将从谁能把模型训练得更好,转向谁能为任务提供最丰富、最相关的上下文。
但更远的挑战在于:即便上下文学习能力提升了,它目前仍然是临时性的。上下文窗口清空,学到的东西就没了。如何让从上下文中学到的知识持久化?
当模型从记忆调用者进化为环境学习者,
AI才会真正进入新的阶段。


