搜索结果:

返回

从提示词到上下文:CL-bench揭示的大模型能力断层

从如何提问到如何构建环境的范式转移背后,模型在上下文学习能力上的真实边界。

AI 速览

从如何提问到如何构建环境的范式转移背后,模型在上下文学习能力上的真实边界。 过去两年,提示词工程几乎是一个被说烂的词汇。 如何写 prompt,如何设计 few-shot 示例,如何引导模型逐步思考。 这些方法论构成了我们与模型协作的基础共识。

过去两年,提示词工程几乎是一个被说烂的词汇。


如何写 prompt,如何设计 few-shot 示例,如何引导模型逐步思考。


这些方法论构成了我们与模型协作的基础共识。

我们像调试代码一样调试自然语言,试图通过优化提问方式来逼近模型的正确答案。


但最近,一个新的关键词开始被频繁提及:

Context Engineering(上下文工程)。


这是一个现实问题的显性化。

当模型进入复杂系统、连接真实数据、嵌入业务流程之后,大量失效场景的根源,并非模型能力不足,而是它所处的信息结构本身就是混乱的。


但即便信息准备充分,模型依然可能无法正确吸收与应用。


问题的核心,正在从如何表达问题转向如何构建环境


01

从写提示词到设计上下文



提示词工程解决的是语言层面的对齐问题。


  • 如何提问能让模型更容易理解预期?
  • 如何拆解步骤,模型减少跳步推理?
  • 如何提供示例,让模型输出风格更稳定?


本质上,这是在优化人与模型之间的对话接口


上下文工程则关注另一件事:模型在生成答案之前,应当处于怎样的信息环境之中。


举个简单的例子:

如果你让 AI 帮你回复一封邮件:

“嘿,明天有空简单碰个头吗?”


一个只依赖 prompt 的模型,只能看到这句话。


于是它给出一个看似合理的回答:

“感谢你的消息,我明天可以,请问几点?”


而一个被上下文工程武装的系统,会在生成回复之前做一系列看不见的工作:

它会查询你的实时日历,确定空闲时段;

它会调取与对方的历史沟通记录,分析惯用的语气和关系亲疏;

它会识别对方身份是同事还是客户;

它甚至会调用会议工具,生成带链接的邀请。


最终的回复可能是:

“明天下午3点我刚好有空,发了个会议链接,咱们那时候聊?”


最终生成的回复,信息密度与可执行性完全不同。

关键差异来自获得的信息维度不同。


这正是上下文工程讨论的核心:

如何为模型构建一个动态、结构化、可操作的信息场。


02

喂更多信息并不等于模型会学习


一个常见误解是:

上下文工程意味着把更多数据接入系统,把更多历史记录输入模型。


近期混元团队与复旦联合发布的《CL-bench》论文,

专门测试了模型从上下文中学习新知识的能力。


包含由资深领域专家精心制作的500个复杂上下文、1899个任务和 31607个验证标准。


划分为了四类情境。



领域知识推理

上下文提供特定领域的专业知识,例如虚构法律体系、新设计的金融工具或小众专业内容。

模型需要从上下文中学习这些领域知识,并将其应用于具体任务,如法律裁决、金融分析或专业咨询。



规则系统应用

上下文提供全新且结构清晰的规则系统,例如新的游戏机制、数学形式体系、编程语法或技术标准。

模型需要理解并正确应用这些规则,完成任务,如游戏推演、数学证明、代码实现或法规解读。



程序性任务执行

上下文提供复杂的流程或操作指南,例如产品手册、软件文档或会议组织流程。

模型需要从中学习具体步骤,并按照流程完成任务,如故障排查、操作指导或流程协调。



经验发现与模拟

上下文提供实验数据、观测记录或复杂系统的模拟环境。

模型需要从数据中归纳规律,或在模拟环境中进行分析与推理。这类任务强调归纳推理能力,是最具挑战性的类别。



CL bench的背景分类体系


测试任务有三个严格的前提条件:

  • 任务所需的知识不在模型预训练参数中
  • 必须从当前提供的上下文中获取
  • 必须正确应用这些知识

结果耐人寻味。


研究团队评估了十个当前最先进的语言模型,

平均任务解决率仅为17.2%。


即便是表现最好的GPT-5.1(High),也只达到了23.7%。



所有模型均在推理环节进行了评估模式,

结果以平均值 ± 标准差(%)的形式报告,涵盖三次运行过程。


这意味着什么?

每个任务的上下文中都包含了解决问题的全部信息,但模型在绝大多数任务上仍然失败。


信息供给不等于信息吸收,上下文到位不等于任务做对。


CL-bench揭示了一个被长期忽视的事实:


当前的语言模型更像参数记忆调用者,而非环境适应性学习者


它们在调用预训练阶段固化下来的静态知识方面高度成熟,

但在根据当前输入的新信息进行即时学习方面,能力远未成熟。


03

归纳推理,是当前明显的短板


论文中一个值得重视的观察是:

当上下文给出明确规则,模型按照规则进行演绎推理时,表现尚可。


但当任务要求模型:

从实验数据中发现规律;从日志中总结模式;在模拟环境中构建抽象规则


成功率大幅下降。


归纳推理要求模型构建新的结构,而非匹配既有模板。


这暴露出当前大模型的能力边界。


模型擅长生成与组合,

但在规则重组与结构构建方面仍存在波动。



04

覆盖旧知识与瞬时学习



另一个常被忽视的问题:知识冲突。


当上下文中引入新的规则,而模型预训练阶段已经学过相似却不同的规则时,模型往往会优先调用参数中已有的知识。


即使当前上下文明确给出了更新后的定义,这种参数惯性仍然可能主导推理路径。


这种现象并不源于信息不足,而更多体现为内部权重分布的影响。


模型在训练过程中形成了稳定的知识结构与优先级排序,

而上下文信息需要在推理阶段对这一结构产生覆盖或调整,

这本身就是一个具有挑战性的过程。


由此可以看到:


  • 模型内部的知识体系存在固化特征
  • 上下文信息需要与参数记忆竞争推理主导权


上下文工程的作用不仅仅是增加输入内容,更涉及对信息优先级的调度与重排。


它在一定程度上改变的是推理路径,而不仅仅是输入规模。



各模型中误差类型分布情况


另外,当前学习是瞬时性的。

即便模型在单次对话中成功吸收了新规则,一旦上下文窗口清空,学到的知识随之消失。


模型无法真正积累经验,无法跨任务迁移技能,无法在多轮对话中持续成长。


当前的上下文学习本质上是临时工作记忆,而非长期知识固化


这也解释了为什么记忆机制正在成为2026年的研究热点。


如果不能把上下文中的学习结果固化下来,模型永远只是个短期推理器。


05

结语



提示词工程提升了表达控制能力。

上下文工程提升了环境组织能力。

上下文学习能力决定模型是否能够在复杂系统中持续运行。


这三者叠加在一起,构成了 AI 下半场的核心问题。


当AI走出实验室,进入真实世界的业务系统,它面对的不再是静态的标准考题,而是不断变化的规则、实时更新的状态、层层迭代的任务。


如果上下文学习显著提升,人类在AI系统中的角色将发生变化。


竞争的焦点将从谁能把模型训练得更好,转向谁能为任务提供最丰富、最相关的上下文


但更远的挑战在于:即便上下文学习能力提升了,它目前仍然是临时性的。上下文窗口清空,学到的东西就没了。如何让从上下文中学到的知识持久化?


当模型从记忆调用者进化为环境学习者,

AI才会真正进入新的阶段。


聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他