搜索结果:

返回

GPT-5.4 来了!OpenAI的“大一统模型”

一个真正的大一统模型:推理、编程、电脑操作、深度搜索、百万级上下文...

AI 速览

一个真正的大一统模型:推理、编程、电脑操作、深度搜索、百万级上下文... 没想到,三月的第一个重磅炸弹,来得这么快。 就在昨夜凌晨,GPT-5.4突然发布,一个真正的“大一统”模型:推理、编程、电脑操作、深度搜索、百万级上下文,全部塞进同一个模型里。 官方把它定义为:为专业工作设计的新模型,

没想到,三月的第一个重磅炸弹,来得这么快。


就在昨夜凌晨,GPT-5.4突然发布,一个真正的“大一统”模型:推理、编程、电脑操作、深度搜索、百万级上下文,全部塞进同一个模型里。


官方把它定义为:为专业工作设计的新模型,

并同步上线到 ChatGPT、API 和 Codex;

ChatGPT 里对应的是 GPT-5.4 Thinking,另外还有更高性能的 GPT-5.4 Pro。



过去几年,大模型最常见的使用方式,其实还是问答式协作

你提问题,它给答案。你写提示词,它按你的意图尽量把事情说清楚。


哪怕是更复杂一点的应用,很多时候也只是把聊天能力包了一层流程。


但真实工作不是这样的。

真实工作里,任务往往长这样:


先读一堆材料--再查几轮网页--期间要调工具--中间要看表格、文档、截图--有些步骤需要直接操作网页和软件--最后交付的还得是一个能用的结果。



GPT-5.4 的核心变化,就是它开始更完整地覆盖这整条链路。


OpenAI 在官方介绍里把它的能力重点放在三类场景上:知识工作、原生计算机使用、高阶编程与调试。


这三个方向放在一起看,会更容易理解它真正的产品定位:

不是一次常规模型升级,

它更像是 OpenAI 对AI 到底要怎么进入真实工作流 给出的新答案。


开始更像会做事的人


OpenAI 这次放出的一个很关键的指标,GDPval。


这个评测不是传统意义上的学术问答,它更接近现实职业任务,

覆盖 44 种职业知识工作。


在这个基准上,GPT-5.4 的得分是 83.0%。


在GDPval评估中,模型需要完成设定明确的知识工作任务,

这些任务涵盖了对美国GDP贡献最大的9个行业中44种职业的真实工作产出,例如销售演示文稿、会计电子表格、急诊排班表、制造图表或短视频。


OpenAI 还给出了一些更贴近办公场景的内部测试:

在投资银行建模任务上,GPT-5.4 达到 87.3%,比 GPT-5.2 的 68.4% 高出不少;


在人类评审的 PPT 生成测试里,评审更偏好 GPT-5.4 结果的比例达到 68%。


这些数字真正值得关注的地方,在于它们说明了一件事:


模型开始更稳定地参与真实产出物的制作。



以前我们说模型能写报告、做表、出方案,很多时候带着一点演示感


你看它输出时会觉得惊艳,但真要把它交付到实际工作里,又总差一点


有时候差在逻辑,有时候差在格式,有时候差在最后那口气:能看,不能交。


GPT-5.4 明显在补这口气。


对内容团队来说,它意味着更好的长文整理和研究辅助;


对策略、财务、咨询类工作来说,它意味着更强的表格、演示文稿、文档理解和构建能力;


对业务团队来说,它意味着从给建议往产出工作成品迈得更近了一步。


把电脑操作做成了主线能力


这次最有讨论度的升级,是 GPT-5.4 成了 OpenAI 首个原生支持计算机使用能力的主线通用模型。


官方的描述很直接:它能看截图、理解界面、执行鼠标点击和键盘输入。


这个能力为什么重要?

因为很多数字世界里的任务,其实都卡在最后一公里


  • 一个模型能告诉你怎么填表,和一个模型真的帮你把表填完,中间差着整整一层世界。
  • 一个模型能告诉你如何创建会议,和一个模型直接把会议建好、发出去,也不是一回事。
  • 一个模型能解释网页怎么操作,和一个模型自己把网页走通,更是两种产品。

GPT-5.4 把这层能力接进来之后,Agent 这件事终于更像一个完整系统了。



GPT-5.4能够解读浏览器界面的截图,并通过基于坐标的点击与UI元素进行交互,从而实现发送邮件和安排日历事件。视频无加速。



从官方给出的基准看,它在 OSWorld-Verified 上达到 75.0%,在 WebArena-Verified 上达到 67.3%,在 Online-Mind2Web 上达到 92.8%。


这些数字背后其实指向的是一个更实际的变化:模型开始具备了穿过软件界面直接完成任务的能力。


这也是为什么很多人会把 GPT-5.4 和 OpenClaw 这类 Agent 框架联系到一起看。


原因很简单:当“理解任务”“写代码”“调工具”“看界面”“点按钮”这些能力终于能在一个模型里收拢,AI 作为执行系统的可用性会突然提高一截。


代码能力终于不再和世界知识分开卖了


这次发布里还有一个很重要但容易被忽略的点:


GPT-5.4 把 GPT-5.3-Codex 的前沿编程能力吸收进了主线模型。


这句话听起来像常规升级,实际意义很大。


过去一段时间,很多开发者都有类似感受:


  • 特化编程模型写代码很猛,但和人、和业务、和复杂任务对齐时,经常显得只会干活,不太会沟通
  • 通用模型更懂语境,但一到复杂开发任务,又容易差点意思。


GPT-5.4 这次尝试把这两头接起来。



OpenAI 给出的公开数据里,

它在 SWE-Bench Pro 上拿到 57.7%,略高于 GPT-5.3-Codex 的 56.8%。


同时它还加入了更强的前端构建与视觉调试流程,例如 Playwright Interactive 这类实验技能,目标很明确:让模型不只会生成代码,还会一边做、一边测、一边改。


这件事对开发者真正的意义在于:

以后选模型,不用总在最会写代码和最会做复杂任务之间来回取舍。


它未必在每个单项上都把所有竞品远远甩开,但它把够强的代码能力和更完整的任务理解能力放到了同一个工作流里。


这对 Agent、自动化开发、复杂产品搭建这些场景非常重要。


一百万上下文和工具搜索


很多人看到 GPT-5.4,最容易被“大一统能力”吸引,

但我觉得还有两处升级特别值得开发者和企业团队注意。


1. 1M token 上下文窗口。

GPT-5.4 支持最高 1.05M 的上下文窗口,这让它可以一次性处理更长的代码库、更大的文档集合、或者更长的 agent 轨迹。

这意味着什么?

意味着很多过去必须“切片处理、反复压缩、不断丢上下文”的场景,现在终于可以更连贯地跑了。


尤其是代码审查、长文档分析、复杂工作流跟踪,这种提升是工程体感上的。



2. Tool Search(工具搜索)。

这次 OpenAI 给模型加了一套更像查字典的工具调用逻辑。


以前模型要用一堆工具时,常常得把所有工具定义都塞进上下文里,既贵又慢


现在模型可以先看工具列表,需要哪个,再把详细定义取出来。


官方测试显示,在保持相同准确率的情况下,这套机制能把总体 token 使用量降低 47%。


这看起来像一个细节优化,实际上非常关键。


因为很多 Agent 项目后来变贵、变慢、变不稳定,问题都不出在模型不会做,而出在工具上下文太臃肿。


谁先把这件事理顺,谁的 Agent 才更容易跑到真实业务里去。


可操控性


ChatGPT 中的 GPT-5.4 Thinking 现在会在处理较长、较复杂的查询时,通过一段前言来梳理其工作计划。


还可以在它生成回复的过程中添加指令或调整方向。


这使得引导模型获得你想要的精确结果变得更加容易,无需从头开始或增加多轮额外的对话。



更强了,也更贵了


GPT-5.4 的 API 价格是输入 2.5 美元 / 百万 token,输出 15 美元 / 百万 token;

GPT-5.4 Pro 则来到输入 30 美元、输出 180 美元。


相比 GPT-5.2,5.4 的单价确实更高。


但这次 OpenAI 反复强调的一点是:能力提升和效率优化同时发生。



说白了,不能只看每百万 token 多少钱,还要看完成同一件事总共要花多少 token。


如果一个模型单价更高,但推理路径更短;工具调用更省;上下文压缩更有效;返工次数更少,那它的总体成本未必更高。


这也是 GPT-5.4 很像专业生产模型的地方。它试图把能力、速度、成本放进同一个产品逻辑里。


当然,Pro 版本的价格还是很有冲击力。


这个版本更像是给极复杂任务和高价值场景准备的,不太适合把它当日常聊天模型来用。


普通团队真要大规模接入,还是得做更细的模型分层:

比如什么场景用 5.4,什么场景用更轻的模型,什么场景只在关键节点调用 Pro。


关于数字员工



GPT-5.4 的目标,已经变成一个能完成真实工作的 Agent 基座。


这背后有一个值得注意的趋势:


过去我们看模型,喜欢按学科分。

谁数学更强,谁代码更强,谁视觉更好,谁搜索更好。


现在模型开始按工作单元来竞争了。

谁能把一段任务完整跑通,谁才更接近真实价值。


AI 产品的竞争,正在从单项能力赛,转向工作流整合赛。


写在最后


如果只写成一篇模型测评文章,GPT-5.4 的故事其实很好讲:更强的知识工作、更原生的电脑操作、更完整的 coding、百万上下文、工具搜索、更低幻觉率。


但如果站在真正要做产品、做系统、做落地的人角度,更重要的问题是:这会把接下来的软件形态推向哪里?


AI 正在从给建议的工具,往参与执行的系统演进。

而一旦模型真的开始参与执行,问题就不再只是模型够不够聪明,还会涉及:权限如何控制;工具怎么接;数据如何流动;审计怎么留痕;哪些任务适合放权,哪些必须人工兜底....



这也是为什么我们一直更在意“业务、数据、AI”三者怎么协同,而不只盯着模型本身。


业务决定它要做什么,数据决定它看到什么,系统决定它能做到什么程度,模型只是把这一切串起来的那一层智能。


如果说过去几年我们一直在训练模型如何回答问题,那么接下来几年,行业真正要学的,可能是如何让模型进入工作。


而 GPT-5.4,就是这个阶段里一个非常明确的信号。


聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他