前两天,OpenAI放出了GPT-image-2,疯狂破圈。
文字渲染、版式、世界知识这些,过去一直是AI生图的老大难,它几乎全解了。
这几天体感也很直接,大家应该都看到不少用它造的图,随便刷一圈,都会有一种很强的感觉,OpenAI又把整个互联网拖进了它的节奏里。
但还没等这波劲儿过去。
今天,GPT-5.5又来了。

前脚刚把产品层的热度点起来,后脚就把模型层的大招甩出来。编程、Agent、知识工作、文档处理、科研能力,一口气全往上抬。
社区的口碑也好到爆。
OpenAl重回AI领域无可争议的第一位。
在Artificial AnalysisIntelligence Index上领先3分,打破了与Anthropic和Google的三方平局。

GPT-5.5是他们目前最聪明、也最好用的新模型,
而且它瞄准的是一种新的电脑工作方式。

代理编码
先从最前面的重头戏说起,编程。

GPT-5.5这次最狠的提升,还是在agentic coding这块。
Terminal-Bench 2.0测试考的是全链路Agent工程实力。

在这里,从GPT-5.4的75.1拉到了82.7,Claude Opus 4.7是69.4。
OpenAI那套更偏长周期工程任务的内部评测里,GPT-5.5是73.1,GPT-5.4是68.5。
拉升十分明显。
来看看这些案例:
1
阿尔忒弥斯太空任务可视化应用
Prompt:
使用 WebGL 和 Vite,并基于阿尔忒弥斯二号任务的真实数据,开发一个全新的应用程序。务必对应用程序进行全面测试,直至其功能完全正常,且外观与图片所示一致。请特别注意行星和飞行路径的渲染效果。我希望能够与 3D 渲染结果进行交互。确保其轨道力学真实可信。
2
UFO射击游戏
Prompt:
使用 three.js 创建一个 3D 游戏。游戏内容应为 UFO 射击,玩家需要控制坦克击落头顶飞过的 UFO。
逐步思考,深呼吸。回答前,复述一遍问题。
想象一下,你正在为一位即将开始构建游戏的初级开发人员编写操作指南。你能否写出非常清晰明确的说明,包括他们需要查看哪些文件进行修改以及需要修复哪些文件?
然后编写所有代码。游戏采用低多边形设计,但要美观。
记住,你是一名代理:请持续处理,直到用户的问题完全解决后再结束你的回合并将选择权交还给用户。将用户的查询分解为所有必要的子请求,并确认每个子请求都已完成。不要在只完成部分请求后就停止。只有当你确信问题已解决时才能结束你的回合。你必须做好回答多个查询的准备,并且只有在用户确认完成后才能结束通话。
在进行后续函数调用之前,必须按照工作流程步骤进行充分的计划,并充分思考每次函数调用的结果,确保用户的查询和相关的子请求得到完全解决。
除了基准测试之外,GPT-5.5还有着更强的理解系统结构的能力:为什么某些东西会失败,修复需要在哪里进行,以及代码库中的其他哪些部分会受到影响。
在推理和自主性方面明显优于GPT-5.4和Claude Opus 4.7,能够提前发现问题,并在无需明确提示的情况下预测测试和审查需求。
例如,要求GPT-5.5重新设计一个协作式Markdown编辑器中的评论系统,结果返回的是一个几乎完整的12差异堆栈。
知识工作
紧接着就是知识工作。

GDPval,评估AI在44个职业中完成规范知识工作的水平。
GPT-5.5拿到84.9%,Opus 4.7是80.3%,Gemini 3.1 Pro只有67.3%。
Tau2-bench Telecom这种复杂客服工作流里,GPT-5.5在没有微调提示词的情况下达到98.0%。

这一块挺容易被低估。
因为大家一提模型升级,大多数还是写代码、跑榜、做游戏demo。
可真正能让企业持续掏钱的,很多时候并非这些最酷的展示,是每天都要做、又特别耗人的工作。
找资料,读文件,拉表,清数据,整理材料,做一版可以发出去的文档,或者把一堆很乱的业务输入收成一个可以继续往下推进的方案.....
有意思的是,OpenAI各个团队也运用了这些优势,超过85%的员工每周都在用Codex,覆盖软件工程、财务、传播、市场、数据科学和产品管理。
有人拿它分析半年演讲邀约数据,有人拿它审24771份税表,总页数71637页,还有人直接把每周业务报告自动化了,每周省下5到10个小时。
GPT-5.5不只在程序员圈子里变强,开始在更大范围的办公室工作里长出存在感。
科学研究
再往下,就是科研。
这些工作流程需要的不仅仅是回答一个难题,研究人员需要探索一个想法,收集证据,检验假设,解释结果,并决定下一步的尝试方向。与其他模型相比,GPT-5.5 更擅长完成这一循环。
来看看科学家们怎么用它:
1. 协助发现了一个关于拉姆齐数的新证明,并在Lean中得到了验证。
2. 波兰波兹南亚当·密茨凯维奇大学数学系助理教授Bartosz Naskręcki使用Codex中的GPT-5.5,仅用11分钟就根据一个提示构建了一个代数几何应用程序,这个程序可视化了二次曲面的交点,并将生成的曲线转换为了Weierstrass模型。

3. 杰克逊基因组医学实验室的免疫学教授兼研究员德里亚·乌努特马兹(Derya Unutmaz) 使用它分析了一个包含62个样本和近28,000个基因的基因表达数据集,生成了一份详细的研究报告。
这份报告不仅总结了研究结果,还提出了关键问题和见解。
他说,这项工作,本来要花团队几个月的时间。
OpenAI对GPT-5.5在科研中的定位,有一句话概括得很准:一个研究伙伴。
推理效率
过去大家普遍的认知是:模型更强,通常也更慢。
更强却更快是怎么做到的?
答案不是只在模型上做优化,OpenAI把整套推理系统一起重构了。
GPT-5.5和NVIDIA的GB200、GB300 NVL72是协同设计、训练和部署的。
更妙的一层在后面,Codex分析了几周真实生产流量数据,自己写出了新的负载均衡和分区启发式算法,把token生成速度又拉高了20%以上。
模型不只是结果生成器,它开始进入工作系统本身。
安全
这部分没有编程和科研那么炸,但很重要。
GPT-5.5的网络安全能力比GPT-5.4又上了一步,所以同步加强了防护。
更严格的分类器,更紧的高风险活动控制,对重复滥用的额外保护,同时还开了Trusted Access for Cyber,让通过验证的防御方拿到限制更少的高级网络安全能力。
申请入口也放出来了。
现在OpenAI给出的办法更像产业级做法,默认更严,合规防御方单独开通道。
以后这套思路大概率不会只停在网络安全,其他高风险又确实有正当需求的领域,多半也会往这个方向走。
强模型真正进入行业,靠的不会只是更高能力,还得有更细的放行机制
价格
最后就是大家最关心的价格了。
GPT-5.5的API定价,每百万输入Token 5美元,每百万输出Token 30美元。
GPT-5.4是2.5美元和15美元。
整整翻了一倍。
GPT-5.5 Pro的价格更猛,输入30美元,输出180美元。
OpenAI给的解释是,5.5更聪明,也更token efficient,Codex里大部分用户完成同样任务时会用更少tokens。
这个逻辑是通的,但账还是得自己算。
· 如果本来就在重度跑复杂工程任务,返工少一点、重试少一点,最后总成本未必难看。
· 如果只是日常轻量调用,那这个价格的存在感就会非常强。
总的来说,GPT-5.5上线,OpenAI终于重铸荣光。
真正的竞争已经慢慢转向另一层,谁能先把AI接进真实工作流,谁就更有机会定义下一代电脑怎么被使用。
跑分只是能力证明,Agent化办公才是更大的战场。

写在最后
回看这一周,新模型一波接一波地上,节奏特别快。
那种熟悉的、让整个行业都绷紧一点的压迫感又回来了。
大家都在往前冲,领先不是静态的,落后也不是永久的。
在这个AI时代里,保持好奇,保持创造,保持对未知的热情,
愿我们都能借助这些新的能力,把自己的想法,变成真实可见的风景。


