昨晚10点半,Claude Opus4.7毫无预兆地上线了。
说突然也不算完全突然,毕竟最近Claude这几天的状态,确实有点像在憋大招。
各种卡、各种崩、各种体验波动,最后等来的就是这个新模型。
整个AI圈一夜之间被刷屏了,也被公司的群刷屏了。。

公司的AI热点信息监控群
Opus4.7在高级软件工程,视觉理解,专业任务,记忆,长上下文推理,还有Agent场景里,都有一轮比较扎实的升级。

一起来详细看看。
高级软件工程
Opus 4.7最显眼的进步在高级软件工程领域,而且这次不是那种跑分赢了但体感差不多的升级,是真的能感知到差距。
官网里有很多早期测试反馈,方向基本一致。
- CursorBench从Opus 4.6的58%到Opus 4.7的70%,
- GitHub 93项编码基准提升13%,
- Notion的复杂多步骤工作流比Opus 4.6提升14%,工具错误只有原来的三分之一,
- Rakuten-SWE-Bench里解决生产任务的数量是Opus 4.6的3倍。
它还会在汇报结果前设计验证方式,这个细节很重要。
真实项目里,模型最让人头疼的地方往往不是不会写,而是它写完以后非常自信地告诉你完成了,结果根本没跑测试,没看报错,没验证边界。
一个能自己设计验证方式的模型,才更接近可以进入工程流程的Agent。
还有几个配套能力。
-Opus 4.7新增了xhigh effort level,介于high和max之间。
-Claude Code里,所有计划的默认effort level已经提升到xhigh。
-API里也开始提供task budgets公开beta,让开发者可以控制Claude在长任务里的token预算。
Claude Code还新增了/ultrareview命令,可以开启专门的代码审查会话,去检查bug和设计问题,Pro和Max用户有三次免费试用。
这些功能看起来是小更新,但连起来看,方向很统一。
Anthropic想让Claude更适合跑长任务。
这也是为什么我们认为,它越来越像一个工作机器。

有一个很有意思的细节,
Anthropic直接放了Opus 4.6和GPT-5.4的对比数据,
Opus4.6在绝大多数编程指标上没跑过GPT-5.4。
这其实算是第一次公开承认,上一代在编程上确实打不过GPT-5.4。
但Opus 4.7把这个差距追回来了,而且在部分指标上反超了。
视觉能力
视觉这块的提升幅度可能是这次最炸裂的。
Opus 4.7支持更高分辨率的图片,最长边可以到2576像素,大约3.75百万像素,是此前Claude模型的三倍以上。

这个变化不是简单看图更清楚,它会直接改变很多场景。
比如Computer Use里的高密度截图,终端小字,Figma页面,复杂图表,技术架构图,财报表格,化学结构,专利图。
模型以前能看个大概,现在开始能读到更多细节。
还有一个很夸张的数据,XBOW的视觉敏锐度测试里,Opus 4.7拿到98.5%,Opus 4.6是54.5%。

这个数据为什么有意思。
因为XBOW做的是自主渗透测试。
模型要看浏览器、后台系统、开发者工具、网络请求、弹窗、错误提示。那种画面信息密度特别高,一个小字没看清,后面的推理就可能全歪。
所以视觉能力提升,不只是给普通用户看图用的。
对Agent来说,视觉是它理解现实工作界面的入口。
看不清,就做不对。
这对我们这种做产品、做系统、做界面的人也挺有意义。
以后拿一张后台截图、一张复杂看板、一张Figma设计稿给Claude,它能不能准确读出页面结构、组件状态、数据含义,会直接影响后续分析质量。
这次Opus 4.7在视觉上补的不是短板,某种程度上是在给Agent补眼睛。
专业任务
Opus 4.7在real-world work上也有提升,尤其是金融分析、专业演示、Office类工作和跨任务整合。
它在GDPval-AA上也是当前最强之一。

Claude一直以来就比较适合知识工作,
Opus 4.7如果能在文档推理、财务分析、法律材料、专业报告上更稳,那确实很有价值。
但这里也要看具体任务。
如果你让它读复杂文件,整理数据,做专业判断,它可能更强。
如果你让它写一段很有人味的文章,或者做品牌表达,结果就不一定完全让人满意。
这也是很多实测反馈里最有争议的点。
不少人说Opus 4.7变强了,但也更GPT味了。
它在编码、视觉和Agent任务上明显更能打,
但在内容创作这些场景里不如之前。。
很多用户最喜欢Claude的地方,是它原来那种文字品味和人味,Opus 4.7在这方面的体感变得不那么稳定。
如果Opus 4.7为了更强的工程执行,慢慢牺牲这部分东西,我觉得会挺可惜==
记忆
Opus 4.7在文件系统记忆上更强,能够跨长时间、多会话工作记住重要说明,并用这些记忆进入新任务,减少一开始需要塞进去的上下文。
这也是Agent化很关键的一步。
以前我们跟模型协作,每次都像重新入职。
你要重新告诉它项目背景、文件结构、编码偏好、业务规则、之前做过什么、不要再犯什么错。
如果文件系统记忆能变得可靠,那Claude就更像一个能持续工作的协作者。
但记忆越强,治理也越重要。
哪些记忆该留下,哪些该丢掉,哪些是项目规则,哪些只是临时偏好,哪些内容会污染后续任务,这些都会成为新的问题。
所以我们一直觉得,Agent真正进入生产之后,记忆不是越多越好。
记忆要能被管理。
安全这件事
先说背景。上周Anthropic发布了Project Glasswing,
展示了Mythos Preview的网络安全能力。
这个模型在各项测试上的表现明显强于Opus 4.7,但Anthropic不打算把它公开放出来。

Opus 4.7在网络安全能力上,是被刻意削弱过的。
他们在训练过程中实验性地差异化降低了网络安全相关的能力。
同时上线了一套自动检测和拦截高风险网络安全请求的防护措施,合法安全研究人员如果要用Opus 4.7做漏洞研究、渗透测试、红队演练,可以申请Cyber Verification Program。
这是一个进入产业级应用后,非常有长期价值的设计。
因为模型能力越强,越会遇到一件事。
全开不现实,全关也不现实。
安全研究、企业红队、漏洞复现、合规测试,这些本来就是合法需求。
但如果模型分不清你是在做合法研究,还是在做恶意攻击,它就只能粗暴拒绝。
所以身份核验、分级授权、专门通道,会越来越重要。
今天是网络安全。
以后可能是医疗、金融、生物、法务、供应链模拟、企业风控。
强模型真正进入产业,不可能只靠一个统一的开放策略。
它需要更细的权限系统。
迁移注意事项
有两个坑需要提前知道。
一个是新的tokenizer。
同样输入可能变成更多tokens,大概是原来的1.0到1.35倍,具体看内容类型。
另一个是更高effort下会思考得更多,特别是在Agent场景后几轮对话里,会产生更多输出tokens。

价格确实没变。
输入每百万tokens 5美元,输出每百万tokens 25美元。
但真实成本要看你的用法。
- 如果你做的是高难任务,Opus 4.7少返工、少工具错误、一次通过率更高,那它可能反而更划算。
- 如果你只是用它做一些轻任务,或者提升不明显的普通任务,那多出来的token消耗就会更明显。
所以不建议大家看到价格没变就默认它成本没变,看到token变多就直接说它隐形涨价。
这两个说法都太简单。
更好的办法是,拿自己的真实任务跑一遍。
同一个需求,用Opus 4.6和Opus 4.7分别跑,看完成质量、返工次数、总tokens、总耗时,再决定要不要切。
如果你是开发团队,可以先从Claude Code里的high或者xhigh开始,不要一上来就max,也不要所有任务都用最重档位。
如果你是内容团队,可以先用Opus 4.7做资料理解、长文档分析、结构梳理,再观察它的文字输出是不是符合你要的风格。
不要急着把所有创作工作流都迁过去。

Opus 4.7很强,但它不是所有任务的默认答案。
现在模型越来越像专业工具了。
越强,越需要放对地方。
写在最后
Claude越来越适合Agent时代。
只是希望它在越来越会干活的同时,别把原来那点会说人话的味儿丢得太快。
模型在进化,如果每一次进化都是有取舍的,我们能做的,就是把它擅长的部分充分用起来,把它退步的部分自己补上~
这大概也是这个时代做技术的人,需要一直保持的状态。
工具永远在变,但判断力得一直在自己手里。


