搜索结果:

返回

一文带你看懂,Claude Opus4.7有哪些重大变化

更像Agent时代的工作机器了??

AI 速览

更像Agent时代的工作机器了?? 昨晚10点半,Claude Opus4.7毫无预兆地上线了。 说突然也不算完全突然,毕竟最近Claude这几天的状态,确实有点像在憋大招。 各种卡、各种崩、各种体验波动,最后等来的就是这个新模型。

昨晚10点半,Claude Opus4.7毫无预兆地上线了。

说突然也不算完全突然,毕竟最近Claude这几天的状态,确实有点像在憋大招。

各种卡、各种崩、各种体验波动,最后等来的就是这个新模型。

整个AI圈一夜之间被刷屏了,也被公司的群刷屏了。。

公司的AI热点信息监控群

Opus4.7在高级软件工程,视觉理解,专业任务,记忆,长上下文推理,还有Agent场景里,都有一轮比较扎实的升级。

一起来详细看看。

高级软件工程

Opus 4.7最显眼的进步在高级软件工程领域,而且这次不是那种跑分赢了但体感差不多的升级,是真的能感知到差距。

官网里有很多早期测试反馈,方向基本一致。

  • CursorBench从Opus 4.6的58%到Opus 4.7的70%,
  • GitHub 93项编码基准提升13%,
  • Notion的复杂多步骤工作流比Opus 4.6提升14%,工具错误只有原来的三分之一,
  • Rakuten-SWE-Bench里解决生产任务的数量是Opus 4.6的3倍。

它还会在汇报结果前设计验证方式,这个细节很重要。

真实项目里,模型最让人头疼的地方往往不是不会写,而是它写完以后非常自信地告诉你完成了,结果根本没跑测试,没看报错,没验证边界。

一个能自己设计验证方式的模型,才更接近可以进入工程流程的Agent。

还有几个配套能力。

-Opus 4.7新增了xhigh effort level,介于high和max之间。

-Claude Code里,所有计划的默认effort level已经提升到xhigh。

-API里也开始提供task budgets公开beta,让开发者可以控制Claude在长任务里的token预算。

Claude Code还新增了/ultrareview命令,可以开启专门的代码审查会话,去检查bug和设计问题,Pro和Max用户有三次免费试用。

这些功能看起来是小更新,但连起来看,方向很统一。

Anthropic想让Claude更适合跑长任务。

这也是为什么我们认为,它越来越像一个工作机器。

有一个很有意思的细节,

Anthropic直接放了Opus 4.6和GPT-5.4的对比数据,

Opus4.6在绝大多数编程指标上没跑过GPT-5.4。

这其实算是第一次公开承认,上一代在编程上确实打不过GPT-5.4。

但Opus 4.7把这个差距追回来了,而且在部分指标上反超了。

视觉能力

视觉这块的提升幅度可能是这次最炸裂的。

Opus 4.7支持更高分辨率的图片,最长边可以到2576像素,大约3.75百万像素,是此前Claude模型的三倍以上。

这个变化不是简单看图更清楚,它会直接改变很多场景。

比如Computer Use里的高密度截图,终端小字,Figma页面,复杂图表,技术架构图,财报表格,化学结构,专利图。

模型以前能看个大概,现在开始能读到更多细节。

还有一个很夸张的数据,XBOW的视觉敏锐度测试里,Opus 4.7拿到98.5%,Opus 4.6是54.5%。

这个数据为什么有意思。

因为XBOW做的是自主渗透测试。

模型要看浏览器、后台系统、开发者工具、网络请求、弹窗、错误提示。那种画面信息密度特别高,一个小字没看清,后面的推理就可能全歪。

所以视觉能力提升,不只是给普通用户看图用的。

对Agent来说,视觉是它理解现实工作界面的入口。

看不清,就做不对。

这对我们这种做产品、做系统、做界面的人也挺有意义。

以后拿一张后台截图、一张复杂看板、一张Figma设计稿给Claude,它能不能准确读出页面结构、组件状态、数据含义,会直接影响后续分析质量。

这次Opus 4.7在视觉上补的不是短板,某种程度上是在给Agent补眼睛。

专业任务

Opus 4.7在real-world work上也有提升,尤其是金融分析、专业演示、Office类工作和跨任务整合。

它在GDPval-AA上也是当前最强之一。

Claude一直以来就比较适合知识工作,

Opus 4.7如果能在文档推理、财务分析、法律材料、专业报告上更稳,那确实很有价值。

但这里也要看具体任务。

如果你让它读复杂文件,整理数据,做专业判断,它可能更强。

如果你让它写一段很有人味的文章,或者做品牌表达,结果就不一定完全让人满意。

这也是很多实测反馈里最有争议的点。

不少人说Opus 4.7变强了,但也更GPT味了。

它在编码、视觉和Agent任务上明显更能打,

但在内容创作这些场景里不如之前。。

很多用户最喜欢Claude的地方,是它原来那种文字品味和人味,Opus 4.7在这方面的体感变得不那么稳定。

如果Opus 4.7为了更强的工程执行,慢慢牺牲这部分东西,我觉得会挺可惜==

记忆

Opus 4.7在文件系统记忆上更强,能够跨长时间、多会话工作记住重要说明,并用这些记忆进入新任务,减少一开始需要塞进去的上下文。

这也是Agent化很关键的一步。

以前我们跟模型协作,每次都像重新入职。

你要重新告诉它项目背景、文件结构、编码偏好、业务规则、之前做过什么、不要再犯什么错。

如果文件系统记忆能变得可靠,那Claude就更像一个能持续工作的协作者。

但记忆越强,治理也越重要。

哪些记忆该留下,哪些该丢掉,哪些是项目规则,哪些只是临时偏好,哪些内容会污染后续任务,这些都会成为新的问题。

所以我们一直觉得,Agent真正进入生产之后,记忆不是越多越好。

记忆要能被管理。

安全这件事

先说背景。上周Anthropic发布了Project Glasswing,

展示了Mythos Preview的网络安全能力。

这个模型在各项测试上的表现明显强于Opus 4.7,但Anthropic不打算把它公开放出来。

Opus 4.7在网络安全能力上,是被刻意削弱过的。

他们在训练过程中实验性地差异化降低了网络安全相关的能力。

同时上线了一套自动检测和拦截高风险网络安全请求的防护措施,合法安全研究人员如果要用Opus 4.7做漏洞研究、渗透测试、红队演练,可以申请Cyber Verification Program。

这是一个进入产业级应用后,非常有长期价值的设计。

因为模型能力越强,越会遇到一件事。

全开不现实,全关也不现实。

安全研究、企业红队、漏洞复现、合规测试,这些本来就是合法需求。

但如果模型分不清你是在做合法研究,还是在做恶意攻击,它就只能粗暴拒绝。

所以身份核验、分级授权、专门通道,会越来越重要。

今天是网络安全。

以后可能是医疗、金融、生物、法务、供应链模拟、企业风控。

强模型真正进入产业,不可能只靠一个统一的开放策略。

它需要更细的权限系统。

迁移注意事项

有两个坑需要提前知道。

一个是新的tokenizer。

同样输入可能变成更多tokens,大概是原来的1.0到1.35倍,具体看内容类型。

另一个是更高effort下会思考得更多,特别是在Agent场景后几轮对话里,会产生更多输出tokens。

价格确实没变。

输入每百万tokens 5美元,输出每百万tokens 25美元。

但真实成本要看你的用法。

  • 如果你做的是高难任务,Opus 4.7少返工、少工具错误、一次通过率更高,那它可能反而更划算。
  • 如果你只是用它做一些轻任务,或者提升不明显的普通任务,那多出来的token消耗就会更明显。

所以不建议大家看到价格没变就默认它成本没变,看到token变多就直接说它隐形涨价。

这两个说法都太简单。

更好的办法是,拿自己的真实任务跑一遍。

同一个需求,用Opus 4.6和Opus 4.7分别跑,看完成质量、返工次数、总tokens、总耗时,再决定要不要切。

如果你是开发团队,可以先从Claude Code里的high或者xhigh开始,不要一上来就max,也不要所有任务都用最重档位。

如果你是内容团队,可以先用Opus 4.7做资料理解、长文档分析、结构梳理,再观察它的文字输出是不是符合你要的风格。

不要急着把所有创作工作流都迁过去。

Opus 4.7很强,但它不是所有任务的默认答案。

现在模型越来越像专业工具了。

越强,越需要放对地方。

写在最后

Claude越来越适合Agent时代。

只是希望它在越来越会干活的同时,别把原来那点会说人话的味儿丢得太快。

模型在进化,如果每一次进化都是有取舍的,我们能做的,就是把它擅长的部分充分用起来,把它退步的部分自己补上~

这大概也是这个时代做技术的人,需要一直保持的状态。

工具永远在变,但判断力得一直在自己手里。

聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他