搜索结果:

返回

聊聊MiniMax M2.7:自我进化的早期回响

当模型开始自我迭代,当AI开始参与AI的创造,我们正在见证的是一个新纪元的序章。

AI 速览

当模型开始自我迭代,当AI开始参与AI的创造,我们正在见证的是一个新纪元的序章。 距离M2.5发布仅过去一个月,就在昨天,MiniMax正式发布了M2.7模型。 官方给它定的标签很明确:这是他们第一个“深度参与自身进化”的模型。 同时,M2.7已经在MiniMax Agent和开放平台上线,API侧也同步放出了M2.7与M2.7-highspeed两个版本。

距离M2.5发布仅过去一个月,就在昨天,MiniMax正式发布了M2.7模型。


官方给它定的标签很明确:这是他们第一个“深度参与自身进化”的模型。


同时,M2.7已经在MiniMax Agent和开放平台上线,API侧也同步放出了M2.7与M2.7-highspeed两个版本。


这次发布的重点地方有两层:


  • 第一层,M2.7的Agent能力明显更完整了
  • 第二层,MiniMax开始把模型参与模型优化这件事,往一个可验证、可持续的方向推。

这两个点叠在一起,M2.7 更像一个开始朝自我迭代型 Agent 基座靠近的版本。


当模型开始参与自身训练与优化,AI 的自治能力会走到哪一步?


自我进化:从被投喂到自己觅食


先看几个官方给出的核心数据。

在SWE-Pro上,M2.7的准确率达到 56.22%;

在VIBE-Pro上是 55.6%;

在Terminal Bench 2上达到 57.0%。


这组能力总结下来就是:不仅会写代码,还能处理真实工程场景里的排障、修复、重构和系统理解。



在MiniMax的内部研发流程中,M2.7被赋予了这样一个任务:协助强化学习团队进行实验。


以往需要多名研究员协作完成的工作:

查阅文献、配置实验环境、监控训练状态、分析日志、调试代码、提交合并请求、执行冒烟测试。

现在由M2.7承担了30%到50%的工作量。



更值得关注的是,它不仅仅是执行命令,更具备了对整个研发流程的主动优化能力。


他们还做了一项内部测试:让M2.7完全自主地运行一个循环:

分析失败轨迹 → 规划改动 → 修改scaffold代码 → 跑评测 → 对比结果 → 决定保留还是回滚


这一轮它跑了100多次,最后让内部评测集的表现提升了约30%


如果把这件事翻译成人话,其实就是:

M2.7不只是完成任务,它开始参与怎么把做任务这套系统变得更好这件事。


这意味着什么?

过去我们依赖人类研究员的经验和直觉来调优模型,现在M2.7已经能够自主探索优化路径,并且找到人类可能忽略的改进空间。


MiniMax认为未来AI的自我进化,会逐渐走向更高自治程度,甚至覆盖数据构建、模型训练、推理架构、评估等环节。


这话当然还很前瞻,但至少M2.7这次,已经把这个方向从口号推到了工程实践阶段。


走进现场的能力


如果说自我进化能力是M2.7的隐藏技能

那么它在实际工程场景中的表现,则直接展现了这种能力的落地价值。


前面提到,SWE-Pro基准测试中M2.7拿下了56.22%的正确率,与GPT-5.3-Codex持平。


但比分数更值得玩味的是它在真实生产环境中的表现。


想象这样一个场景:

凌晨两点,线上系统突然告警,数据库CPU飙升。

传统模式下,需要值班工程师爬起来看日志、查监控、定位问题、写修复脚本。整个过程少则半小时,多则数小时。


而M2.7的处理流程是这样的:


收到告警后,它首先关联监控指标和部署时间线进行因果推理;

然后对调用链采样数据进行统计分析,提出精确的故障假设;

接着主动连接数据库验证根因,在代码仓库中定位到缺失的索引迁移文件;

最关键的一步是,它懂得先用非阻塞方式创建索引来止血,然后再提交代码合并请求。


从发现故障到恢复系统,整个过程被压缩到了三分钟以内。



虽然这属于内部案例,外部还需要更多验证。


但这个案例至少说明MiniMax想把M2.7放到一个更真实的技术场景里去证明自己,而不是只停留在benchmark层。


另外这次M2.7原生还支持多Agent协作。


多Agent场景对模型提出的是范式级要求

因为这里涉及:角色边界;对抗性推理;协议遵循;行为差异化,这些能力只靠 prompting 很难稳定做出来,必须被模型内化成原生能力。



现在很多多Agent系统,看起来很热闹,实际上只是多个 prompt 轮流接力。


角色会串,状态会飘,任务越长越乱。


MiniMax这次把Agent Teams放到软件工程这一节里,其实是在说明:他们理解的软件工程,不只是单模型写代码,而是多角色协作完成复杂构建


这也解释了为什么很多人会觉得M2.7更适合放进OpenClaw这类框架里看。


因为它开始做的是一个更适合复杂Agent场景的模型。


开始接近能交付工作


另外的亮点,专业工作和复杂办公环境。


(1)专业知识和任务交付能力


在GDPval-AA上,M2.7的ELO达到1495。

官方表示这是开源模型里最高水平,并且超过了GPT-5.3。


同时,他们专门强化了Word、Excel、PPT的复杂编辑能力。

重点不只是能生成一个文件,还可以:


基于模板直接生成;

在现有文件上多轮高保真修改;

最终交付的还是可编辑文件,而不是一次性展示品。


这件事对真实办公场景很重要。

因为工作里最烦的,从来不是生成第一版,而是后面反复改。


(2)复杂环境交互能力


在Toolathon上,M2.7 达到 46.3%;

在MM Claw testing里,它在40个复杂skills、每个超过 2000 token 的环境下,还能保持97%的skill compliance rate。


这个指标的意义是:模型开始更稳定地理解和调用大量复杂技能,而不是一多就乱。


这对Agent非常关键。


因为真正进入工作流时,模型面对的从来都不是一个单技能沙盒,而是一堆长提示、长文档、长技能说明混在一起的环境。


官方还给了一个案例。

任务:根据台积电的年度报告和财报电话会议信息,构建台积电的收入模型。阅读多份研究报告,设计相应的假设,根据最新信息建立台积电的收入模型,然后根据PPT模板制作PPT,并撰写一份Word文档形式的研究报告。



这个案例是不是完全无水分,大家可以继续观察。


但它传递出来的方向很明确:

模型开始逼近初级知识工作者的角色。


以前大家说模型会做PPT、会做报告,很多时候只是会生成格式

现在更大的变化是,它开始具备:读材料;建判断;做结构化输出;在多种办公介质里完成交付


当然,它肯定还远没有到完全替代人的阶段。


但它已经开始出现在一个更实际的位置上:不是最终决策者,是能把第一轮重活先做完的那个数字同事。


有温度的智能


最后在偏C端互动的场景中,M2.7在角色一致性和情感智能上表现很好。

它的价值更多在于,对陪伴类产品、角色扮演类交互、多轮对话型产品、强人格一致性的应用,会更有想象空间。


M2.7这次不是只朝生产力去了,交互产品这条线它也留了口子。


写在最后



当模型开始自我迭代,当AI开始参与AI的创造,我们正在见证的不仅是一次产品发布,更是一个新纪元的序章。


变化已经开始了,而且大概率会比很多人想得更快。


它不会等你把过去的方法论整理完,也不会等你把现有流程慢慢适应完。


很多原本还停留在“演示”“尝鲜”“试试看”的能力,正在一点点越过那条线,开始进入真实工作。


技术的浪潮一浪高过一浪,真正拉开差距的,从来不是追逐每一个新工具,而是谁能把这些能力组合成真正的业务价值。


模型再强,也需要有人理解它的边界;能力再全,也需要落到具体的场景里解决实际问题。


在极客上线,我们一直在关注这些变化。


如果你也在思考:当技术边界不断被推远,自己的业务该怎么借力前行;当AI的能力越来越强,企业又该如何真正把它用起来?


欢迎来和我们聊聊。


聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他