搜索结果:

返回

DeepSeek新年开卷!新论文mHC

解读DeepSeek新年第一篇论文。

AI 速览

解读DeepSeek新年第一篇论文。 2025年12月31日,当大多数人准备迎接新年时, DeepSeek-AI团队在arXiv上发布了一篇新论文: mHC

2025年12月31日,当大多数人准备迎接新年时,

DeepSeek-AI团队在arXiv上发布了一篇新论文:


mHC

(Manifold-ConstrainedHyper-Connections)



论文地址: https://www.arxiv.org/abs/2512.24880


提出了一个针对大规模神经网络(特别是Transformer类模型) 宏观结构优化方法,

旨在解决现有超连接(Hyper-Connections,HC)方法在训练稳定性和扩展性方面的问题


元旦假期回来,赶紧从头到尾又查阅各种资料看了看。

真的很硬核,详细了解完,有一个非常强烈的感受:


相比参数和 benchmark 的提升,这篇论文更关心的是另一件事:

模型怎么才能长期跑下去”。



这篇论文在解决什么问题?

如果用一句话概括这篇论文,它关心的并不在于


  • 模型还能不能再聪明一点
  • 推理速度能不能再快一点
  • 榜单排名还能不能再上升一位


它把注意力放在了一个更偏工程、但迟早会遇到的问题上:


当模型结构不断扩展、连接不断增多时,信息在系统内部还能不能被稳定、可靠地传递?”


在现有的Hyper-Connections(HC) 结构中,

连接一旦变得复杂,信息强度容易失控,训练过程会出现明显波动,扩展性也随之下降。

这类问题往往不会在小模型阶段暴露,

但在大规模训练中几乎不可避免


就像一台精密仪器,部件越多,相互作用的复杂度越高,维持稳定运行的成本就越大。



三种网络连接结构的演进:

从标准的残差连接(a),到引入可学习映射以扩展信息路径的超连接 HC(b),

再到通过流形投影(𝒫)对映射空间进行约束、显著提升训练稳定性的 mHC(c)



mHC 给出的解法,其实非常清晰:

通过引入流形约束和系统级优化,对连接的强度与结构进行统一约束


让 HC 在规模扩展时依然保持稳定性,

为大模型训练提供了一种高效、稳定、可扩展的宏观连接方案


这正是一个很多人容易低估、

但真正做系统的人一定会踩到的坑。


01

一个被反复低估的问题


过去几年,大模型的能力提升非常快。

模型更大、层数更深、信息流更复杂。


但与此同时,一个老问题也在不断被放大:

信息在模型内部传递时,是否可靠?


如果用一句话形容这个问题,就是:

“信息在的过程中,容易失真、放大,或者直接消失。”


在神经网络里,这类问题有很多名字:

梯度消失、梯度爆炸、训练不稳定……

它们本质都是信息传递机制的故障。


为了缓解这些问题,行业做过很多尝试,其中最重要的一次突破,

就是残差连接(Residual Connection)


它的直觉很简单:

“让原始信息可以绕过中间层,直接参与后续计算。”


这一步,几乎奠定了现代深度网络的基础。

自ResNet以来,无论是卷积网络还是Transformer,残差连接都成为标配设计。


它的核心优势在于身份映射(identity mapping)

确保信息在传递过程中有一个“保底通道”,不会被完全扭曲。


02

当信息通路变多,问题反而变复杂了


随着模型变得更大、更复杂,一条“直通”的信息通路,已经不够用了。


于是,出现了更激进的设计:

Hyper-Connections(超连接)


你可以把它理解为:不再是一条“直达通路”,而是多条并行的信息交互路径


这样做的好处很明显:


  • 信息吞吐量更大
  • 表达能力更强
  • 模型性能短期内确实会上涨

但问题也随之而来,而且非常“工程化”。


当信息通路变成多条之后,模型开始出现两类极端情况:


  • 有的信息被反复放大,在不同通路中相互叠加
  • 有的信息被“责任稀释”,在多路径中逐渐消失

结果就是训练过程变得极其不稳定,甚至会在某个阶段直接崩掉。问题并不出在模型“聪不聪明”,而是系统在复杂结构下逐渐失去了控制



HC 与 mHC 的训练稳定性对比

HC 在训练过程中表现出更明显的损失偏移与梯度波动,

而 mHC 能够在整个训练阶段维持更平滑、稳定的优化轨迹


论文中有一个令人印象深刻的观察

在标准的HC结构中,当训练到约12k步时,会出现意外的损失突增,同时梯度范数出现剧烈波动。


这种不稳定性具有明显的结构性特征,源于连接设计本身的系统性缺陷。


03

mHC 做的事:给自由加上约束


DeepSeek 的这篇论文,核心思想并不复杂,但非常克制。


他们没有否定 Hyper-Connections,

也没有回退到更保守的结构。


他们做的是另一件事:为多路径信息流,引入严格的数学约束


论文里,这套机制叫:

Manifold-ConstrainedHyper-Connections


如果不看公式,只看直觉,可以这样理解:


  • 信息依然可以在多条路径中流动
  • 但每一次流动,都必须满足“守恒”和“可追溯”
  • 不允许无中生有的放大
  • 也不允许责任被无限分散

在数学上,这体现在双重随机矩阵(doubly stochastic matrix)约束上。


论文使用了Sinkhorn-Knopp算法将连接矩阵投影到Birkhoff多面体这一特定的流形上,

确保每一行的和为1,每一列的和也为1。



这相当于为信息流动建立了“交通规则”:


每条道路的通行总量是固定的,不会出现某条路过度拥堵,也不会出现某条路完全闲置。



当 HC 在深层网络中进行复合传播时,

反向梯度的放大效应会不断叠加,最高可达到千倍量级,

这也是其在大规模模型中难以稳定训练的根本原因之一。


在工程效果上,mHC带来的变化非常直接:

  • 信息不会被异常放大
  • 信息不会在路径中悄然消失
  • 训练过程的波动被显著压低



论文中有一个非常夸张、但也非常直观的对比:


不受约束的HC在最坏情况下会将信息强度放大近3000倍

而引入流形约束的mHC,

则能将信号放大的上限严格压制在约1.6倍以内


这不是参数优化,这是风险压制。


像一个精密的供电系统,mHC确保电压稳定在安全范围内。


04

性能提升6.7%的“系统保险”


最令人印象深刻的是mHC的工程实现。

论文不仅提出了理论方案,还提供了完整的系统级优化方案:


1. 核融合

将多个小操作合并成大操作,减少内存访问次数。特别是在处理RMSNorm和高维隐状态时,通过重排序计算流程,在保持数学等价的同时大幅提升效率。


2. 选择性重计算

mHC引入了额外的中间激活,直接存储会显著增加显存占用。团队设计了一种巧妙的块状重计算策略:只存储每个计算块的第一层输入,反向传播时按需重算。通过理论推导找到了最优块大小,最小化总显存占用。


3. 通信与计算重叠

在分布式训练中,mHC需要额外的跨阶段通信。团队扩展了DualPipe调度器,让mHC的计算与管道通信重叠,避免计算设备空闲等待。



mHC 没有让新增计算路径成为流水线的“负担”,

通过扩展 DualPipe 调度器,将如 F_post_res 等额外计算与通信和主计算过程进行并行重叠,

使整体训练时间的额外开销被控制在约 6.7%。


通过这些优化,mHC在扩展率n=4时仅增加约6.7%的训练时间

这是一个令人惊喜的数字


对一家真正训练大模型的团队来说:


  • 一次训练失败,意味着数周时间和数千万成本直接归零
  • 稳定性,本身就是一种极其昂贵的能力

mHC本质上做的一件事:“用可控的额外成本(6.7%的时间开销),换取数量级下降的系统性风险。”


这在任何工程体系里,都是一笔极其划算的“保险”


05

实验结果:稳定基础上的全面进步


论文在3B、9B、27B不同规模的模型上进行了全面验证。

结果令人信服:


Part1

训练稳定性显著提升:mHC完全避免了HC中出现的损失突增现象,在整个训练过程中保持平滑收敛。梯度范数也保持在稳定范围内。


Part2

下游任务性能全面进步:在BBH、DROP、MMLU等8个主流评测集上,mHC不仅全面超越Baseline,在多数任务上也超过了原始的HC。

特别是在推理任务上(BBH +2.1%,DROP +2.3%),mHC展现出了更强的能力。


Part3

扩展性验证:从3B到27B的不同规模实验中,mHC的性能优势都能稳定保持,没有出现“大模型失效”的现象。



下游任务性能对比

在 27B 模型规模下,mHC 在大多数任务上优于 Baseline,

并在整体表现上进一步超过 HC。


06

透露出的信号


DeepSeek 这篇论文,真正值得关注的地方,

不只在于 mHC 本身,它同时透露出了一个清晰方向:


大模型的竞争,正在从谁更聪明

转向谁更稳、更可控、更能长期运行


当模型开始承担真实任务、长期运行、参与决策时:


  • 稳定性比峰值性能更重要
  • 约束能力比完全自由更重要
  • 系统一致性比偶然的突破更重要

这和我们在真实业务系统中看到的情况,是高度一致的。


任何一个需要7×24小时运行的系统,可靠性都是首要考量。


AI模型正在从“演示品”转变为“生产力工具”,

这个转变对系统设计提出了全新的要求。


写在最后


如果回头看,你会发现一个很明显的变化:


  • 早期的大模型,更像一次“能力展示”
  • 现在的大模型,越来越像一套需要长期运行的系统

而系统工程,从来不是靠“灵感”取胜的。它依赖的是:


  • 约束:明确的边界和规则
  • 稳定:可预测的行为和输出
  • 可预期的行为:在复杂环境下依然保持一致性


这篇论文在一个非常关键的层面,补上了长期被忽视的一块拼图。


在我们看来,这类工作才是真正决定AI能否从“能用”走向“可持续”的基础


技术会继续演进,但真正能走远的,

永远是那些尊重工程约束、尊重系统复杂度的选择。


DeepSeek这次的新年开卷,开的是系统工程能力。


当大家都在关注“模型能做什么”时,他们在思考“模型怎样才能持续稳定地做下去”。


这或许就是2026年AI领域最需要的声音


聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他