2025年12月31日,当大多数人准备迎接新年时,
DeepSeek-AI团队在arXiv上发布了一篇新论文:
mHC
(Manifold-ConstrainedHyper-Connections)

论文地址: https://www.arxiv.org/abs/2512.24880
提出了一个针对大规模神经网络(特别是Transformer类模型) 宏观结构优化方法,
旨在解决现有超连接(Hyper-Connections,HC)方法在训练稳定性和扩展性方面的问题。
元旦假期回来,赶紧从头到尾又查阅各种资料看了看。
真的很硬核,详细了解完,有一个非常强烈的感受:
相比参数和 benchmark 的提升,这篇论文更关心的是另一件事:
“模型怎么才能长期跑下去”。
这篇论文在解决什么问题?
如果用一句话概括这篇论文,它关心的并不在于:
- 模型还能不能再聪明一点
- 推理速度能不能再快一点
- 榜单排名还能不能再上升一位
它把注意力放在了一个更偏工程、但迟早会遇到的问题上:
“当模型结构不断扩展、连接不断增多时,信息在系统内部还能不能被稳定、可靠地传递?”
在现有的Hyper-Connections(HC) 结构中,
连接一旦变得复杂,信息强度容易失控,训练过程会出现明显波动,扩展性也随之下降。
这类问题往往不会在小模型阶段暴露,
但在大规模训练中几乎不可避免,
就像一台精密仪器,部件越多,相互作用的复杂度越高,维持稳定运行的成本就越大。

三种网络连接结构的演进:
从标准的残差连接(a),到引入可学习映射以扩展信息路径的超连接 HC(b),
再到通过流形投影(𝒫)对映射空间进行约束、显著提升训练稳定性的 mHC(c)
mHC 给出的解法,其实非常清晰:
通过引入流形约束和系统级优化,对连接的强度与结构进行统一约束,
让 HC 在规模扩展时依然保持稳定性,
为大模型训练提供了一种高效、稳定、可扩展的宏观连接方案。
这正是一个很多人容易低估、
但真正做系统的人一定会踩到的坑。
01
一个被反复低估的问题
过去几年,大模型的能力提升非常快。
模型更大、层数更深、信息流更复杂。
但与此同时,一个老问题也在不断被放大:
信息在模型内部传递时,是否可靠?
如果用一句话形容这个问题,就是:
“信息在传的过程中,容易失真、放大,或者直接消失。”
在神经网络里,这类问题有很多名字:
梯度消失、梯度爆炸、训练不稳定……
它们本质都是信息传递机制的故障。
为了缓解这些问题,行业做过很多尝试,其中最重要的一次突破,
就是残差连接(Residual Connection)。
它的直觉很简单:
“让原始信息可以绕过中间层,直接参与后续计算。”
这一步,几乎奠定了现代深度网络的基础。
自ResNet以来,无论是卷积网络还是Transformer,残差连接都成为标配设计。
它的核心优势在于身份映射(identity mapping)
确保信息在传递过程中有一个“保底通道”,不会被完全扭曲。
02
当信息通路变多,问题反而变复杂了
随着模型变得更大、更复杂,一条“直通”的信息通路,已经不够用了。
于是,出现了更激进的设计:
Hyper-Connections(超连接)。
你可以把它理解为:不再是一条“直达通路”,而是多条并行的信息交互路径。
这样做的好处很明显:
- 信息吞吐量更大
- 表达能力更强
- 模型性能短期内确实会上涨
但问题也随之而来,而且非常“工程化”。
当信息通路变成多条之后,模型开始出现两类极端情况:
- 有的信息被反复放大,在不同通路中相互叠加
- 有的信息被“责任稀释”,在多路径中逐渐消失
结果就是训练过程变得极其不稳定,甚至会在某个阶段直接崩掉。问题并不出在模型“聪不聪明”,而是系统在复杂结构下逐渐失去了控制。

HC 与 mHC 的训练稳定性对比
HC 在训练过程中表现出更明显的损失偏移与梯度波动,
而 mHC 能够在整个训练阶段维持更平滑、稳定的优化轨迹
论文中有一个令人印象深刻的观察:
在标准的HC结构中,当训练到约12k步时,会出现意外的损失突增,同时梯度范数出现剧烈波动。
这种不稳定性具有明显的结构性特征,源于连接设计本身的系统性缺陷。
03
mHC 做的事:给自由加上约束
DeepSeek 的这篇论文,核心思想并不复杂,但非常克制。
他们没有否定 Hyper-Connections,
也没有回退到更保守的结构。
他们做的是另一件事:为多路径信息流,引入严格的数学约束。
论文里,这套机制叫:
Manifold-ConstrainedHyper-Connections
如果不看公式,只看直觉,可以这样理解:
- 信息依然可以在多条路径中流动
- 但每一次流动,都必须满足“守恒”和“可追溯”
- 不允许无中生有的放大
- 也不允许责任被无限分散
在数学上,这体现在双重随机矩阵(doubly stochastic matrix)约束上。
论文使用了Sinkhorn-Knopp算法将连接矩阵投影到Birkhoff多面体这一特定的流形上,
确保每一行的和为1,每一列的和也为1。

这相当于为信息流动建立了“交通规则”:
每条道路的通行总量是固定的,不会出现某条路过度拥堵,也不会出现某条路完全闲置。

当 HC 在深层网络中进行复合传播时,
反向梯度的放大效应会不断叠加,最高可达到千倍量级,
这也是其在大规模模型中难以稳定训练的根本原因之一。
在工程效果上,mHC带来的变化非常直接:
- 信息不会被异常放大
- 信息不会在路径中悄然消失
- 训练过程的波动被显著压低

论文中有一个非常夸张、但也非常直观的对比:
不受约束的HC在最坏情况下会将信息强度放大近3000倍;
而引入流形约束的mHC,
则能将信号放大的上限严格压制在约1.6倍以内。
这不是参数优化,这是风险压制。
像一个精密的供电系统,mHC确保电压稳定在安全范围内。
04
性能提升6.7%的“系统保险”
最令人印象深刻的是mHC的工程实现。
论文不仅提出了理论方案,还提供了完整的系统级优化方案:
1. 核融合
将多个小操作合并成大操作,减少内存访问次数。特别是在处理RMSNorm和高维隐状态时,通过重排序计算流程,在保持数学等价的同时大幅提升效率。
2. 选择性重计算
mHC引入了额外的中间激活,直接存储会显著增加显存占用。团队设计了一种巧妙的块状重计算策略:只存储每个计算块的第一层输入,反向传播时按需重算。通过理论推导找到了最优块大小,最小化总显存占用。
3. 通信与计算重叠
在分布式训练中,mHC需要额外的跨阶段通信。团队扩展了DualPipe调度器,让mHC的计算与管道通信重叠,避免计算设备空闲等待。

mHC 没有让新增计算路径成为流水线的“负担”,
通过扩展 DualPipe 调度器,将如 F_post_res 等额外计算与通信和主计算过程进行并行重叠,
使整体训练时间的额外开销被控制在约 6.7%。
通过这些优化,mHC在扩展率n=4时仅增加约6.7%的训练时间
这是一个令人惊喜的数字。
对一家真正训练大模型的团队来说:
- 一次训练失败,意味着数周时间和数千万成本直接归零
- 稳定性,本身就是一种极其昂贵的能力
mHC本质上做的一件事:“用可控的额外成本(6.7%的时间开销),换取数量级下降的系统性风险。”
这在任何工程体系里,都是一笔极其划算的“保险”。
05
实验结果:稳定基础上的全面进步
论文在3B、9B、27B不同规模的模型上进行了全面验证。
结果令人信服:
Part1
训练稳定性显著提升:mHC完全避免了HC中出现的损失突增现象,在整个训练过程中保持平滑收敛。梯度范数也保持在稳定范围内。
Part2
下游任务性能全面进步:在BBH、DROP、MMLU等8个主流评测集上,mHC不仅全面超越Baseline,在多数任务上也超过了原始的HC。
特别是在推理任务上(BBH +2.1%,DROP +2.3%),mHC展现出了更强的能力。
Part3
扩展性验证:从3B到27B的不同规模实验中,mHC的性能优势都能稳定保持,没有出现“大模型失效”的现象。

下游任务性能对比
在 27B 模型规模下,mHC 在大多数任务上优于 Baseline,
并在整体表现上进一步超过 HC。
06
透露出的信号
DeepSeek 这篇论文,真正值得关注的地方,
不只在于 mHC 本身,它同时透露出了一个清晰方向:
大模型的竞争,正在从谁更聪明,
转向谁更稳、更可控、更能长期运行。
当模型开始承担真实任务、长期运行、参与决策时:
- 稳定性比峰值性能更重要
- 约束能力比完全自由更重要
- 系统一致性比偶然的突破更重要
这和我们在真实业务系统中看到的情况,是高度一致的。
任何一个需要7×24小时运行的系统,可靠性都是首要考量。
AI模型正在从“演示品”转变为“生产力工具”,
这个转变对系统设计提出了全新的要求。
写在最后
如果回头看,你会发现一个很明显的变化:
- 早期的大模型,更像一次“能力展示”
- 现在的大模型,越来越像一套需要长期运行的系统
而系统工程,从来不是靠“灵感”取胜的。它依赖的是:
- 约束:明确的边界和规则
- 稳定:可预测的行为和输出
- 可预期的行为:在复杂环境下依然保持一致性
这篇论文在一个非常关键的层面,补上了长期被忽视的一块拼图。
在我们看来,这类工作才是真正决定AI能否从“能用”走向“可持续”的基础。
技术会继续演进,但真正能走远的,
永远是那些尊重工程约束、尊重系统复杂度的选择。
DeepSeek这次的新年开卷,开的是系统工程能力。
当大家都在关注“模型能做什么”时,他们在思考“模型怎样才能持续稳定地做下去”。
这或许就是2026年AI领域最需要的声音。


