DeepSeek最近悄悄更新了R1的论文版本。
篇幅从最初的 22 页,扩展到了86 页。
如果把两版论文放在一起对比,会发现一个明显的变化:
它从一篇“展示结果的论文”,变成了一份“可以被工程复现的技术报告”。
01
论文角色的变化

论文地址: https://arxiv.org/pdf/2501.12948
最初的 R1 论文,重点回答的是一个问题:
这个模型能做到什么?
新版论文回答的,则是另一个更难的问题:
这一套推理能力,是如何被系统性地制造出来的?
为此,DeepSeek 在新版中补充了大量此前行业里极少公开的内容,包括:
1. 明确的数据配方
- 2.6 万道数学题的构建方法
- 1.7 万条代码数据的生成流程
- 数据筛选、清洗、难度分层的具体标准
2.训练基础设施的工程细节
- vLLM + DualPipe 的整体架构
- 分布式训练调度与并行策略

3.完整的成本拆解
- 总训练成本约 29.4 万美元
- R1-Zero 使用约 198 小时的 H800 GPU
4.失败尝试的系统复盘
- PRM 为什么没有带来预期提升
- MCTS 在该场景下的局限性
5.长达 10 页的安全性评估
- 多语言、越狱攻击、内部安全数据集
这类信息的密度,在以往的大模型论文中并不常见
02
推理能力
论文中一个值得注意的现象是:
DeepSeek 并没有把重点放在“示范更多标准答案”上,
而是通过强化学习和奖励设计,
让模型在训练过程中逐步形成推理策略。
从实验曲线可以看到:
人类般的学习模式
简单问题快速掌握:
难度1-3级的问题在训练早期迅速达到90-95%准确率
复杂问题逐步攻克:
难度4级问题从78%提升到95%;最难5级问题从55%提升到90%
偶尔的“反超”现象:
在特定阶段,模型在较难问题上表现甚至超过简单问题

反思能力的自然涌现
随着训练推进,模型开始自发地使用反思性词汇:
- “wait”、“check”、“verify”等词汇使用频率增加5到7倍
- 特定反思模式在训练特定时间点突然出现
- 模型学会了“中途修正方向”的策略

这证明了一个重要观点:
推理不是被“教会”的,而是在明确的反馈机制下被“逼出来”的。
模型学会了在长期奖励最大化的目标下,
自主发展出有效的推理策略。
03
真正稀缺的部分
相比性能曲线,新版论文里更有价值的,
其实是对工程可靠性的验证。
系统性稳定性验证
· 复杂连接结构在大规模扩展后的稳定性分析
· 信号在多层传递过程中的可控性证明
· 训练过程崩溃点的系统化识别与修复

多规模模型蒸馏验证
DeepSeek系统性地验证了知识蒸馏的有效性,
将R1的推理能力迁移到多个规模:
· 1.5B、7B、8B、14B、32B、70B模型
· 相同参数规模下,推理能力全面提升
· 证明了“能力不是参数的专利”

完整的安全性评估体系
10页的安全性报告,构建了多维度的安全评估框架:
· 6项公开安全基准对比测试
· 4个一级类目、28个细分子类的内部安全数据集
· 50种语言的多语言安全评估
· 针对越狱攻击的稳健性测试

04
行业意义

这次更新几个重要的信号:
1. 工程透明度成为新竞争力
当模型能力逐渐接近时,
谁能把复杂系统讲清楚、跑稳定、实现复现,谁就更容易获得信任。
86页的详细技术报告,本身就是一种技术自信的体现。
2. 失败经验的价值被重新认识
论文中大量的“失败复盘”,
不仅没有削弱其价值,反而增强了可信度。
这标志着AI研究正在从“只展示成功”转向“诚实地记录探索过程”。
3. AI评估维度的根本性扩展
评估重点从单纯的“性能指标”扩展到:
· 工程可复现性
· 长期运行稳定性
· 安全可控性
· 成本效益比
05
给企业的实际启示
对于企业和创业者来说,这次更新提供了几个关键判断依据:
1. 技术路线的可评估性大大增强
当训练成本、数据配方、基础设施全部透明时,企业可以:
准确评估自研可行性,合理预测投入产出比,制定更现实的技术路线图
2. 工程能力成为选型关键
模型间的性能差距正在缩小,选择标准应该更多考虑:
系统的长期稳定性,工程文档的完整性,社区的活跃度和支持度
3. 推理能力不再是大模型专属
知识蒸馏的成功证明,推理能力可以通过数据迁移到小模型,这为:
边缘计算部署打开了大门,成本敏感场景提供了新选择,移动端AI应用创造了可能
06
结语
当系统变得足够复杂,透明和克制本身,就是工程能力的一部分。
在我们看来,
更重要的意义,在于它把一个高度复杂的推理系统,
尽可能完整地暴露在工程视角之下。
我们参与的系统开发中,
模型是否“更强”往往不是首要问题,
是否可理解、可复现、可长期维护,
才决定了一项技术能否进入生产环境。
从这个角度看,DeepSeek 这次更新更像是一份工程样本,
帮助我们更早地理解,未来推理型系统将不可避免地面对哪些复杂性与取舍。
真正能走远的 AI,并不依赖单次性能突破,
而依赖于能否被理解、被复现、被持续迭代。



