搜索结果:

返回

DeepSeek R1论文爆更四倍!发生了什么?

从精确的数据配方、透明的训练成本,到失败的坦诚复盘,它把推理能力如何被“制造”的全过程摊在了阳光下。

AI 速览

从精确的数据配方、透明的训练成本,到失败的坦诚复盘,它把推理能力如何被“制造”的全过程摊在了阳光下。 DeepSeek最近悄悄更新了R1的论文版本。 篇幅从最初的 22 页,扩展到了86 页。 如果把两版论文放在一起对比,会发现一个明显的变化:

DeepSeek最近悄悄更新了R1的论文版本。

篇幅从最初的 22 页,扩展到了86 页

如果把两版论文放在一起对比,会发现一个明显的变化:

它从一篇“展示结果的论文”,变成了一份“可以被工程复现的技术报告”。


01

论文角色的变化



论文地址: https://arxiv.org/pdf/2501.12948


最初的 R1 论文,重点回答的是一个问题:

这个模型能做到什么?


新版论文回答的,则是另一个更难的问题:

这一套推理能力,是如何被系统性地制造出来的?


为此,DeepSeek 在新版中补充了大量此前行业里极少公开的内容,包括:


1. 明确的数据配方

  • 2.6 万道数学题的构建方法
  • 1.7 万条代码数据的生成流程
  • 数据筛选、清洗、难度分层的具体标准

2.训练基础设施的工程细节

  • vLLM + DualPipe 的整体架构
  • 分布式训练调度与并行策略



3.完整的成本拆解

  • 总训练成本约 29.4 万美元
  • R1-Zero 使用约 198 小时的 H800 GPU

4.失败尝试的系统复盘

  • PRM 为什么没有带来预期提升
  • MCTS 在该场景下的局限性

5.长达 10 页的安全性评估

  • 多语言、越狱攻击、内部安全数据集

这类信息的密度,在以往的大模型论文中并不常见


02

推理能力


论文中一个值得注意的现象是:

DeepSeek 并没有把重点放在“示范更多标准答案”上,

而是通过强化学习和奖励设计,

让模型在训练过程中逐步形成推理策略

从实验曲线可以看到:


人类般的学习模式

简单问题快速掌握:

难度1-3级的问题在训练早期迅速达到90-95%准确率


复杂问题逐步攻克:

难度4级问题从78%提升到95%;最难5级问题从55%提升到90%


偶尔的“反超”现象:

在特定阶段,模型在较难问题上表现甚至超过简单问题


反思能力的自然涌现

随着训练推进,模型开始自发地使用反思性词汇:

  • “wait”、“check”、“verify”等词汇使用频率增加5到7倍
  • 特定反思模式在训练特定时间点突然出现
  • 模型学会了“中途修正方向”的策略



这证明了一个重要观点:

推理不是被“教会”的,而是在明确的反馈机制下被“逼出来”的

模型学会了在长期奖励最大化的目标下,

自主发展出有效的推理策略。


03

真正稀缺的部分


相比性能曲线,新版论文里更有价值的,

其实是对工程可靠性的验证


系统性稳定性验证

· 复杂连接结构在大规模扩展后的稳定性分析

· 信号在多层传递过程中的可控性证明

· 训练过程崩溃点的系统化识别与修复



多规模模型蒸馏验证

DeepSeek系统性地验证了知识蒸馏的有效性,

将R1的推理能力迁移到多个规模:

· 1.5B、7B、8B、14B、32B、70B模型

· 相同参数规模下,推理能力全面提升

· 证明了“能力不是参数的专利”



完整的安全性评估体系

10页的安全性报告,构建了多维度的安全评估框架:

· 6项公开安全基准对比测试

· 4个一级类目、28个细分子类的内部安全数据集

· 50种语言的多语言安全评估

· 针对越狱攻击的稳健性测试



04

行业意义



这次更新几个重要的信号:


1. 工程透明度成为新竞争力

当模型能力逐渐接近时,

谁能把复杂系统讲清楚、跑稳定、实现复现,谁就更容易获得信任。

86页的详细技术报告,本身就是一种技术自信的体现。


2. 失败经验的价值被重新认识

论文中大量的“失败复盘”,

不仅没有削弱其价值,反而增强了可信度。

这标志着AI研究正在从“只展示成功”转向“诚实地记录探索过程”


3. AI评估维度的根本性扩展

评估重点从单纯的“性能指标”扩展到:

· 工程可复现性

· 长期运行稳定性

· 安全可控性

· 成本效益比


05

给企业的实际启示


对于企业和创业者来说,这次更新提供了几个关键判断依据:


1. 技术路线的可评估性大大增强

当训练成本、数据配方、基础设施全部透明时,企业可以:

准确评估自研可行性,合理预测投入产出比,制定更现实的技术路线图


2. 工程能力成为选型关键

模型间的性能差距正在缩小,选择标准应该更多考虑:

系统的长期稳定性,工程文档的完整性,社区的活跃度和支持度


3. 推理能力不再是大模型专属

知识蒸馏的成功证明,推理能力可以通过数据迁移到小模型,这为:

边缘计算部署打开了大门,成本敏感场景提供了新选择,移动端AI应用创造了可能


06

结语


当系统变得足够复杂,透明和克制本身,就是工程能力的一部分。


在我们看来,

更重要的意义,在于它把一个高度复杂的推理系统,

尽可能完整地暴露在工程视角之下。


我们参与的系统开发中,

模型是否“更强”往往不是首要问题,

是否可理解、可复现、可长期维护,

才决定了一项技术能否进入生产环境


从这个角度看,DeepSeek 这次更新更像是一份工程样本,

帮助我们更早地理解,未来推理型系统将不可避免地面对哪些复杂性与取舍。


真正能走远的 AI,并不依赖单次性能突破,

而依赖于能否被理解、被复现、被持续迭代



聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他