| DeepSeek-R1通过强化学习激励大型语言模型中的推理 |
| 来源:一起赢论文网 日期:2026-08-22 浏览数:44 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
DeepSeek-R1通过强化学习激励大型语言模型中的推理
通用推理是人工智能(AI)中长期存在且艰巨的挑战。近期突破,以大型语言模型(LLMs)为代表 1,2以及思维链(CoT)提示3在基础推理任务上取得了相当大的成功。然而,这种成功很大程度上依赖于大量人工注释演示,模型的能力仍不足以应对更复杂的问题。我们展示了可以通过纯强化学习(RL)激励LLM的推理能力,从而无需依赖人类标记的推理轨迹。所提出的强化学习框架促进了高级推理模式的涌现发展,如自我反思、验证和动态策略适应。因此,训练模型在数学、编程竞赛和STEM领域等可验证任务中表现优异,超越了通过传统监督学习在人类演示中训练的对应模型。此外,这些大规模模型展现的涌现推理模式可以系统地用于指导和提升小型模型的推理能力。
类似内容被他人观看
揭示对齐大型语言模型的内在伦理脆弱性 文章 开放获取 2026年3月21日
在语言理解任务中测试人工智能暴露出对潜在含义的敏感度不足 文章 开放获取 2024年11月14日
一种新颖的主演评论家强化学习,结合人类反馈框架,增强机器人导航 文章 开放获取 2025年2月28日 主要角色 推理能力是人类智能的基石,能够完成从数学问题解决到逻辑推理和编程等复杂认知任务。人工智能的最新进展表明,当规模足够大时,大型语言模型能够表现出涌现行为,包括推理能力 4,5.然而,在预训练中实现此类能力通常需要大量计算资源。与此同时,另一条补充的研究线显示,大型语言模型可以通过CoT提示有效增强。这种技巧包括提供精心设计的短镜头示例,或使用诸如“让我们一步步思考”这样的简约提示 3,6使模型能够产生中间推理步骤,从而显著提升其在复杂任务中的表现。同样,当模型在训练后阶段学习高质量、多步推理轨迹时,进一步的表现提升也被观察到 2,7.尽管这些方法有效,但也存在明显局限性。它们对人工注释推理的依赖减缓了可扩展性并引入认知偏见。此外,通过限制模型复制人类思维过程,其表现本质上被人类提供的范例所限制,阻碍了对更高级、非人类推理路径的探索。
为解决这些问题,我们旨在探索大型语言模型在强化学习框架下通过自我进化发展推理能力的潜力,且极少依赖人类标签。具体来说,我们是在DeepSeek-V3基础上构建的8并使用群相对策略优化(Group Relative Policy Optimization,GRPO)9作为我们的强化学习框架。奖励信号仅基于最终预测的正确性与真实答案,不对推理过程本身施加限制。值得注意的是,我们在强化学习训练前绕过了传统的监督微调(SFT)阶段。这一设计选择源于我们的假设:人类定义的推理模式可能限制模型探索,而不受限制的强化学习训练则能更好地激励大型语言模型中新推理能力的出现。通过这一过程,详见下一节,我们的模型(称为DeepSeek-R1-Zero)自然发展出多样且复杂的推理行为。为解决推理问题,该模型倾向于生成更长的回答,包含验证、反思以及在每个回答中探索替代方法。虽然我们没有明确教模型如何推理,但它通过强化学习成功学会了改进的推理策略。
尽管 DeepSeek-R1-Zero 展现出出色的推理能力,但它面临诸如可读性差和语言混淆等挑战,有时会在单一的 CoT 回答中将英语和中文结合起来。此外,DeepSeek-R1-Zero的基于规则的强化学习阶段专注于推理任务,导致在写作和开放领域问答等更广泛领域的表现有限。为应对这些挑战,我们介绍了DeepSeek-R1模型,该模型通过多阶段学习框架训练,集成了拒绝采样、强化学习和监督微调,详见“DeepSeek-R1”部分。该训练流程使 DeepSeek-R1 能够继承其前身 DeepSeek-R1-Zero 的推理能力,同时通过更多非推理数据使模型行为与人类偏好保持一致。
为了以更低的能源成本更广泛地接触强大的人工智能,我们提炼了几个较小的模型并公开发布。这些精炼模型展现出强大的推理能力,超越了原始指令调优模型的性能。我们相信,这些指令调优版本也将极大地为研究社区做出贡献,为理解长CoT推理模型背后的机制提供宝贵资源,并推动更强大推理模型的发展。我们向公众发布了DeepSeek-R1-Zero、DeepSeek-R1的数据样本和精炼模型,详见“代码可用性”部分。
深搜-R1-零 为了实现DeepSeek-R1-Zero的大规模强化学习,我们使用了高效的强化学习流水线。具体来说,我们使用 GRPO9作为我们的强化学习算法,详见方法部分“GRPO”。此外,我们采用基于规则的奖励系统计算准确率并格式化奖励,详细方法论见方法部分“奖励设计”。此外,我们的高性能强化学习基础设施详见补充信息第2.1节,确保培训可扩展且高效。
具体来说,我们将强化学习技术应用于DeepSeek-V3基础,以训练DeepSeek-R1-Zero。在培训过程中,我们设计了一个简单的模板,要求DeepSeek-R1-Zero先产生推理过程,然后给出最终答案。提示模板如下。
“用户和助理之间的对话。用户提出问题,助理解答。助手首先思考心中的推理过程,然后向用户提供答案。推理过程和答案都包含在<思考>......</思考><回答>......</answer>标签分别是<think>推理过程< ><answer>回答在这里 回答 </answer>。用户:提示。助理:“,在培训中,提示被具体的推理问题取代。我们有意将约束限制在这种结构格式,避免任何内容特定的偏见,以确保能够准确观察模型在强化学习过程中的自然发展。
图1a显示了DeepSeek-R1-Zero在美国邀请数学考试(AIME)2024基准测试中在整个强化学习训练过程中的表现轨迹,AIME 2024的平均pass@1分数显著提升,从初始15.6%跃升至77.9%。此外,通过自洽解码10模型性能可进一步提升,准确率达到86.7%。这一表现远超AIME所有人类竞赛者的平均水平。除了数学竞赛,如补充图所示。8,DeepSeek-R1-Zero在编程竞赛以及研究生级生物、物理和化学问题中也取得了显著表现。这些结果强调了强化学习在提升大型语言模型推理能力方面的有效性。
图1:DeepSeek-R1-Zero在整个训练过程中的准确率和输出长度。 图1:DeepSeek-R1-Zero在整个训练过程中的准确率和输出长度。 全尺寸图像 a, 训练中DeepSeek-R1-Zero的AIME精度。AIME以数学问题为输入,输出为数字,详见扩展数据表1。pass@1和cons@16详见补充信息第4.1节。基线是AIME竞赛中人类参与者取得的平均得分。b,在强化学习过程中,DeepSeek-R1-Zero在训练集上的平均响应长度。DeepSeek-R1-Zero 自然地学会用更多思考时间解决推理任务。注意,训练步骤指的是一个策略更新操作。
除了在训练中逐步提升推理能力外,DeepSeek-R1-Zero还在强化学习中展现了自我进化行为。如图所示。1b,DeepSeek-R1-Zero在整个训练过程中,思考时间持续增加,这仅由内在适应驱动,而非外部变化。利用多头CoT,模型逐步完善推理,生成数百到数千个代币,以探索和改进其解决问题的策略。
增加思考时间有助于自主发展复杂行为。具体来说,DeepSeek-R1-Zero 越来越多地展现出先进的推理策略,如反思推理和系统探索扩展数据图中提供的替代解。1a,显著提升了其在可验证任务(如数学和编程)上的表现。值得注意的是,在训练过程中,DeepSeek-R1-Zero出现了“啊哈时刻”,如表1所示,表现为在反射时“等待”一词的突然增加,详见扩展数据图。1b. 这一时刻标志着推理模式的明显变化,清晰展现了DeepSeek-R1-Zero的自我进化过程。
表1 DeepSeek-R1-Zero中间版本的一个有趣的“顿悟时刻” 全尺寸表格 DeepSeek-R1-Zero的自我进化凸显了强化学习的力量和美感:我们不是明确教模型如何解决问题,而是简单地给予它正确的激励,它就能自主发展出先进的问题解决策略。这提醒人们,强化学习有潜力解锁LLM更高级的能力,为未来更自主和自适应的模型铺平道路。
深寻-R1 尽管DeepSeek-R1-Zero展现出强大的推理能力,但它面临若干问题。DeepSeek-R1-Zero面临诸如可读性差和语言混合等挑战,因为DeepSeek-V3基础是基于多种语言训练,尤其是英语和中文。为解决这些问题,我们开发了DeepSeek-R1,其流水线如图所示。2. 在初期阶段,我们收集数千条冷启动数据,这些数据展现出对话式、与人对齐的思维过程,详见补充信息,第2.3.2节。强化学习训练随后在方法部分“第一强化学习阶段的训练细节”中应用超参数,补充信息第2.3.1节数据细节,以提升模型在会话思维过程和语言一致性方面的表现。随后,我们再次应用拒绝抽样和SFT。这一阶段将推理和非推理数据集纳入SFT流程,详见补充信息第2.3.3节,使模型不仅能在推理任务中表现出色,还能展示高级写作能力。为了进一步使模型符合人类偏好,我们实施了次级强化学习阶段,旨在提升模型的有用性和无害性,同时完善其推理能力。奖励模型详见方法部分“奖励设计”,强化学习超参数见方法部分“第二强化学习阶段的训练细节”。总培训费用详见补充信息,第2.4.4节。
图2:DeepSeek-R1的多阶段流水线。 图2:DeepSeek-R1的多阶段流水线。 全尺寸图像 关于DeepSeek-V3基础和DeepSeek-V3的详细背景见补充信息,第1.1节。DeepSeek-R1 Dev1、Dev2 和 Dev3 模型代表了该流水线中的中间检查点。
我们在MMLU上评估我们的模型11,MMLU-Redux12,MMLU-Pro13,放下14,C-评估15,IFEval16,帧17GPQA 钻石18, SimpleQA19, C-SimpleQA20,CLUEWSC21,AlpacaEval 2.0(参考文献)22),竞技场-困难23,软件工程师台验证24, Aider-Polyglot25,LiveCodeBench26(2024-08–2025-01),Codeforces27中国国家高中数学奥林匹克竞赛(CNMO 2024)28以及AIME 2024(参考文献:29).这些基准的详细信息见补充表15–29。
表2总结了DeepSeek-R1在多个开发阶段的表现,如图所示。2. DeepSeek-R1-Zero 与 DeepSeek-R1 Dev1 的比较显示指令跟踪率显著提升,IF-Eval 和 Arena-Hard 基准测试得分更高。然而,由于冷启动数据集规模有限,Dev1 在推理性能上相较于 DeepSeek-R1-Zero 有所下降,尤其是在 AIME 基准测试上。相比之下,DeepSeek-R1 Dev2在需要高级推理能力的基准测试上表现显著提升,包括专注于代码生成、数学问题解决和STEM相关任务。针对通用任务的基准测试,如AlpacaEval 2.0,显示出边际提升。这些结果表明,以推理为导向的强化学习显著增强了推理能力,同时对用户偏好导向基准的影响有限。
表2 DeepSeek-R1各阶段的实验结果 全尺寸表格 DeepSeek-R1 Dev3 将推理和非推理数据集整合进 SFT 流水线,从而提升模型在推理和通用语言生成任务中的熟练度。与 Dev2 相比,DeepSeek-R1 Dev3 在 AlpacaEval 2.0 和 Aider-Polyglot 上实现了显著的性能提升,这得益于包含了大规模的非推理语料库和代码工程数据集。最后,基于基于混合推理和通用数据的DeepSeek-R1 Dev3进行全面的强化学习训练,最终产出了DeepSeek-R1。代码和数学基准测试方面取得了有限的提升,因为之前阶段已进行了大量针对推理的强化学习。最终DeepSeek-R1中的主要进展体现在通用指令跟踪和用户偏好基准测试上,AlpacaEval 2.0提升了25%,Arena-Hard提升了17%。
我们还在补充信息第4.2节中将DeepSeek-R1与其他模型进行比较。模型安全评估见补充信息,第4.3节。补充信息第5节提供了全面的评估分析,包括与DeepSeek-V3的比较、对两个新测试集的性能评估、按类别划分的数学能力分析以及测试时间扩展行为的调查。补充信息,第6节显示强推理能力可以转移到较小的模型中。
伦理与安全声明 随着DeepSeek-R1推理能力的提升,我们深刻认识到潜在的伦理风险。例如,R1可能遭受越狱攻击,导致生成危险内容,如爆炸物制造计划,而增强的推理能力使模型能够提供更具操作可行性和可执行性的计划。此外,公共模式还可能受到进一步微调的影响,这可能危及固有的安全保护。
在补充信息第4.3节,我们从多个角度呈现了一份全面的安全报告,包括开源和内部安全评估基准的表现,以及跨语言和针对越狱攻击的安全水平。这些综合安全性分析得出结论,与其他先进模型相比,DeepSeek-R1模型的固有安全水平通常处于中等水平(与GPT-4o相当(2024-05-13)30).此外,结合风险控制系统,模型的安全水平提升至更高标准。
结论、局限性及未来工作 我们介绍了DeepSeek-R1-Zero和DeepSeek-R1,它们依赖大规模强化学习来激励模型推理行为。我们的结果表明,预训练检查点在复杂推理任务中具有巨大潜力。我们认为,释放这一潜力的关键不在于大规模的人类注释,而在于提供硬性推理问题、可靠的验证器和充足的强化学习计算资源。复杂的推理行为,如自我验证和反思,似乎在强化学习过程中自然而然地出现。
即使DeepSeek-R1在推理基准测试上取得了前沿成果,仍面临若干能力限制,如下所述。
结构输出与工具使用 目前,DeepSeek-R1的结构输出能力仍低于现有模型。此外,DeepSeek-R1 无法利用搜索引擎和计算器等工具来提升输出性能。然而,构建结构输出和工具使用的强化学习环境并不难,我们相信这个问题将在下一版本中得到解决。
令牌效率 与传统的测试时间计算尺度方法(如多数投票或蒙特卡洛树搜索(MCTS)不同,DeepSeek-R1 在推断过程中根据问题的复杂度动态分配计算资源。具体来说,它用较少的代币来解决简单任务,但为复杂任务生成更多代币。尽管如此,代币效率方面仍有进一步优化空间,因为在面对简单问题时仍会出现过度推理——表现为过度思考。
语言混合 DeepSeek-R1目前针对中文和英语进行了优化,这可能导致处理其他语言查询时的语言混合问题。例如,DeepSeek-R1 可能使用英语进行推理和回答,即使查询语言不是英语或中文。我们计划在未来的更新中解决这一限制。这一限制可能与基础检查点DeepSeek-V3 Base有关,该检查点主要使用中文和英语,以便在推理中更好地结合这两种语言。
提示工程 在评估DeepSeek-R1时,我们观察到它对提示非常敏感。少彩提示总是会降低其性能。因此,我们建议用户直接描述问题,并使用零次设置指定输出格式以获得最佳效果。
软件工程任务 由于评估时间较长,影响了强化学习过程的效率,大规模强化学习在软件工程任务中尚未被广泛应用。因此,DeepSeek-R1在软件工程基准测试中并未显著优于DeepSeek-V3。未来版本将通过在软件工程数据中实现拒绝抽样或在强化学习过程中加入异步评估来解决这一问题,以提高效率。
除了具体能力限制外,纯强化学习方法本身也带来了固有的挑战:
奖励黑客 纯强化学习的成功依赖于可靠的奖励信号。本研究通过推理领域的基于规则的奖励模型确保奖励可靠性。然而,对于某些任务,如写作,构建这种可靠的奖励模型较为困难。如果奖励信号是由模型而非预定义规则分配的,随着训练的进行,它更容易被利用,这意味着策略模型可能会找到捷径来破解奖励模型。因此,对于无法通过可靠奖励模型有效评估的复杂任务,纯强化学习方法的规模化仍是一个开放的挑战。
在这项工作中,对于无法获得可靠信号的任务,DeepSeek-R1 使用人工注释创建监督数据,并且仅执行数百步的强化学习。我们希望未来能够建立一个健全的奖励模式来解决这些问题。
随着DeepSeek-R1等纯强化学习方法的出现,未来在解决任何可被验证者有效评估的任务方面具有巨大潜力,无论其对人类的复杂性如何。配备如此先进的强化学习技术的机器,凭借通过反复试错迭代优化性能的能力,有望超越人类在这些领域的能力。然而,对于构建可靠奖励模型本身就很困难的任务来说,仍然存在挑战。在这种情况下,缺乏稳健的反馈机制可能会拖慢进展,因此未来研究应聚焦于开发创新方法,以定义和完善这些复杂且难以验证的问题的奖励结构。
此外,在推理过程中使用工具具有显著潜力。无论是使用编译器或搜索引擎等工具检索或计算必要信息,还是使用生物或化学试剂等外部工具验证现实中的最终结果,这种工具增强推理的整合都能极大提升机器驱动解决方案的范围和准确性。
|
| [返回] |