| 发现最先进的强化学习算法 |
| 来源:一起赢论文网 日期:2026-08-22 浏览数:41 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
发现最先进的强化学习算法 人类和其他动物使用了经过多代反复试验发现的强化学习(RL)机制。相比之下,人工代理通常通过手工制定的学习规则进行学习。尽管几十年来一直关注,自主发现强大强化学习算法的目标一直难以实现1,2,3,4,5,6.在这里,我们展示了机器有可能发现一种超越手动设计规则的先进强化学习规则。这是通过元学习从大量复杂环境中的代理群体积累经验实现的。具体来说,我们的方法发现了强化学习规则,通过该规则更新了代理的策略和预测。在我们的大规模实验中,发现的规则超越了所有现有的Atari基准测试规则,并在发现时未曾见过的多项挑战性基准测试中表现优于多项最先进的强化学习算法。我们的发现表明,高级人工智能所需的强化学习算法可能很快能从智能体的经验中自动发现,而非人工设计。
类似内容被他人观看
DeepSeek-R1 通过强化学习激励大型语言模型中的推理
文章 开放获取 2025年9月17日
一个灵活且个性化的在线学习课程推荐框架
文章 开放获取 2024年5月6日
竞争性群体强化学习提升深度强化学习的稳定性和性能
文章 开放获取 2025年12月11日
主要角色
人工智能的主要目标是设计能够像人类一样,在复杂环境中预测和行动以实现目标的智能体。许多最成功的代理基于强化学习(RL),即代理通过与环境交互来学习。数十年的研究催生了越来越高效的强化学习算法,带来了人工智能领域的诸多里程碑,包括对围棋等复杂竞技游戏的掌握7,国际象棋8,星际争霸9以及《我的世界》10新数学工具的发明11,或复杂物理系统的控制12.
与人类不同,人类的学习机制是通过生物进化自然发现的,强化学习算法通常是手动设计的。这通常缓慢且繁琐,且受限于依赖人类知识和直觉。尽管已有多种尝试自动发现学习算法1,2,3,4,5,6但目前尚无任何一种被证明足够高效和通用,能够取代手工设计的强化学习系统。
在本研究中,我们引入了一种自主方法,仅通过多代代理与各种环境的交互经验,发现强化学习规则(见图)。1a)。发现的强化学习规则在多种具有挑战性的强化学习基准测试上实现了最先进的性能。我们方法的成功与之前在二维领域的工作形成对比。首先,之前的方法是在强化学习规则的狭窄空间中搜索(例如超参数) 13,14或者保单损失 1,6),我们的方法使智能体能够探索更具表现力的潜在强化学习规则空间。其次,之前的工作主要聚焦于简单环境中的元学习(例如网格世界3,15 ),我们的方法在更大规模的复杂多样环境中进行元学习。
图1:从一群代理中发现强化学习规则。
图1:从一群代理中发现强化学习规则。
全尺寸图像
a,发现号。多个代理在不同环境中交互,按照元网络定义的学习规则并行训练。与此同时,元网络被优化以提升代理的集体性能。b,代理架构。代理产生以下输出:(1)策略(π),(2)观察条件预测向量(y),(3)动作条件预测向量(z),(4)动作值(q)和(5)辅助策略预测(p)。y和z的语义由元网络决定。c,元网络架构。代理输出的轨迹作为元网络输入,连同来自环境的奖励和分集终止指示器(图中省略)。利用这些信息,元网络生成代理当前和未来时间步的所有预测目标。智能体会更新以最小化相对于其目标的预测误差。LSTM,长短期记忆。d,元优化。元网络的元参数通过通过反向传播通过智能体更新过程计算的元梯度步(θ0→ θN),元目标是最大化代理在其环境中的集体收益。
为了选择一个一般的发现空间,我们观察到标准强化学习算法的核心组成部分是一个规则,该规则会更新一个或多个预测,以及策略本身,朝向与未来奖励和未来预测等数量相关函数的目标。基于不同目标的强化学习规则示例包括时间差分学习16, Q-学习17,近端策略优化(PPO)18,辅助任务19,继任功能20以及分布式强化学习21.在每种情况下,目标的选择决定了预测的性质,例如它们是成为价值函数、模型还是后继特征。
在我们的框架中,强化学习规则由元网络表示,该元网络决定了智能体应将预测和策略移动到哪些目标(见图)。1c)。这使得系统能够在没有预设语义的情况下发现有用的预测,以及预测的使用方式。系统原则上可以重新发现过去的强化学习规则,但灵活的功能形式也允许智能体发明新的强化学习规则,专门适应感兴趣的环境。
在发现过程中,我们实例化一个智能体群体,每个代理与其来自多样复杂任务的环境实例互动。每个代理的参数根据当前的强化学习规则进行更新。然后我们使用元梯度法13逐步改进强化学习规则,使其能够带来更优绩效的代理。
我们的大规模实证结果表明,我们发现的强化学习规则(称为DiscoRL)超越了所有现有的强化学习规则,尤其是在其元学习环境中。值得注意的是,这包括雅达利游戏22可以说是最成熟且信息量最大的强化理论基准测试。此外,DiscoRL在多项具有挑战性的基准测试中实现了最先进的性能,如ProcGen23,在发现过程中从未接触过。我们还表明,随着发现环境更多样化和复杂,DiscoRL的性能和通用性进一步提升。最后,我们的分析显示,DiscoRL发现了独特的预测语义,这些语义与现有的强化学习概念(如价值函数)不同。据我们所知,这正是经验证据表明,在通用性和效率方面超越手动设计的强化学习算法,终于触手可及。
发现方法
我们的发现方法包含两种优化类型:代理优化和元优化。通过更新策略和预测,针对强化学习规则产生的目标,优化了代理参数。与此同时,通过更新目标来优化强化学习规则的元参数,以最大化代理人的累计奖励。
代理网络
许多强化学习研究考虑智能体应做出哪些预测(例如值),以及应使用哪些损失函数来学习这些预测(例如时间差(TD)学习)并改进策略(例如策略梯度)。我们不是手工打造,而是定义一个没有预设语义的预测表达空间,并通过元网络来元学习智能体需要优化的内容。在支持大量新颖算法可能性的同时,保持在现有强化学习算法中表示关键思想的能力是理想的。
为此,我们让由θ参数化的代理输出两种预测,除了策略(π):观察条件向量预测y(s)∈R)n任意大小为n,以及一个动作条件向量预测z(s, a)∈R。m任意大小为m,其中s和a分别是观察和作用(图)。1b)这些预测的形式源于预测与控制之间的根本区别16.例如,价值函数通常分为状态-价值函数v(s)(用于预测)和动作-价值函数q(s, a)(用于控制),而在强化学习中,许多其他概念,如奖励和后继特征,也有观察条件版本和动作条件版本。因此,预测的函数形式(y, z)足够通用,能够表示但不限于强化学习中许多现有的基本概念。
除了待发现的预测外,在我们的大多数实验中,代理人还会用预定义的语义进行预测。具体来说,代理生成一个动作-价值函数 q(s, a) 和一个动作条件辅助策略预测 p(s, a)8.这鼓励发现过程通过y和z专注于发现新概念。
元网络
现代强化学习规则中很大一部分采用强化学习的前向视图16.在此视角中,RL规则接收从时间步t到t+n的轨迹,并利用该信息更新代理的预测或策略。它们通常会针对自筹目标更新预测或政策,即朝向未来预测。
相应地,我们的强化学习规则使用元网络(见图)。1c)作为一个函数,决定智能体应向哪些目标移动其预测和策略。为了在时间步t生成目标,元网络输入的是代理的预测和策略轨迹,以及从时间步t到t+n的奖励和剧集终止。它使用标准的长短期记忆24处理这些输入,尽管也可以使用其他架构(扩展数据图)。3)。
元网络输入和输出的选择保持了手工强化学习规则的某些理想属性。首先,元网络可以处理任何观测和任意大小的离散动作空间。这是因为元网络不会直接接收观测值作为输入,而是通过预测间接接收。此外,它通过在动作维度间共享权重,处理动作特定的输入和输出。因此,它可以推广到截然不同的环境。其次,元网络对代理网络的设计具有中立性,因为它只看到代理网络的输出。只要代理网络产生所需的输出形式(π、y、z),发现的强化学习规则就可以推广到任意代理架构或规模。第三,元网络定义的搜索空间包含了重要的算法思想——自助法。第四,元网络同时处理策略和预测,不仅能元学习辅助任务25但也可以直接使用预测来更新策略(例如,提供方差缩减的基线)。最后,输出目标比输出标量损失函数更具表达力,因为它包含了搜索空间中的Q-learning等半梯度方法。在建立在标准强化学习算法这些特性的基础上,丰富的参数化神经网络使发现的规则能够实现算法,并具有潜在更高的效率和更具上下文细差别。
代理优化
智能体的参数(θ)会被更新,以最小化其预测和策略与元网络目标之间的距离。智能体的损失函数可以表示为:
$$L(\theta )={{\mathbb{E}}}_{s,a\sim {{\boldsymbol{\pi }}}_{\theta }}[D(\hat{{\boldsymbol{\pi }}},{{\boldsymbol{\pi }}}_{\theta }(s))+D(\hat{{\bf{y}}},{{\bf{y}}}_{\theta }(s))+D(\hat{{\bf{z}}},{{\bf{z}}}_{\theta }(s,a))+{L}_{\rm{a}}{\rm{u}}{\rm{x}}}$$
其中s和a根据策略分布πθ,D(p, q) 是 p 与 q 之间的距离函数。我们选择了Kullback–Leibler散度作为距离函数,因为它足够通用,且此前已被发现有助于元优化3.给你πθ, yθ, zθ\(\hat{{\boldsymbol{\pi }}}\)、\(\hat{{\bf{y}}\)\(\hat{{\bf{z}}}\)分别是代理网络和元网络的输出,并应用SoftMax函数对每个向量进行规范化。
辅助损耗L辅助用于具有预定义语义的预测:动作值(q)和辅助策略预测(p),如下:L辅助= D(\(\hat{{\bf{q}}\), qθ(s, a)) + D(\(\hat{{\bf{p}}\)), pθ(s, a)),其中 \(\hat{{\bf{q}}}\) 是 Retrace 中的动作值目标26投影为二热矢量8,且 \(\hat{{\bf{p}}}\) = πθ(s′)是一步未来状态下的策略。为了与其他损失的一致性,我们使用库尔巴克–莱布勒散度作为距离函数D。
元优化
我们的目标是发现一种强化学习规则,由元参数η的元网络表示,使智能体能够在多种训练环境中最大化奖励。该发现目标 J(η) 及其元梯度∇ηJ(η) 可以表示为:
$$J(\eta)={{\mathbb{E}}}_{{\mathcal{E}}}{{\mathbb{E}}}_{\theta }[\,J(\theta )],{\nabla }_{\eta }\,J(\eta)\approx {{\mathbb{E}}}_{{\mathcal{E}}}}_{\mathbb{E}}}_{\theta }[{\nabla }_{\eta }\theta {\nabla }_{\theta }\,J(\theta )],$$
其中 \({\mathcal{E}}\) 表示从分布中抽样的环境,θ 表示由初始参数分布诱导的代理参数及其在学习过程中的演变。\(J(\theta )={\mathbb{E}}\left[{\sum }_{t}{{\gamma }}^{{t}{r}_{{t}}\right]\)其中 γ 是贴现因子,rt是步骤t的奖励,是期望折现后的奖励和,这也是典型的强化学习目标。元参数通过沿上述方程的梯度上升进行优化。
为了估计元梯度,我们实例化一组根据元网络在一组采样环境中学习的智能体。为了确保该近似接近真实的兴趣分布,我们使用了大量来自具有挑战性基准的复杂环境,这与之前只关注少数简单环境的工作不同。因此,发现过程揭示了多种强化学习的挑战,如奖励稀疏、任务视野以及环境的部分可观测性或随机性。
每个代理的参数会定期重置,以鼓励更新规则在有限的代理生命周期内实现快速学习进展。正如之前关于元梯度强化学习的研究一样13,超梯度项 ∇ηJ(η) 可以通过链式法则分为两个梯度项:∇ηθ 和 ∇θJ(θ)。第一个项可以理解为代理更新过程的梯度27,而第二项是标准强化学习目标的梯度。为了估算第一个项,我们多次迭代更新代理,并在整个更新过程中反向传播,如图所示。1d。为了使其易于处理,我们使用滑动窗口反向传播了20多个代理更新。最后,为了估计第二项,我们使用优势行为者-批判者法28.为了估算优势,我们训练一个元值函数,这是一种仅用于发现的价值函数。
经验结果
我们在一组复杂环境中,用大量代理实施了发现方法。我们称之为发现强化学习规则DiscoRL。在评估中,汇总表现通过包含多任务的基准测试的归一化分数的四分位均值(IQM)来衡量,这一指标已被证明具有统计可靠性29.
雅达利
雅达利基准测试22RL历史上研究最深入的基准测试之一,包含57款Atari 2600游戏。它们需要复杂的策略、规划和长期的信用分配,使得AI代理掌握这变得不易。过去十年中,数百种强化学习算法在该基准测试中被评估,其中包括MuZero8以及梦想家10.
为了看看该规则在直接从基准测试中发现时的强大程度,我们对强化学习规则Disco57进行了元训练,并在同样的57场比赛中进行了评估(见图。2a)。在本次评估中,我们采用了一种网络架构,其参数数量与MuZero所用的数量相当。这是一个比发现时使用的网络更大的网络;因此,发现的强化学习规则必须推广到该环境。Disco57 的 IQM 达到了 13.86,优于所有现有的 RL 规则8,10,14,30在Atari基准测试中,其墙时钟效率明显高于最先进的MuZero(扩展数据图)。4)。这表明我们的方法能够从如此具有挑战性的环境中自动发现强强化学习规则。
图2:DiscoRL评估。
图2:DiscoRL评估。
全尺寸图像
a–f,DiscoRL 的性能与 Atari(a)、ProcGen(b)、DMLab(c)、Crafter(d;图内显示了 100 万环境步的结果)、NetHack(e)和 Sokoban(f)上的人类设计强化语言规则。x轴表示环境步数(以百万计)。纵轴表示由多个任务(Atari、ProcGen和DMLab-30)基准测试的人类归一化IQM分数,以及其余任务的平均回报。Disco57(蓝色)来自Atari基准测试,Disco103(橙色)来自Atari、ProcGen和DMLab-30基准测试。阴影区域显示95%置信区间。虚线代表手动设计的强化学习规则,如MuZero8高效基于内存的探索代理(MEME)30,梦想家10,自调优演员-批评算法(STACX)14, 重要性加权演员-学习者架构(IMPALA)34,深度Q网络(DQN)51,阶段政策梯度(PPG)52,近端策略优化(PPO)18,以及彩虹53.
推广
我们进一步通过评估 Disco57 在发现过程中未曾接触过的多种既定基准测试,来评估其普遍性。这些基准包括未见的观察和动作空间、多样的环境动态、各种奖励结构以及未见的代理网络架构。元训练超参数仅在训练环境(即雅达利)上调整,以防止规则被隐性地针对未完成的基准优化。
ProcGen 的结果23基准(图。2b 和扩展数据表 2),包含 16 个程序生成的二维游戏,显示 Disco57 的表现优于所有现有已发布的方法,包括 MuZero8以及PPO18,尽管它在发现过程中从未与ProcGen环境互动过。此外,Disco57在Crafter节目中取得了竞争性表现31(图。二维及扩展数据表5),特工需要学习广泛的能力才能生存。Disco57在NetHack NeurIPS 2021挑战赛排行榜上获得第三名32(图。2e和扩展数据表4),当时有40多个队伍参与。与竞赛中提交成绩最好的经纪人不同33Disco57 未使用任何领域特定的知识来定义子任务或奖励塑造。为了公平对比,我们用重要性加权演员-学习者架构(IMPALA)算法训练了一个代理34使用与Disco57相同的设置。IMPALA的性能则远不如常规,这表明Disco57发现了比标准方法更高效的强化学习规则。除了环境外,Disco57 还对多种代理特定设置表现出鲁棒性,如网络规模、重放率和超参数等评估(扩展数据图)。1)。
复杂多样的环境
为了理解复杂多样环境对发现的重要性,我们进一步扩展了元学习,增加了更多环境。具体来说,我们发现了另一条规则Disco103,使用了更多样化的103环境,包括Atari、ProcGen和DMLab-3035基准测试。该规则在Atari基准测试上表现类似,同时提升了图中所有其他可见和未显示基准的得分。2. 特别是,Disco103在《Crafter》中达到了人类水平的表现,接近了《Sokoban》中MuZero的顶尖表现36.这些结果表明,用于发现的环境越复杂和多样化,发现的规则就越强大、越普遍,即使是在发现时未被发现的保留环境中。发现Disco103相比Disco57,除了环境集外,没有对发现方法做任何更改。这表明发现过程本身是稳健、可扩展且具有通用性的。
为了进一步探讨使用复杂环境的重要性,我们对57个基于以往工作的网格世界任务进行了探索过程3,使用与Disco57相同的元学习设置。新规则的表现明显更差(见图)。3c)在Atari基准测试中。这验证了我们关于直接从复杂且具有挑战性环境中进行元学习重要性的假设。虽然使用这些环境至关重要,但并不需要精心策划正确的环境集;我们只是参考了文献中的流行基准。
图3:发现过程的性质。
图3:发现过程的性质。
全尺寸图像
a, 发现效率。最佳DiscoRL是在每场比赛中3次模拟中发现的,模拟代理生命周期(2亿步)。b,可扩展性。随着训练环境集的增加,DiscoRL在ProcGen基准测试(所有方法共3000万环境步)上变得更强。c,消融。图中展示了Atari上DiscoRL变体的表现。“无辅助预测”是元学习,没有辅助预测(p)。“小型代理”在发现过程中使用较小的代理网络。“无预测”是元学习,没有学习预测(y, z)。“无价值”是元学习,但没有价值函数(q)。“玩具环境”是通过57个网格世界任务而非Atari游戏元学习的。
效率与可扩展性
为了进一步理解我们方法的可扩展性和效率,我们评估了多个 Disco57 在发现过程中的表现(见图)。3a)。最佳规则是在每款雅达利游戏中约6亿步内发现的,这仅涉及57款雅达利游戏中的3次实验。这可以说比手动发现强化学习规则更高效,后者通常需要执行更多实验,同时还需要人类研究人员的时间。
此外,DiscoRL在未被发现的ProcGen基准测试中表现更好,因为更多Atari游戏被用于发现(见图)。3b),表明最终的强化学习规则能够很好地适应用于发现的环境数量和多样性。换句话说,发现规则的性能取决于数据(即环境)和计算。
发现新预测的影响
研究预测语义(图中 y, z 的发现)的影响1b),我们通过改变代理人的输出,并有或没有某些类型的预测,比较了不同的规则。图中的结果。3c表明,价值函数的使用显著改善了发现过程,这凸显了强化学习这一基本概念的重要性。然而,图中的结果3c还展示了发现超越预定义预测的新预测语义(y和z)的重要性。总体而言,与以往工作相比,发现的范围有所扩大1,2,3,4,5,6是必不可少的。在接下来的部分,我们将进一步分析,揭示所发现的语义。
分析
定性分析
我们以 Disco57 为案例研究,分析了发现规则的性质(见图)。4)。从定性角度看,发现的预测会在显著事件(如获得奖励或政策熵变化)之前激增(见图。4a)。我们还通过测量与观测各部分相关的梯度范数,调查了哪些观测特征导致元学习预测强烈响应。图中的结果。4b 显示元学习预测倾向于关注未来可能相关的对象,这与策略和价值函数关注的对象不同。这些结果表明,DiscoRL已经学会在较小的时间范围内识别和预测重要事件,从而补充了政策函数和价值函数等现有概念。
图4:DiscoRL分析。
图4:DiscoRL分析。
全尺寸图像
a, 发现预测的行为。图中展示了代理人发现的预测(y)以及Ms Pacman(左)和Breakout(右)中其他量的变化。“置信度”以负熵计算。预测信心的激增与即将发生的显著事件相关。例如,在《Ms Pacman》中,它们通常先于获得丰厚奖励,在《Breakout》中则优先获得强烈的行动偏好。b,梯度分析。每个等高线通过Beam Rider的梯度分析显示了每个预测在观测中的重点。预测更侧重于远距离敌人,而策略和数值则分别关注附近的敌人和记分牌。c,预测分析。未来熵和大奖事件可以通过发现的预测更好地预测。阴影区域代表95%置信区间。d,自力更生地平线。图中显示了当每个时间步的预测被扰动时,DiscoRL产生的预测目标发生了多大变化。每条曲线对应16条随机抽样轨迹,粗体曲线对应其平均值。e,依赖预测。图中显示了受控DiscoRL在Ms Pacman上无自控更新预测且完全未使用预测时的性能。阴影区域代表95%置信区间。
信息分析
为了确认定性发现,我们进一步调查了预测中包含的信息。我们首先从10款雅达利游戏的DiscoRL代理中收集数据,并训练神经网络预测感兴趣的数量,无论是发现的预测、策略还是价值函数。图中的结果。4c表明,发现的预测比政策和价值包含更多关于即将到来的大额奖励和未来政策熵的信息。这表明发现的预测可能捕捉了策略和价值未能很好地捕捉的独特任务相关信息。
自助法的出现
我们还发现了DiscoRL采用自助机制的证据。当元网络在未来时间的预测输入为 (z )t+k)受到扰动,会强烈影响目标 \({\hat{{\bf{z}}}}_{t}\)(图。4d)。这意味着未来预测用于构建当前预测的目标。这种自助机制和发现的预测结果对性能至关重要(见图)。4e)。如果在计算目标 \(\hat{{\bf{y}}\)和 \(\hat{{\bf{z}}})(从而阻止自助时),元网络的 y 和 z 输入被设置为零,性能会大幅下降。如果计算所有目标(包括策略目标)时,y和z输入都设为零,性能会进一步下降。这表明发现的预测被大量用于政策更新,而不仅仅是辅助任务。
以往工作
人工智能中的元学习,或学习学习的概念可以追溯到20世纪80年代37提出了用梯度反向传播训练元学习系统的建议38.核心理念是利用较慢的元学习过程进行元优化快速的学习或适应过程 39,40在各种情境下,包括迁移学习,已被广泛研究41,持续学习42,多任务学习43超参数优化44以及自动化机器学习45.
早期尝试将元学习应用于强化学习智能体,主要是对信息寻求行为进行元学习46.许多后续工作专注于对现有强化学习算法中少量超参数进行元学习 13,14.这些方法取得了有希望的结果,但无法明显偏离底层手工算法。另一条研究方向试图通过元学习完全黑箱算法来避免归纳偏见,例如作为循环神经网络实现47或者作为突触学习规则48.尽管概念上吸引人,这些方法容易对元训练中出现的任务进行过拟合49.
用更广泛的预测类别来表示知识的理念最早是在时间差分网络中提出的50但没有任何元学习机制。类似的思想也被用于元学习辅助任务25.我们的工作进一步扩展了这一思想,有效地发现了智能体优化的整个损失函数,涵盖了更广泛的可能强化学习规则。此外,与以往研究不同,发现的知识可以推广到看不见的环境。
近年来,人们对通用强化学习规则的兴趣日益增长1,3,4,5,6,15.然而,大多数实验仅限于小型代理和简单任务,或者发现范围限制在部分强化学习规则。因此,他们的规则并未与最先进的挑战性基准规则进行广泛比较。相比之下,我们搜索更广泛的规则空间,包括全新的预测,并扩展到大量复杂环境进行发现。因此,我们证明了有可能发现一种通用的强化学习规则,在具有挑战性的基准测试上表现优于许多最先进规则。
结论
让机器能够自行发现学习算法,是人工智能中最有前景的想法之一,因为它具有开放式自我提升的潜力。这项工作迈出了一步,使机器设计的强化学习算法能够在复杂环境中与甚至超越一些最佳手动设计算法。我们还展示了,发现的规则随着接触到更多样的环境而变得更强、更通用。这表明未来先进人工智能的强化学习算法设计可能由能够有效扩展数据和计算的机器主导。 |
| [返回] |