掌握基于像素的无监督强化学习基准
Mastering the Unsupervised Reinforcement Learning Benchmark from Pixels
https://arxiv.org/pdf/2209.12016v2
![]()
![]()
摘要
从视觉感官数据中控制人工代理是一项艰巨的任务。强化学习(RL)算法可以成功,但需要代理与环境之间的大量交互。为了缓解这一问题,无监督强化学习提出采用自监督交互与学习,以便更快地适应未来任务。然而,正如无监督强化学习基准(URLB;Laskin等人(2021))所示,当前的无监督策略能否提升泛化能力仍不明确,尤其是在视觉控制设定中。在这项工作中,我们研究了URLB,并提出了一种新方法来解决它:使用无监督基于模型的强化学习对代理进行预训练,并采用任务感知的微调策略,结合一种新提出的混合规划器Dyna-MPC,使代理适应下游任务。在URLB上,我们的方法获得了93.59%的总体归一化性能,以惊人的幅度超越了此前的基线。该方法通过大规模实证研究进行了经验评估,我们用它来验证我们的设计选择并分析我们的模型。我们还在真实世界强化学习基准上展示了稳健的性能,暗示了在适应过程中对环境扰动的韧性。
引言
深度强化学习(RL)在现代的成功已在控制问题中展现出有前景的结果(Levine等人,2016;OpenAI等人,2019;Lu等人,2021)。然而,为每个任务单独训练一个代理需要大量任务特定的环境交互,造成巨大的冗余和长期的人工监督。因此,开发能够高效适应和泛化到新任务的算法已成为一个活跃的研究领域。
在计算机视觉和自然语言处理中,无监督学习使得无需监督即可训练模型,从而降低下游任务的样本复杂度(Chen等人,2020;Radford等人,2019)。以类似的方式,无监督强化学习(URL)代理旨在没有外部奖励函数的情况下学习环境,由内在动机驱动(Pathak等人,2017;Burda等人,2019a;Bellemare等人,2016)。学习到的模型随后可以适应下游任务,旨在减少所需的环境交互量。
最近,无监督强化学习基准(URLB)(Laskin等人,2021)建立了一个通用协议,用于比较来自DMC套件(Tassa等人,2018)的多个领域和任务中的自监督算法。在该基准中,代理被允许一个任务无关的预训练阶段,在此阶段它可以以无监督方式与环境交互,随后是一个微调阶段,在其中给定有限的环境交互预算,代理应快速适应特定任务。然而,Laskin等人(2021)获得的结果表明,该基准对当前URL方法尤其具有挑战性,特别是当代理的输入是基于像素的图像时。
世界模型已被证明在从视觉解决RL任务方面非常有效,无论是在仿真中(Hafner等人,2021;2019a)还是在机器人学中(Wu等人,2022),并且它们通常具有数据高效性,因为它们能够在想象中学习行为(Sutton,1991)。受此前基于模型的探索工作(Sekar等人,2020)以及世界模型能够高效利用自监督数据这一想法(LeCun,2022)的启发,我们采用了基于世界模型的方法。在一项初步的大规模研究中,我们表明不同的URL策略可以有效地与基于世界模型的代理相结合,用于无监督预训练,从而在基于像素的URLB中相比无模型代理(Laskin等人,2021)带来更稳健的性能。通过我们的方法,我们进一步通过利用任务感知的适应策略并引入一种新的混合规划器Dyna-MPC来提升性能,该规划器通过使代理能够在想象中学习和规划行为,从而能够更多地利用预训练的世界模型。
我们的贡献可以总结如下:
• 我们对URLB进行了一项大规模研究,表明世界模型可以与不同的无监督强化学习方法相结合,作为一种有效的预训练策略,用于数据高效的视觉控制(第3节),
• 我们介绍了我们的方法:一种有效的适应策略,它将代理各组件间的任务感知微调与一种新颖的混合规划器Dyna-MPC相结合,使代理能够有效地将想象中学习到的行为与规划相结合(第4节),
• 我们展示了基于像素的URLB上的最先进结果,获得了93.59%的归一化性能。我们还广泛评估并分析了我们的方法,以测试其在适应时对潜在环境扰动的鲁棒性(Dulac-Arnold等人,2020),并理解当前的局限性(第5节)。
一项广泛的实证评估,由超过2k次实验支持,涵盖主要结果、分析和消融研究,被用于仔细研究URLB并分析我们的方法。我们希望我们的大规模评估能够为未来研究提供信息,推动开发和部署预训练代理,使其能够以显著更少的数据适应更复杂和现实的任务,正如视觉(Parisi等人,2022)和语言(Ahn等人,2022)的无监督预训练模型所发生的那样。
2. 预备知识
![]()
世界模型。在这项工作中,我们基于 DreamerV2 代理(Hafner 等人,2021),它学习一个世界模型(Ha & Schmidhuber,2018;Hafner 等人,2019b),预测环境中动作的结果。动力学被捕获到一个潜在空间 Z Z中,提供高维输入的紧凑表示。
世界模型由以下组件组成:
![]()
![]()
3. 无监督基于模型的预训练
在预训练(PT)阶段,无监督强化学习可用于探索环境,收集数据以训练代理的各组件。由此产生的网络随后被用于初始化部署到下游任务的代理中的相应组件,旨在降低样本复杂度。
无监督强化学习方法可分为三类(Laskin 等人,2021):基于知识的,旨在通过最大化误差预测来增加代理的知识(Pathak 等人,2017;2019;Burda 等人,2019b);基于数据的,旨在实现数据的多样性(Yarats 等人,2021;Liu & Abbeel,2021b);以及基于能力的,旨在学习多样化的技能(Liu & Abbeel,2021a;Eysenbach 等人,2019)。在图 1a 中,我们报告了 Laskin 等人(2021)的结果,表明当与 DrQv2 无模型代理(Yarats 等人,2022)——基于像素的强化学习中最先进的代理——相结合时,这些方法在基于像素的 URLB 上均没有特别有效,其中使用无监督强化学习收集的数据被用于预训练代理的演员、评论家和编码器。这种不尽如人意的表现的原因是,无模型代理中所有预训练的组件都依赖奖励函数来最大化。由于 PT 阶段的奖励是来自无监督强化学习的内在奖励,它们未能捕获环境的重要方面,例如环境的动力学,而这些方面本可有助于高效地适应下游任务。
相反,基于世界模型的代理可以被用来有效地利用无监督数据收集,因为它们专注于学习环境的动力学,然后利用学习到的模型在潜在想象中学习动作。为了加强这一论点,我们进行了一项大规模研究,包括多种无监督强化学习方法,并使用它们来预训练 Dreamer 代理的组件。作为基于知识的方法,我们采用 ICM(Pathak 等人,2017)、LBS(Mazzaglia 等人,2021)、Plan2Explore(P2E;(Sekar 等人,2020))和 RND(Burda 等人,2019b)。作为基于数据的方法,我们选择 APT(Liu & Abbeel,2021b),作为基于能力的方法,我们采用 DIAYN(Eysenbach 等人,2019)和 APS(Liu & Abbeel,2021a)。最后,我们还测试了随机动作,作为一种朴素的最大熵基线(Haarnoja 等人,2018)。
在图 1b 中按类别汇总结果,我们表明通过利用预训练的世界模型,所有类别的整体性能随时间推移而提升,这与无模型结果相反,后者只有基于知识的方法略有改善。特别是,基于数据和基于知识的方法在 Walker 和 Quadruped 领域更有效,而随机动作和基于能力的方法在 Jaco 领域更有效。每种方法的详细结果(可在附录 D 中找到)还表明,与 Sekar 等人(2020)的发现相反,许多无监督强化学习方法可以与世界模型相结合以实现高效探索。这一优点可能归因于我们仔细调整了这些方法,使其有效地与世界模型协同工作。实现细节见附录 B,代码可在项目网站上获取。
![]()
4. 方法
在上一节关于 URLB 的大规模研究中,我们展示了使用无监督强化学习收集的数据来学习基于模型的代理,构成了一种有效的预训练策略。基于此,我们将方法聚焦于高效地适应预训练好的基于世界模型的代理,以用于下游任务。我们的方法可以总结为:
采用任务感知的微调(FT)策略,该策略仅调整我们预期对下游任务有意义的预训练代理模块;
采用混合规划器,它允许通过在想象中学习和规划,进一步利用预训练的世界模型。为此,我们提出了一种新算法:Dyna-MPC。
该方法的概述如图 2 所示,算法见附录 C。
![]()
任务感知微调。在 URLB 的背景下,环境动力学在预训练(PT)和微调(FT)阶段之间保持不变,因此在无监督交互期间学到的一些组件(例如世界模型)可以被复用于 FT 期间的快速适应。然而,由于从 PT 阶段切换到 FT 阶段时,奖励从伪奖励变为任务奖励,预训练演员和评论家是否能帮助下游任务尚不清楚,这一因素在先前的工作(Laskin 等人,2021;Sekar 等人,2020)以及第 3 节的结果中并未被考虑。
在无监督阶段,演员的动作驱动代理探索新的转移或到达环境中未见过的状态。当进入 FT 阶段时,这些动作可能有助于在密集奖励任务(如 URLB 中的 Quadruped 和 Walker 任务,其中代理因每次状态变化而获得奖励)中快速探索一些环境转移。然而,在更稀疏的奖励设定中,如 Jaco 任务,代理的动作需要找到对应于环境某些特定区域的奖励。在这些情况下,反复驱使代理远离起始状态、可能错过任务目标的动作,实际上可能使适应阶段更加困难。
评论家的预测是在无监督交互阶段基于内在奖励训练的,鉴于奖励尺度和值的差异,它们很难迁移到特定的下游任务奖励函数。虽然我们认为找到调整评论家预测的方法可能很有趣,例如通过重新缩放它们以更接近下游任务回报,但我们选择丢弃预训练的评论家,并在微调期间从头重新学习它。
总而言之,在将我们的代理转移到适应阶段时,我们总是保留并微调预训练模型,并且总是丢弃预训练评论家。至于预训练演员,当奖励密集时(例如 Walker 和 Quadruped 任务),我们会对其进行微调;但在稀疏奖励任务中(例如 Jaco),我们会将其丢弃。
在想象中学习和规划。已知环境的模型后,传统的基于模型的控制方法,例如模型预测控制(MPC)(Williams 等人,2015;Chua 等人,2018;Richards,2005),可用于规划代理的动作。尽管如此,使用演员-评论家方法有几个优势,例如通过缓存先前计算的(次)优动作来摊销规划成本,以及计算从某一状态出发的长期回报,而无需预测遥远未来的结果。更近期的混合策略,如 LOOP(Sikchi 等人,2020)和 TD-MPC(Hansen 等人,2022),允许将演员的预测与从动作分布中采样的轨迹相结合,并迭代改进该分布(Rubinstein & Kroese,2004)。
由于在 URLB 中我们预训练了一个世界模型,我们可以利用潜在空间中的规划,以有限的额外环境交互来进行适应。上述策略的一个问题是,它们基于学习离策略演员和评论家,在我们的背景下,这会阻碍我们利用预训练模型在想象中学习演员和评论家。为了能够将想象中学习到的行为与混合规划相结合(Hafner 等人,2019a),我们开发了一种新方法,我们称之为 Dyna-MPC,它将想象中学习到的演员和评论家与用于规划的类 MPPI 采样策略(Williams 等人,2015)相结合。
4.1. Dyna-MPC
如算法 1 中详述,在每个时间步,我们使用模型想象一组潜在轨迹,这是通过从时间相关的多元高斯分布以及从在想象中训练的潜在演员策略中采样动作来实现的(Hafner 等人,2019a)。回报使用模型和评论家的奖励预测来估计。一种迭代策略(Williams 等人,2015)被用来在 J J次迭代中更新多元高斯分布的参数。与先前方法的一个显著区别是,Dyna-MPC 中的策略是在想象中以在策略(on-policy)方式学习的,因此不需要针对离策略学习的校正(Sikchi 等人,2020)。
![]()
评论家在世界模型的想象中学习,使用回报的 GAE- λ λ估计来计算演员动作的期望值(Schulman 等人,2016):
![]()
![]()
![]()
![]()
5. 评估与分析
对于所有实验,结果均以至少三个随机种子呈现。
5.1. 无监督强化学习基准
在图 3 中,我们将 Disagreement(URLB 论文中表现最好的算法,Laskin 等人,2021)和 Plan2Explore(Sekar 等人,2020)的结果与我们的方法进行了比较。我们还报告了 DrQv2 和 DreamerV2 在经过 100k 微调帧、无预训练后的得分。我们的方法在所有领域都表现更优。相对于 Disagreement,我们将性能提升了惊人的 55%。相对于 Plan2Explore,我们将性能提升了 17%。我们强调,与 Plan2Explore 的主要区别在于:(i) 我们采用 LBS 进行无监督数据收集(Mazzaglia 等人,2021),因为这在某些领域表现更好(见附录 D),(ii) 我们采用任务感知微调,(iii) 我们采用 Dyna-MPC。
![]()
如表 1 所报告,当与我们所引入的适应策略相结合时,Plan2Explore 的性能也可以显著提升。我们通过以下段落中的消融研究进一步验证了这些策略。
![]()
任务感知微调。我们测试了不同的微调配置,其中我们将一些预训练组件的权重复制到代理中,以针对下游任务进行微调。为了增加该消融研究的普适性,我们对第 3 节中介绍的所有无监督强化学习方法进行了测试,并在图 4 中展示了汇总结果(每种方法的详细结果见附录 D)。
![]()
总体而言,微调预训练的世界模型提供了最显著的性能提升,强化了世界模型与无监督强化学习结合非常有效的假设。正如我们所预期的,使用预训练的评论家系统性地更差,这可以由内在奖励和任务奖励之间的差异来解释。最后,微调演员在 Walker 任务中略微提升了性能,在 Quadruped 任务中显著提升(这些是密集奖励任务),但在 Jaco 稀疏奖励任务中却有害。
Dyna-MPC。我们使用通过我们所考虑的所有不同无监督策略预训练的世界模型和演员(见第 3 节),并测试它们在有无 Dyna-MPC 规划情况下的微调性能。汇总得分报告在图 5 中,每种方法的详细结果可在附录 D 中获得。我们观察到,采用 Dyna-MPC 总是有益的,因为它提升了所有领域的平均性能。
![]()
5.2. 真实世界强化学习基准
我们采用 RWRL 套件(Dulac-Arnold 等人,2020)中基于视觉的 Walker Walk 和 Quadruped Walk 任务变体,来测试我们方法的鲁棒性。这些任务引入了系统延迟、随机性以及机器人模型和传感器的扰动,这些扰动以三种强度应用于原始环境,即“简单”、“中等”和“困难”(详见附录 E)。
在图 6 中,我们展示了我们的方法(在无扰动环境上预训练,并在有扰动环境上微调)的结果,并将其与在有扰动环境上从零开始训练 Dreamer 100k、1M 和 2M 帧进行了比较。我们还添加了一个随机动作 + Dreamer 基线,它同样在无扰动环境上预训练,以观察我们的方法是否优于在随机收集数据上进行的预训练。
总体而言,我们发现,尽管环境中存在所有变化,微调预训练模型相比从零开始训练 100k 帧具有优势。此外,在 Quadruped 简单和中等设定中,我们的方法表现优于 Dreamer@1M,并且与 Dreamer@2M 相差不远,同时分别少用 10 倍和 20 倍的任务特定数据。我们的方法在 Walker 简单任务中也表现接近 Dreamer@1M/2M。最后,我们的方法在“简单”和“中等”设定中也大幅优于随机动作,表明更好的预训练模型能带来更高的微调性能,即使下游任务的动力学受到错误设定和噪声因素的影响。
5.3. 扩展分析
为了更好地分析所学习的组件,我们进行了一系列额外的研究。为简洁起见,实验设置的详细描述推迟到附录 F,这里我们简要总结主要结论。
在线学习奖励。我们验证了在微调期间必须发现并学习奖励函数是否会影响性能。在图 7 中,我们将此与(违反 URLB 设定的)提前知道任务并能在预训练阶段预训练奖励预测器的代理进行了比较。我们看到,对于密集奖励任务(如 Walker 和 Quadruped 任务),学习奖励预测器不会显著影响性能。然而,在更稀疏的奖励任务中,即 Jaco 任务,提前知道奖励信息提供了优势。高效发现稀疏奖励的有效策略是未来研究的一个挑战。更多细节见附录 F.1。
![]()
零样本适应。已知来自预训练的奖励预测器,如果模型和奖励函数允许,就有可能使用 MPC 方法进行零样本控制。在图 8 中,我们表明尽管零样本 MPC(ZS)相比 Dreamer@100k 具有优势,但微调阶段对于在下游任务上提供高性能至关重要,因为代理利用这一阶段来收集关于环境和任务的缺失信息。进一步细节见附录 F.2。
![]()
潜在动力学差异。我们提出了一种新度量,潜在动力学差异(LDD),评估预训练模型的潜在预测与在任务上微调后同一模型之间的距离。在图 9 中,我们展示了 LDD 与使用预训练模型和微调模型进行规划之间的性能比值的相关性(详细解释见附录 F.3)。我们观察到强烈的负皮尔逊相关性(−0.62,p 值:0.03),突显了微调期间模型动力学的更新在提升性能方面发挥了重要作用。
![]()
无监督奖励与性能。我们在表 2 中分析了不同代理的性能与其在预言机代理获得的最优轨迹上的内在奖励之间的相关性。特别是,在 URLB 中总体表现最好的 LBS 的相关性具有统计显著性,其 p 值 < 0.05。我们认为这种相关性可能是 LBS 出色表现的原因之一。进一步见解见附录 F.4。
![]()
6. 相关工作
基于模型的控制。动力学模型与强大的搜索方法相结合,已在诸如 Atari(Schrittwieser 等人,2020)和连续控制(Hafner 等人,2019a;Janner 等人,2019;Sikchi 等人,2021;Lowrey 等人,2018)等各种任务上取得了令人印象深刻的成果。LOOP(Sikchi 等人,2020)和 TD-MPC(Hansen 等人,2022)将时序差分学习与 MPC 相结合。TD-MPC 提出的模型是任务导向的,因此需要一个任务来加速学习。在我们的工作中,我们专注于无监督模型学习,基于 DreamerV2 模型(Hafner 等人,2021),其监督来自预测环境的观测。不使用重建的方法可能更好地泛化到视觉差异(Deng 等人,2021;Ma 等人,2020),但由于缺少解码器,它们失去了可解释性。
无监督强化学习。在我们工作之前,关于好奇心的大规模研究(Burda 等人,2018)对无奖励设定中基于知识的方法的性能提供了富有洞见的分析。在我们的工作中,我们利用 URLB 设定,对基于模型的控制技术与无监督强化学习的结合进行了分析。这使我们得以制定一种策略,以数据高效的方式使预训练模型适应视觉控制任务。与之密切相关的是,Plan2Explore(Sekar 等人,2020)将 Disagreement(Pathak 等人,2019)改造为与 Dreamer(Hafner 等人,2019a)协同工作。在我们的工作中,除了分析更广泛的、可与基于世界模型的代理协同工作的无监督强化学习策略之外,我们还展示了如何更好地利用代理的预训练组件进行适应,并且我们提出了一种混合规划器以提高数据效率。因此,与 Plan2Explore 相比,我们大幅提升了性能。
迁移学习。在迁移学习领域,微调是最常用的方法。然而,微调所有预训练的代理组件可能并不是最有效的策略。在强化学习的迁移学习中,他们研究了这一问题,主要目标是从一个环境迁移到另一个环境(Farebrother 等人,2018;Sasso 等人,2022;van Driessel & Francois-Lavet,2021)。相反,我们分析了在假定环境动力学保持相似或相同的情况下,哪些代理组件应从无监督预训练阶段迁移到有监督微调阶段。
7. 结论
为了加速面向真实世界任务的学习代理的开发和部署,所采用的算法能够以数据高效的方式适应多个任务至关重要。我们的方法在基于像素的 URLB(一个具有挑战性且已被社区广泛采用的基准)上获得了接近最优的性能,并在 RWRL 基准上展示了对环境中扰动的鲁棒性。我们还分析了学习模型的几个方面,以理解未来哪些方面可以进一步改进,从而简化适应过程。
我们的结果在基于像素的 URLB 上确立了新的最先进水平,可能成为推动 URL 研究进一步发展的参考。同时,随着我们缩小与监督基线的差距,我们表明社区需要新的基准来进一步发展 URL 研究。URLB 的一个主要局限是预训练和微调之间的环境几乎相同,而正如我们所展示的,这使得基于模型的方法更容易学习环境如何运作。尽管我们在 RWRL 基准上的评估表明,尽管存在视觉差异和扰动,无监督预训练仍然有益,但将这些系统部署到真实世界还需要额外的预防措施。为了支持这一研究方向,未来的基准应包含预训练和微调之间的变化(包括视觉和动力学两方面),以测试代理行为或世界模型的泛化能力。
我们关于 URLB 研究的另一个结论是学习可泛化且可适应的行为的重要性。在强化学习中,这体现在演员和评论家模型上。虽然我们表明,在无监督奖励上训练的评论家模型无法轻易迁移到新任务,但有一些研究路线旨在通过采用后继特征(Hansen 等人,2020;Barreto 等人,2016)或目标导向的价值函数(Ma 等人,2022)来学习可泛化的评论家网络,这可能带来对给定奖励函数的更快或零样本适应(Touati 等人,2023)。至于演员,我们相信学习可泛化的技能可能是学习更多样化和可适应动作行为的一种潜在方式(Pertsch 等人,2020)。然而,我们也体验到,技能驱动的方法(Liu & Abbeel,2021a;Eysenbach 等人,2019)往往具有更有限的探索能力(Campos 等人,2020),在 URLB 的某些领域(即 Walker 和 Quadruped)中落后于其他方法。
原文链接:https://arxiv.org/pdf/2209.12016v2
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.