![]()
AI 确实完美执行了你的 Prompt,但也极易顺手毁掉你想要的结果。
编译 | 王启隆
出品丨AI 科技大本营(ID:rgznai100)
“享乐型神经元”——1977 年,当 29 岁的安德鲁·巴托(Andrew Barto)在马萨诸塞大学接下这个听起来有些“疯狂”的博士后项目时,强化学习(RL)还只是计算机科学边缘的一个异类。“
在随后的几十年里,监督学习和深度神经网络席卷全球,而巴托与他的学生——如今被世人称为“强化学习之父”的理查德·萨顿(Richard Sutton),却在“试错”与“奖惩”的冷板凳上坐了半个世纪。直到大模型时代降临,RLHF(人类反馈强化学习)与智能体(Agent)成为通往 AGI 的必经之路,这对师徒才在 2024 年被授予以计算机界诺贝尔奖之称的图灵奖。
![]()
◀ Andrew Barto & Richard Sutton ▶
直到大模型时代降临,RLHF(人类反馈强化学习)与智能体(Agent)成为通往 AGI 的必经之路,这对师徒才在 2024 年被授予以计算机界诺贝尔奖之称的图灵奖。
2026 年 6 月 12 日,在第八届北京智源大会上,78 岁的巴托因身体原因未能亲临现场,他隔着屏幕,用略显沙哑的声音发表了名为《重新发现强化学习》的演讲。他将视线拉回到了 1898 年桑代克的“谜箱”与动物实验,并警示人们:当智能体被释放到物理世界,最致命的危险依然是控制论之父维纳半个世纪前就提出的警告——系统只会给你“你所要求的东西”,而非“你真正想要的东西”。
![]()
演讲结束后,南洋理工大学教授安波与巴托展开了一场关于“算力分配、自进化与 AGI 终局”的极具张力的对话。这位 78 岁的图灵奖得主,在这场思想碰撞中厘清了强化学习在 AI 自进化时代最本质的坐标:
强化学习绝非仅能“激发”模型的既有能力,它是探索并发现全新行为的算法通路。大语言模型的预训练本质是模仿,而强化学习的底层是“探索与利用”的试错博弈。在序贯决策中,即使序列中的每一步动作都是已知的,它们重组后的序列仍然可能产生超越人类既有经验的全新结果。
时序差分算法(TD)中预测误差的数学项,在提出十多年后被证明与大脑多巴胺的相位活动特征完全吻合。
强化学习并不是仅靠“只要 RL 就够了”的单一教条就能通往通用人工智能(AGI)。尽管萨顿等学者坚持“奖励即一切”的终极假设,但纯粹的 RL 在计算上极度昂贵且极其低效。AGI 的终局绝非单一范式的胜利,而是 RL 与环境模型、规划、推理等多种机制深度协同的复杂系统。
就像迈达斯许愿“点石成金”却把女儿也变成金子的寓言,系统极易走向“反向实例化”——它确实高效执行了你写下的指令,却彻底偏离了你真正想要的结果。
年轻学者如果想在强化学习领域实现范式突破,最值得深耕的依然是“多智能体强化学习”(Multi-agent RL)。尽管其博弈复杂性呈指数级上升,以至于早期的教科书极少提及,但“神经系统本质上是多个强化学习智能体相互作用的社会”这一假说,仍有巨大的未垦空间。
以下为巴托教授的演讲内容。
![]()
强化学习的本质是什么?
我给这场报告起的标题叫《重新发现强化学习》(Rediscovering Reinforcement Learning)。这个标题暗示的是:强化学习其实已经存在了非常非常久,这一点我接下来会讲得很清楚。
这个主题之所以一直让我着迷,其中一个原因就在于,它和很多别的领域都有联系,正如这里展示的那样。首先当然是心理学,很多相关方法最早就是从那里开始的;当然也包括人工智能、控制理论和运筹学;还有经济学与金融学;再比如神经科学、博弈论等等。
![]()
这些联系,在我研究这一主题的整个过程中,一直都让我很着迷。
CSDN 6 月宠粉福利
200 小时 GP U 算力免费领
瑞幸咖啡/肯德基早餐/下午茶等能量套餐任选其一
入群还可每月定期抽取旗舰显卡、AI PC 等极客神装
![]()
领取地址:https://s.csdn.cn/4nPsOp
如果把时间回溯到 19 世纪,回到 Edward Thorndike——他用动物研究学习问题。大家最熟悉的,大概是他把动物放进一个谜箱(puzzle box)里,箱子的门闩设计得比较特殊。动物并不喜欢待在箱子里,于是会四处摸索,最后偶然发现如何逃出来。然后他再把动物放回去,这些动物就会比之前更快地逃出箱子。再往后,只要一被重新放进去,它们就会相当“听话”地把自己放出来。
这是一种学习形式,在当时被称为“试错学习”(trial-and-error learning),后来则被称为工具性条件作用(instrumental conditioning)或操作性条件作用(operant conditioning)。
他提出了“效果律”(law of effect)这个术语,时间是在 1898 年。这里展示的是效果律的一种表述。
从根本上说,这是一种非常符合常识的观念:如果某件事之后紧跟着的是满足感,那么在其他条件相同的情况下,先前采取的那些动作就会与当时的情境建立连接;这样一来,当同样的情境再次出现时,那些动作就更可能再次发生。反过来,如果某件事之后跟着的是不适或痛苦,那么动物内部这些连接就会被削弱,于是这些动作再次发生的可能性就会降低。
我想强调的是,这里处理的不局限在“找到令人满足的东西”或者“避开不令人满足的东西”,还包括把动作和情境联系起来。所以这本质上是一个联想性的过程。实际上,即便在那个时候,它就已经被称为“联结主义”(connectionism),因为这里建立的是从情境到那些被证明有益的动作之间的连接。
这被称为试错学习;用更现代的话说,就是工具性条件作用或操作性条件作用。
哲学家 Daniel Dennett 曾写过一篇文章,题目叫《为什么效果律不会消失》(Why the Law of Effect Will Not Go Away)。他甚至提出一个更强的说法:效果律不只是对行为的一种可能解释的一部分,而是任何充分的行为解释都不可或缺的一部分。
因此,尽管效果律这些年来不断被修正、被批评,但它依然是我们理解某类学习如何发生时,一个非常符合常识的解释框架。
现在说回 RL,也就是计算意义上的强化学习。在我看来——当然,我不确定每个人都会同意——它是控制(control)、搜索(search)和联想记忆(associative memory)的结合。
所谓控制,是指学习系统会影响未来发生的事情。所谓搜索,是指试错式的“生成并测试”(generate-and-test),或者更准确地说,“生成并评估”(generate-and-evaluate)、“变异与选择”(variation and selection)。这些其实都是同一类过程的不同名称:通过探索,看看会产生怎样的评估结果。而所谓记忆,则是记住在每一种情境下什么方法最有效,并在下一次从那里出发。所以,这里的联想记忆,正是它的联结主义一面。
同时,生成器和评估器本身也都应该以某种方式体现智能性,这一点非常重要,不过我今天不会在这个问题上展开太多。大家只需要记住:有时“生成并测试”会被称为“盲变异”(blind variation),但“盲”并不一定意味着完全随机,它只是表示:结果在一开始并不能被预见。
好,我们知道监督学习(supervised learning)是从带标签样本中学习,它是一种误差校正(error-correction)过程,有时也被称为“有教师的学习”(learning with a teacher)。无监督学习(unsupervised learning)则是从无标签样本中学习。强化学习和这两者都不同,有时它也被称为“有评判器的学习”(learning with a critic)。
评判器(critic)和教师(teacher)并不一样。教师会直接给出期望的响应;而评判器只是对已经生成出来的结果进行评价,却不会明确告诉你本来应该生成什么。
另外,当人们把这种学习称为“试错”时,其实也不完全准确,因为它并不一定涉及“错误”。事实上,心理学家所说的试错学习,并不等同于误差校正。它和强化学习的关系,反而比和监督学习更近。
当年我们在研究这个问题时,尝试回头寻找历史上那些已经构建出、用今天的话说属于强化学习的系统。其中一个方向,就是随机学习自动机(stochastic learning automata);而在统计学里,它通常更常被称作多臂老虎机问题(multi-armed bandit problems)。
在这类问题中,随机环境会生成动作,而学习自动机会对这些动作进行奖励或惩罚,从而改变未来生成这些动作的概率。如果学习规则设计得合适,它就会收敛到回报最高的那个动作。
我们早期有一篇论文,研究的是利用随机学习自动机进行模式识别(pattern recognition)。那篇论文是我和 Anand Barto 一起做的,他那时还是研究生。这项工作把联想学习的部分和 bandit 问题连接了起来。也就是说,它不只是找到“哪个动作的奖励最高”,而是进一步建立了一个从情境到动作的映射。
![]()
这就是 Anand——现在的 Anand。当时他还是学生。我们为一个把随机学习自动机和联想学习结合起来的算法证明了收敛性。我们当时觉得,这正是此前随机学习自动机研究中所缺失的一块。
后来,我们又加入了一个想法:学习的对象不一定只是“做出一个动作”,也可以是学习一串由状态转移触发的动作序列。于是问题就变成了序贯决策问题(sequential decision problems)。会有一系列状态出现,动作会影响状态转移和奖励,而奖励可以在这个序贯过程中任何一步出现。
![]()
在这种情况下,系统性能由一个叫作“回报”(return)的量来评估。这个概念其实来自金融领域。某个特定的回报——比如折扣回报(discounted return)——本质上就是未来奖励的折扣和。折扣率如果是 0,那么看重的就是即时奖励;如果是 1,那就是把所有未来奖励全部加起来。
![]()
因此,系统追求的就不再只是让眼前结果最大化,而是可以扩展到处理时间跨度更长的结果。这正是大多数研究强化学习的人真正想要理解的问题。
如果我想再强调几个特征,那就是:学习者并不会被教师直接告知该采取什么动作。它必须通过尝试,并观察这些动作得到怎样的评价,自己去发现。所以从本质上说,“变异与评估”其实就是一个优化问题。
奖励也可能是延迟到来的,而“为了更大的长期收益而牺牲短期收益”正是其中的核心问题。系统需要探索,去发现哪些动作回报更高;然后又要利用(exploit)这些知识,把奖励真正积累起来。实际上,我们研究的那类强化学习,把整个问题看作一个目标导向的智能体在不确定环境中的交互问题。
那我是怎么进入这个领域的呢?我后来做博士后时,参与了一个项目。这个项目的目标,是评估 Harry Klopf 的一个想法。
![]()
Klopf 当时是美国空军科研办公室(Air Force Office of Scientific Research)某个主管部门的一位资深科学家。他提出了一个假说:神经元是“享乐型的”(hedonistic),也就是说,每个神经元本身并不考虑整体,只是努力最大化某种局部意义上的“快乐类比”,同时最小化某种局部意义上的“痛苦类比”。
他写过一些报告,也写过这本书。比如这本书的第一版出版于 1972 年。1977 年,马萨诸塞大学聘我做博士后的那个项目,名称就叫“面向自适应智能的目标寻求组件”(Goal-Seeking Components for Adaptive Intelligence)。
他认为,大脑是由一群像社会一样相互作用的享乐型神经元构成的。我们在这个项目中的任务,就是看看这件事究竟有没有道理。它听上去相当前卫,甚至也许有点疯狂。但问题是:它之前有人研究过吗?它已经被否定了吗?它值得研究吗?
我、我的第一个学生 Rich Sutton,以及其他一些学生,都相当深入地钻研了这整段历史,最后我们认为:这件事值得继续追下去。我们也因此了解了很多这方面的历史。
下面我想稍微讲一点:他的想法到底是什么,神经元在这个框架里又是如何工作的。
![]()
强化学习的基石
![]()
这是一条突触(synapse):前面是突触前末梢(presynaptic terminal),后面是一个突触后神经元(postsynaptic neuron)。突触连接由一个权重(weight)来表征;而在 Klopf 的理论中,突触前末梢还由另一个他称之为 eligibility 的量来表征。
Klopf 的说法是:当一个神经元发放动作电位(action potential)时,所有那些当时处于活跃状态、并且对这个动作电位有贡献的突触,都会变得“具备资格”,可以发生效能或权重上的变化。如果在一个合适的时间窗口内,这个动作电位之后伴随着奖励增加,那么所有这些具备资格的突触,它们的效能都会提高;如果伴随的是惩罚,则效能降低。
换句话说,按照这个设想,突触可塑性(synaptic plasticity)实现的就是效果律。至于在单个神经元层面,什么才算是奖励或惩罚,这一点并没有被具体说明。
那我们是怎么研究这个想法的呢?我们使用了一种单独的信号,把所谓的奖励信号传递给这些人工神经元。
强化学习的应用有很多,而且我几乎每天都会听到新的应用场景。当然包括棋类游戏、机器人、能源管理、自动驾驶、交易与金融、自然语言处理、医疗健康——凡是序贯决策很重要的地方都可能用得上。比如,随着时间推进去安排治疗方案,依据每个阶段的结果来制定化疗计划。对于大语言模型来说,也有大量应用,比如微调,以及其他大语言模型可以借助的过程。
所谓深度强化学习(deep reinforcement learning),就是把强化学习和深度神经网络结合起来。因此,这些享乐型神经元的输入,就会来自一个可能具有很深层级的网络的输出。
这个想法其实出现得非常早,甚至早于计算机本身。在 20 世纪 30 年代,人们已经在使用机电装置,本质上做的就是强化学习。这是华盛顿大学心理学领域 Stephen Smith 的工作:那其实有点像一辆模型火车,可以自己决定在轨道上往哪个方向走。不过那是 1935 年,所以这个思路的历史真的非常久远。
当然,在心理学中,操作性条件作用——或者说强化学习——也一度是研究动物学习时最热门的话题之一。
![]()
另外,就我所知,最早提出在数字计算机上实现 RL 的想法的人,是 Alan Turing。他描述过一个“快乐—痛苦系统”(pleasure-pain system)。他的原话大致是这样:
“当系统到达某个配置,而在该配置下应采取什么动作尚未确定时,就会针对缺失的数据做出一次随机选择,并在描述中写入相应条目。如果随后出现痛苦刺激,这些暂时写入的条目就会被取消;如果随后出现快乐刺激,它们就会全部被永久保留。”
这件事发生在 1948 年。Turing 本人并没有真正把它实现出来,因为他当时能用到的那种计算机实际上还并不存在。但这已经是对某类强化学习系统非常清晰的表述了。
Claude Shannon 那只名叫 Theseus 的“老鼠”,本质上也是一个强化学习系统。严格说来,真正进行学习的其实不是“老鼠”本身,而是它所运行的那个迷宫,但那仍然是一个本质上依赖强化学习的迷宫求解系统。
我只想强调一点:它必须去探索。没有人告诉它该走哪条岔路,它必须自己去试,看看这些路到底通向哪里。
再往后,Farley 和 Clark 在 1954 年做的工作——据我所知——是第一次在数字计算机上模拟一个会学习的自适应人工神经网络。
![]()
他们研究了一个网络,当时使用的是一台拥有 4K 个 16 位字的机器,并实现了 64 个随机线性阈值单元(stochastic linear threshold units)。他们用强化过程来训练这个网络,目标是:依据输入模式,让一组输出单元的激活高于另一组。
所以,这是一个在数字计算机上实现的联想式强化系统;据我判断,这是这一类系统的第一次实例。
后来第二年,在下一篇论文里,Clark 和 Farley 用的还是同一个网络,但他们改做了监督学习,并且开始对模式识别和泛化感兴趣——从标题里你就能看出来。
![]()
所以在我看来,这几乎就标志着人们开始放弃强化学习,转而拥抱监督学习;而监督学习后来也确实成了机器学习、或者说神经网络学习中更突出的主流研究对象。
Marvin Minsky 的博士论文,其实做的也是强化学习。他使用了一种叫作随机神经模拟强化计算器(stochastic neural analog reinforcement calculators, SNARCs)的装置,它们实际上就很像突触。这是一个非常明确的强化学习系统,他在自己那篇著名的 1961 年论文里也谈了很多。
他讨论了“信用分配问题”(credit assignment),也就是如何把训练信息送到正确的位置、并在正确的时间送达。在那里,这个问题就是在强化学习的语境下提出的。因此,我们后来参与的很多强化学习工作,本质上都在处理信用分配问题,而这正是让这些系统真正起作用的关键所在。
![]()
当然,Minsky 后来转向了逻辑机器(logic machines),不再继续走这条路;但他的博士论文直到今天读起来仍然非常有意思。
Arthur Samuel 的跳棋程序(checker player)也是 AI 史上的一个里程碑,而且我认为它本质上也是一个强化学习系统——尽管有些人未必同意这个判断。但它确实是通过自我博弈(self-play)来学习的。
他的核心想法是:他希望给棋盘上的每一个局面打分,使这个分数看起来像是“在真实对弈中最有可能发生的那串走子最终所对应的终局局面”的分数。换句话说,这个分数其实是在预测整局棋最终的结果。
![]()
这个想法在强化学习中当然极其关键,事实上,它也正是把这一领域与最优控制(optimal control)和动态规划(dynamic programming)联系起来的桥梁。动态规划是 Richard Bellman 提出的术语,原本指的是一种处理多种不同问题——尤其也包括最优控制问题——的计算过程。
更具体地说,在最优控制里,给状态赋分的这个过程对应的就是价值函数(value functions)。这里有一个公式,表示从某个特定初始状态出发时的期望回报(expected return)。所以,这其实就是对一个状态的打分,而这个分数反映的是:从该状态出发后,未来能够获得的期望奖励。
还有一种变体会把动作也一起纳入考虑。因此,用来学习这些量的算法,本来是经典的动态规划算法;但我们后来做成了一种更简单、递归式的形式。
特别是 Rich Sutton——也就是凭借这项工作,和我共同获得图灵奖的人——提出了今天所谓的时序差分算法(temporal-difference algorithm)。
![]()
它本质上是一种误差校正过程。这个误差项,就是“当前奖励 + 对未来奖励的一个估计”,再减去“先前对未来奖励的估计”。如果把这个误差项用于一个监督学习算法里,并且算法收敛了,那么它最终就会收敛到价值本身。在这里没有折扣因子,因此这个价值就是未来奖励的总和。所以它实际上是在估计当前状态的状态价值。
这个想法如今已经被非常广泛地使用。
我们当时想亲自试一试这个思路,于是看到了 Donald Michie 和 Roger Chambers 在 1968 年发表的一篇论文,来自爱丁堡大学。这是一个经典控制问题。他们把它称为BOXES,因为他们把倒立摆小车系统(cart-pole system)的状态空间划分成一个个“盒子”,每个盒子都对应某种状态索引。每个盒子里都有一个所谓的 demon,它会记录自己提出了什么动作,以及在采取这个动作之后,杆子被维持平衡了多久。
![]()
这个系统确实学会了保持平衡。小车—倒立摆本来就是一个经典控制问题。
我们对这个问题很感兴趣,于是沿用了这种问题设定,进一步构建了后来被称为actor-critic 的系统。
我们用了两个类似神经元的单元:一个是我们称作自适应评判器单元(adaptive critic element)的部分,另一个则是联想搜索单元(associative search element)。
![]()
所以,critic 是一个基于时序差分进行预测的单元,而联想搜索单元则是一个遵循效果律的单元。我们现在会区分 reinforcement 和 reward。我们当时把这里的 reinforcement 实际上视为 reward,而 TD 误差则被用作传给 actor 的强化信号。
这是我们 1983 年发表的一篇论文。它实际上是我们被引用最多的论文之一。最近我还写过一篇文章,专门回顾我们当时是怎么完成这项工作的,其中有哪些问题、有哪些困难,以及我们在那篇论文里犯过哪些错误——这些错误我们自己也很遗憾。比如说,我们在仿真里把重力的符号写反了;但那些试图复现实验的人会说,我们的系统居然一下就把杆子平衡住了。其实那是因为重力方向本来就反过来了。
于是,这就演化成了今天强化学习中所说的 actor-critic 系统。
正如我前面提到的,Google 开发的围棋程序 AlphaGo Zero,在没有事先输入人类棋谱的情况下,也是通过与自己对弈来学习的,这一点和很久以前 Samuel 的做法非常相似。当然,这些问题难得多,但无论有没有先验信息,它们最终都学会了极高水平的博弈能力。
![]()
类似的思路也出现在 DeepMind 的AlphaProof中。你可以看到,在那张流程图的后半部分,基本上就是 AlphaGo Zero 的思路,只不过它的奖励来自“证明是否成功”,而证明本身是一系列操作构成的序列。所以,这套思想已经渗透进了一些相当惊人的成果之中。
下面我想简单谈一下大脑。
![]()
多巴胺(dopamine)是一种神经调质(neuromodulator),由大脑中一些很小的区域产生,但会广泛分布到大脑的许多不同区域。多巴胺与我们感受到的愉悦和奖励有关;在经典观点里,人们常常认为,这些产生多巴胺的脑区输出的就是奖励信号。
而 Wolfram Schultz——现在在剑桥大学的一位神经科学家——做过一些关键实验。他在清醒、能够自主行为的猴子身上记录多巴胺神经元的活动,因为他想知道:这些神经元到底在做什么,它们的信号又是什么样子。
他发现,在最开始的时候,猴子会在这个实验装置里得到葡萄干之类的奖励;起初,当奖励真正送达时,会出现一个很大的反应,你们在第一条记录轨迹里就能看到。
但如果事先有一个预测信号(predictor),会发生什么呢?多巴胺神经元的反应会在时间上向前移动,并且不再出现在奖励真正到来的那个时刻。也就是说,它会回溯到那个预测信号上;如果还有更早的预测信号,它又会继续往更早的地方移动。如果你在原本应该给出奖励的时刻没有真正给奖励,就会出现一个负向下陷(depression);在最下面张柱状图里,这一点看得最清楚。你会看到,在原本奖励应该出现的位置,会出现一个明显下陷。
这件事当时让神经科学家非常困惑;但我们这些了解 TD 算法的人知道,TD 误差恰恰就会表现出这种现象。这里其实只是快速展示了一下:在 Wolfram Schultz 所做实验的类似情境中,这个 delta 项会如何变化。
这件事几乎有种不可思议的巧合意味,因为在 TD 算法被提出的时候,那些实验结果还根本没人知道。后来,这条线索催生出了如今所谓的“奖励预测误差假说”(reward-prediction-error hypothesis),由 Schultz、Peter Dayan 和 Montague 在 1997 年提出。
这个假说认为:中脑多巴胺神经元的相位性活动(phasic activity)所传递的,是对未来期望奖励的新旧估计之间的误差——换句话说,也就是 TD 误差。这个假说让神经科学家获得了很大启发;随后人们做了大量实验,发现它在很多类型的实验中都能得到支持——当然,也不是所有实验都如此。因此,这一假说和其他想法之间一直存在持续的辩论与互动。不过,TD 误差这一思路,确实让我们对多巴胺机制有了新的理解。
所以我认为,它确实改变了神经科学家理解奖励系统的方式。
好,现在还有很多其他话题我没法展开:比如无模型强化学习(model-free RL)——我刚才主要讲的其实就是这个;还有基于模型的强化学习(model-based RL),在那里面你会拥有一个环境模型。我们还可以谈规划、推理、问题求解、工作记忆。强化学习并不排斥把世界模型纳入整个系统的一部分。
现在人们也在研究更好的算法、更稳定的算法、策略梯度算法(policy-gradient algorithms)、多智能体强化学习(multi-agent RL)——这又回到了 Klopf 最初那个想法:神经元构成了一个强化学习智能体的社会。还有人研究所谓的分布强化学习(distributional RL):它不再只是预测期望奖励,而是尝试去学习一个完整的分布,而不仅仅是期望值。
此外,还有计算精神病学(computational psychiatry)方向,它会利用这些思想,帮助我们理清某些精神疾病中大脑究竟发生了什么。
最后再说一点,强化学习面临的一大挑战,就是奖励设计问题。在有些情况下,比如游戏里,定义赢或输很容易;但在其他类型的问题中,事情就没有那么简单。
控制论之父 Norbert Wiener 早在半个多世纪前,其实就提醒过人们这个问题。他当时讲的还不一定是强化学习,而更广义地是在谈优化(optimization)。当你指定了一个目标函数,你其实并不知道还会连带引入什么别的东西。
用他的话说:系统会给你“你所要求的东西”,但不一定给你“你本该要求的东西”,或者“你真正想要的东西”。
Nick Bostrom——那位写过一本关于人工智能问题、颇有影响力著作的人——把这种现象称作“反向实例化”(reverse instantiation)。Wiener 也举过一个典型例子:迈达斯之触(Midas touch)。他许愿自己碰到什么都能变成金子,结果碰到自己的女儿,女儿也变成了金子,诸如此类。
所以,这是一个经典问题。它并不是随着 RL 才出现的新问题。我认为它非常重要,尤其是在智能体化 AI(agentic AI)的语境下更是如此。如果智能体真的被释放出去,而它们又是强化学习智能体,那么你事先并不知道它们最终会想出什么办法来。因此,你需要护栏(guardrails),也需要大量实验,来确认它们做的事情真的是你希望它们做的。
好,我最后想说的是:强化学习与神经网络的计算研究,它们的历史从一开始就是紧密交织在一起的。两者最初都源于关于大脑如何运作、如何学习的假说,而且从诞生之初,它们的发展就是相互耦合的。
我刚才提到了 RL 和智能体化 AI,我认为这对于自我改进型智能体来说是一个关键议题。如今,深度强化学习的计算能力,再加上我们近年对大脑奖励系统的研究结果,正在指向下一轮突破可能出现的方向。
![]()
问答环节:强化学习是通向通用人工智能(AGI)的唯一道路吗?
演讲结束后,南洋理工大学校长讲座教授、人工智能交叉研究院院长安波教授,与巴托教授开展了学术对话。以下为内容翻译:
安波:谢谢你带来这场非常精彩的主题演讲,也谢谢你对强化学习历史中一些非常重要概念的回顾。我有几个问题想请教你,第一个问题是:强化学习是否就是通向 AGI 的那条路。我想像 Rich Sutton、David Silver 这样一些人会主张,RL 是走向 AGI 的唯一道路。但也有另一些人,比如 Yann LeCun,并不这么认为。我们很想听听你的看法。或者说,也许会有好几种不同的架构,都可能通向 AGI。
安德鲁·巴托:是的,这是个非常好的问题。
我认为,各种不同形式的学习都会参与到通用人工智能之中。RL 确实有一些其他方法不具备的能力,但其他方法也同样有 RL 不具备的能力。
比如说,RL 真的很难。它需要很长时间,需要大量试验。这些博弈系统会和自己对弈数百万次。所以我觉得,真正起作用的绝不只是纯粹的 RL。
我能理解 Sutton 他们为什么会认为“只要 RL 就够了”,但我个人倾向于不认为世界上只有这一种东西。它也许是一个必要组成部分——就像我在演讲开头引用的那位哲学家所说的,它是必要的——但我不认为仅靠它就足够了。这就是我对这个问题的看法。
安波:谢谢。下一个问题是:我记得我读博士那会儿,RL 方向的人在工业界找工作其实很难。那时候,SVM 之类的话题在工业界特别重要、也特别流行。但现在,RL 已经变得非常重要了,比如大语言模型里的 RLHF,如今在智能体方向人们也在做 agentic RL。
最近还有一些研究——我想是经验层面的——展示了 RL 的能力。那么,这是否意味着你在把模型的分布收缩到某些可达且高回报的轨迹上?有些人猜测,RL 本身并不能建立新的能力,它只是把已有能力激发出来。这对我们如何分配算力会有非常大的影响:是投给基座模型,还是投给 RL?因为如果这是真的,那么基座模型的 scaling 其实也就决定了 RL 的 scaling。所以我想知道你怎么看:RL 到底能不能真正建立新能力,还是说它仍然只是在从基座模型里激发出已有能力?
安德鲁·巴托:是的,这是个很有意思的问题。
在 RL 里,系统必须进行探索(explore),这意味着它必须去尝试那些并不是事先预设好的、也不是由既有行为直接推导出来的东西。从计算实现上看,常见做法是:系统会时不时做出一些原本发生概率非常非常低、甚至理论上概率为零的动作——这就是你的探索。它对于发现新东西来说是必不可少的。
所以,我认为“RL 只会激发现有能力”这个假设并不正确。事实上,我知道有些人甚至会进一步主张:发现新东西的唯一方式就是 RL。对此我自己也不完全同意,但这确实是一种相当常见的看法。
正如我前面提到的,探索与利用(exploit)是这些系统的核心:它们既要探索,也要利用,并且必须在两者之间找到某种平衡。实现这种平衡的方法有很多。我觉得我们人类自己也是这样。有时候我们在探索,不知道结果会是什么,也不知道会发生什么;有时候我们知道自己在做什么,于是就会利用这种确定性,去获取它所能带来的好处。
但我认为,“利用与探索”这对机制,本质上是随机系统的一种回报结构。所谓随机系统,就是结果本身带有不确定性的系统。所以,说 RL 只能激发现有行为,我觉得是不对的;它实际上可以发现新的行为。尤其是在讨论序贯决策问题时,这一点更明显:因为哪怕序列中的每一个单步动作,其后果都是相对已知的,整个序列组合起来,却仍然可能产生非常不一样、甚至全新的结果。这就是我对这个问题的看法。这个问题非常好。
安波:我想今天现场应该有很多博士生。你能不能给这些年轻人一些研究方向上的建议?也就是,从概念上看,哪些 RL 方向是值得他们从现在开始投入去做的?
安德鲁·巴托:可以。我觉得首先是多智能体强化学习(multi-agent RL)。已经有人在做了,但我认为它仍然研究得不够充分。当然,我们自己其实一直也没有真正做到这一步,因为它非常难,确实很难。可是,“神经系统是许多强化学习智能体相互作用的结果”这个想法——人们研究过,我们也研究过——但还有大量工作可以做。所以,多智能体 RL 是一个方向。
另外,我觉得在医疗领域也有一些很有意思的应用。比如针对慢性病,去设计时间跨度较长的治疗方案;这些决策过程,完全有可能通过 RL 得到改进。
所以如果要我选,我大概还是会坚持多智能体这个方向。就我自己的工作来说,如果你去看我们那本书,就会发现我们其实并没有太多篇幅谈多智能体。这是因为它真的很难,我们自己也没能在这方面做得特别深入。但别人已经做了一些。所以除此之外,当然还有神经科学——也就是 RL 与神经科学的交叉。我认为,用机器学习的一些概念,尤其是 RL 的概念,去观察神经系统,可以获得很多新的知识;而现在也确实已经有不少神经科学家在这样做。
所以,是的,大概就是这些。也许还有别的方向,但我现在一时想不起来了。
安波:感谢您这场很有启发性的演讲,也希望未来还能见到你。
CSDN 6 月宠粉福利
200 小时 GP U 算力免费领
瑞幸咖啡/肯德基早餐/下午茶等能量套餐任选其一
入群还可每月定期抽取旗舰显卡、AI PC 等极客神装
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.