网易首页 > 网易号 > 正文 申请入驻

决策理论、强化学习和大脑

0
分享至

决策理论、强化学习和大脑

Decision theory, reinforcement learning, and the brain

https://link.springer.com/article/10.3758/CABN.8.4.429



决策是动物和人类在他们仅部分理解的环境中行动和生存的核心能力,并为其努力获得奖励和惩罚。决策理论概念渗透于动物行为学、心理学和神经科学的实验和计算模型中。在此,我们回顾了一种众所周知且连贯的决策贝叶斯方法,展示了它如何统一马尔可夫决策问题、信号检测心理物理学、顺序采样和最优探索中的问题,并讨论了每个问题的范式性心理学和神经学实例。我们讨论了关于受试者对其任务的了解程度以及他们在寻求最优解时的进取心的计算问题;探讨了关于用于做出选择的基于模型和无模型方法的算法主题;并强调了决策的神经实现的关键方面。

动物预测其环境效价(affective nature,指奖惩或情感性质)并施加控制,以最大化奖励并最小化对稳态的威胁的能力,对其生存(longevity)至关重要。决策理论是一个形式化框架,它使我们能够描述并针对此类环境中的最优和近似最优行为提出定量问题(例如,Bellman, 1957; Berger, 1985; Berry & Fristedt, 1985; Bertsekas, 2007; Bertsekas & Tsitsiklis, 1996; Gittins, 1989; Glimcher, 2004; Gold & Shadlen, 2002, 2007; Green & Swets, 1966; Körding, 2007; Mangel & Clark, 1989; McNamara & Houston, 1980; Montague, 2006; Puterman, 2005; Sutton & Barto, 1998; Wald, 1947; Yuille & Bülthoff, 1996),因此,它是建模、理解和预测心理学数据及其神经基础的关键工具。

图1说明了三个已被用于探究这种能力的范式性任务。图1A展示了一个预测学习的案例(Seymour等,2004)。在这里,人类志愿者被连接到一个能提供可变强度电击的装置上。电击的施加之前会按顺序出现视觉线索(线索A到线索D)。线索A出现在50%的试验中;在80%的时间里,它后面跟着线索B,然后是更强的电击;或者在20%的时间里,后面跟着线索D,然后是较弱的电击。线索C的情况则相反。因此,受试者在得到线索A时,通常可以预期会受到强电击,但这种预期偶尔会被逆转。他们如何学会预测未来的电击?“马尔可夫决策问题”部分提供了这个问题的答案;正如该部分所述,这些功能被认为涉及纹状体和各种神经调节剂。这种预测可用于指导可能具有延迟后果的决策;形式上,这种情况可以被表征为动态规划(Bellman, 1957)和强化学习(Sutton & Barto, 1998)领域中所研究的马尔可夫决策问题(MDP)。


图1B描绘了一个与信号检测理论(Green & Swets, 1966)密切相关的决策任务,并且该任务特别有助于阐明神经活动与知觉之间的联系(Britten, Newsome, Shadlen, Celebrini, & Movshon, 1996; Britten, Shadlen, Newsome, & Movshon, 1992; Gold & Shadlen, 2001, 2002, 2007; Shadlen, Britten, Newsome, & Movshon, 1996; Shadlen & Newsome, 1996)。在该任务的经典版本中,猴子观看显示移动光点的屏幕。一部分光点向一个方向移动;其余的光点向随机方向移动。猴子必须通过做出适当的眼球运动来报告相干运动的方向。通过改变相干移动的光点比例(称为相干性),可以使任务变得更容易或更难。猴子的视觉系统会报告关于运动方向的证据;受试者应如何使用这些信息来做出决策?在该任务的某些版本中,猴子还可以选择何时发出其反应;它如何决定是做出反应还是继续收集信息?这些主题在“信号检测理论”和“时间状态不确定性”部分进行了探讨,同时也探讨了两个视觉皮层区域(MT区和外侧顶内沟区[LIP])的作用。较简单的版本可以被视为标准的信号检测理论任务;较复杂的版本已被Gold和Shadlen(2001, 2007)作为最优停止问题进行了分析。这反过来又是部分可观测马尔可夫决策过程(POMDP)的一种形式,与序贯概率比检验(SPRT;Ratcliff & Rouder, 1998; Shadlen, Hanks, Churchland, Kiani, & Yang, 2007; Smith & Ratcliff, 2004; Wald, 1947)相关。

最后,图1C以一种关于探索与利用之间权衡的实验形式,展示了进一步的决策理论复杂细节(Daw, O’Doherty, Dayan, Seymour, & Dolan, 2006)。在这里,人类受试者必须在四台单臂老虎机之间进行选择,这些老虎机的收益随时间而变化(由每台机器内部的曲线显示)。受试者只能通过选择某台机器来了解其当前价值,因此,必须在“选择当前被认为最好的机器”与“选择最近未被采样的机器(以防其价值已经增加)”之间取得平衡。这类问题在计算上出奇地难以处理(Berry & Fristedt, 1985; Gittins, 1989);本文关于“探索与利用”的部分讨论了这些问题和近似解,其中包括一个证据表明涉及额极皮层的近似解。

尽管这些任务之间存在明显的差异,但它们实际上共享一些深层的潜在共性。在本综述中,我们提供了一个简明直接的形式化框架来展示这些联系,给出了解决这些问题的方法的计算视角,并详细讨论了这些特定案例及其相近的案例。由此,心理学和神经生物学不同领域中出现的大量问题和解决方案被整合在一起,并确定了共同的解决机制。特别是,将这些问题视为涉及感觉推断和学习组件的共同任务的不同特化,为感觉系统和参与信号检测任务的计算机制(如MT区和LIP区)如何可能与参与强化学习任务的基底神经节和神经调节系统相互作用,提供了强烈的线索。

我们通过设计一个新的、稍微更抽象的任务(如图2所示)将这些问题联系在一起。然后,这种抽象的特定特化与图1相关的任务同构。图2的案例是一个表面上简单的迷宫般的选择任务,我们可能会将其呈现给动物或人类受试者,他们必须做出决策(在这里,是在动作L、R和C之间进行选择),以优化其结果(r)。最优选择涉及平衡当前和未来的奖励与成本,并处理关于任务规则及其内部状态的不同形式的不确定性。

从对图2的考量中浮现出的两个关键维度,涉及受试者知道什么以及他们试图完成什么。当受试者不知道任务规则但知道自己在其中的状态或情况时,就会出现图1A所示的预测任务。相反,图1B所示的心理物理辨别任务起源于受试者知道任务规则,但对状态只有不完全确定性的情况。图1C所示的探索/利用权衡可以被视为将这两者结合起来的情况,在这种情况下,受试者渴望在面对任何不确定性时都能表现出最优行为。关键在于,通过图2所示任务的媒介,所有这些问题都可以被表征为需要共同的计算。实现这些计算会导致与“过去和当前试验的信息可以累积的不同方式”相关的算法问题,进而导致与解决方案所涉及的神经结构相关的实现问题。


基础问题


计算问题

如前所述,有两个主要维度定义了受试者所面临的问题:一个维度与他们被假定对任务知道什么有关,另一个维度则定义了他们的进取心(ambition,即追求最优解的抱负水平)的性质。


如果受试者甚至可能不完全知道任务的规则,那么平衡此类成本和收益的问题就会变得困难得多。在动物实验开始时必然是这种情况,并且当(正如实验中常见的那样)规则随时间改变时,这种情况也会更持久地存在。在这些情况下,受试者将不得不从经验中学习规则。然而,经验通常只能部分地确定规则,留下一些未知和不确定性,因此通常重要的是要适当地考虑这一点。


更有进取心的受试者可能会寻求将探索(exploration)和利用结合起来。也就是说,鉴于不仅当前的选择可能导致本次试验的良好结果,而且它还可以提供信息,使受试者在未来获得更好结果方面更加熟练这一事实,他们可能试图正确地做出每一个单一选择。这个目标——进行选择以便在学习过程中的多次试验里获得的综合奖励最大化,权衡利用的即时收益和探索的延迟收益——有时被称为终身最优(lifetime optimality)。同样,如何平衡这些取决于时间折扣。

请注意,这两个计算维度并非完全独立;例如,在给定对规则和状态的完全知识的情况下,探索就失去了实际意义(moot)。

算法问题

沿着组合计算维度的不同点会导致各种各样不同的问题。其中一些问题在形式上是可处理的(tractable)——也就是说,存在只需要适度的内存空间或时间就能计算出最优解的算法。其他点,特别是那些涉及不完全知识或终身最优(lifetime optimality)的点,则更具挑战性,并且通常需要近似处理,即使对于非神经生物学系统也是如此。

算法在如何利用经验来估计与决策相关的量,以及如何将这些量转化为选择方面存在差异。最重要的算法维度是区分基于模型(model-based)和无模型(model-free)的方法(Sutton & Barto, 1998)。粗略地说,基于模型的方法显式地利用任务的实际规则或习得的规则来做出选择。重要的是,即使规则完全已知,从这些更基本的量中推导出特定状态下的最优决策也需要一定的计算。


实现问题

长期以来人们一直认为,无模型强化学习算法与大脑之间存在相当直接的映射关系,其中神经调质多巴胺作为教学信号,通过控制目标(如腹侧和背外侧纹状体)的突触可塑性来训练价值或策略(Barto, 1995; Daw, Niv, & Dayan, 2005; Friston, Tononi, Reeke, Sporns, & Edelman, 1994; Joel, Niv, & Ruppin, 2002; Montague, Dayan, & Sejnowski, 1996; Schultz, Dayan, & Montague, 1997; Suri & Schultz, 1998; Wickens, 1990)。对于像图1A所示的电击这样的厌恶结果,关于其整体神经基质的证据要少得多。最近,有人提出大脑也在规则不确定的情况下采用基于模型的方法进行规划,这涉及另一组回路,包括前额叶皮层和背内侧纹状体(Balleine, Delgado, & Hikosaka, 2007; Daw et al., 2005; Dickinson & Balleine, 2002; Everitt & Robbins, 2005)。

这项工作的大部分集中在规则、价值或策略学习上,忽略了状态不确定性的问题;事实上,可以说,在真实世界环境中采用基于模型或无模型方法的主要障碍,是这些理论所依赖的高度受限且精细的状态抽象,与生物体实际面临的丰富、多样且模糊的感觉世界之间的鸿沟。

相反,从嘈杂的感觉输入进行状态估计的基于模型的方法,已经在另一组相当不同的心理物理任务中得到了广泛研究(Britten et al., 1996; Britten et al., 1992; Gold & Shadlen, 2007; Parker & Newsome, 1998; Platt & Glimcher, 1999),以图1B为例,重点关注感觉区域编码的输入信息映射到皮层更多运动相关区域编码的决策理论量。然而,这项工作通常局限于相当初级和有限的学习形式。

本文剩余部分的目的是将学习和状态估计机制置于单一框架中。

我们将使用图1中所示的例子,以图2所示的抽象形式呈现,来说明上述确立的关键一般原则。这些例子涵盖了神经强化学习(Montague et al., 1996; Schultz et al., 1997)、贝叶斯心理物理学(Britten et al., 1992; Shadlen & Newsome, 1996)、信息收集和最优停止(Gold & Shadlen, 2001, 2007),以及探索/利用权衡(Daw, O’Doherty, et al., 2006)。第一个例子发展了状态已知任务的基本强化学习方法;其余例子说明了如何通过信念状态作为不确定真实状态的形式替代来扩展这些方法。

在每一节中,我们将首先描述形式计算概念和想法,然后是与计算相关的算法方法,最后是涉及的心理和神经生物学任务及机制。

马尔可夫决策问题

图1A所示预测任务中的核心问题是,直到受试者在试验开始时观察到线索A或C,他或她才知道在试验结束时是否会受到电击;线索使结果更具可预测性。在马尔可夫问题中——即只有当前状态重要,而先前历史不重要的领域——结果存在一种计算上精确的方法来定义预测未来强化物的目标。当有动作选择可用时,该目标也提供了最优选择的形式化。还有各种算法方法用于获取预测并将预测用于控制。

计算问题









虽然我们只展示了最简单的动态规划问题背后的计算,但解决更现实的情况(尽管如此仍保留我们任务的结构)是一个直接的扩展(参见,例如,Bertsekas, 2007; Sutton & Barto, 1998)。核心要求是状态和规则是已知的,奖励随时间是可加的(尽管未来奖励可以像利率那样被指数折扣),并且问题是马尔可夫的,所以未来的转移和奖励只取决于当前状态,而不取决于受试者达到当前状态所采取的路径。状态满足这一马尔可夫性质的约束对上述所有分析至关重要,并且随之而来的是,将这种抽象形式化与线索不决定状态的更现实情况联系起来的主要障碍。这个问题是文章剩余例子的核心。


算法方法







心理学与神经科学

在心理学和神经科学中,有大量关于可被视为马尔可夫决策问题的任务的研究,利用问题一直是一个关键焦点。重要的是,该理论将预测总和强化视为决策制定的一个关键子问题,因此许多工作都涉及在没有决策的任务中预测强化。

也许这些想法与神经数据之间发展得最好的联系是通过无模型强化学习的预测误差,如方程7所示。这些(理论)版本长期以来在行为条件反射理论中发挥了重要作用——最著名的是Rescorla和Wagner(1972)的理论。最近,这种误差信号的神经相关性已在许多任务和物种中被检测到。


例如,图4B显示了受试者看到线索C随后是线索B的试验中右侧壳核的平均BOLD信号。在这种情况下,第一个线索表明大电击不太可能,但后来的线索表明它是确定的。第二个线索引起的预期变化导致了预测误差,反映在BOLD活动的增加上。相反,线索A之后的线索D表明以前认为可能发生的大电击不会发生;这是一个负预测误差(BOLD相对减少;见图4C)。图4D说明了我们可以如何将相同的逻辑进一步向后扩展一步,就像在MDP的动态规划分析中一样。在这里,由于线索A表明线索B(以及随之而来大电击)是可能的,当它出现时,它也会诱发正预测误差,标志着试验间相对安全时期的结束。


Seymour等人(2004)的研究是在厌恶领域。对于趋利结果(appetitive outcomes),有充分的证据表明猴子腹侧被盖区和黑质致密部多巴胺细胞的相位活动(例如,Schultz, 2002),以及大鼠纹状体靶点处多巴胺的释放(Day, Roitman, Wightman, & Carelli, 2007)报告了类似于方程7中时间差分预测误差的量。这是在大量关于多巴胺及其纹状体投射参与趋利学习和趋利动机选择行为的结果之上的(关于一些最近的亮点,参见Costa, 2007; Hyman, Malenka, & Nestler, 2006; Joel et al., 2002; Wickens, Horvitz, Costa, & Killcross, 2007)。提出这种机制根据强化学习规则运作的观点(Balleine et al., 2007; Barto, 1995; Daw & Doya, 2006; Haruno et al., 2004; Joel et al., 2002; Montague et al., 1996; O'Doherty, Dayan, Friston, Critchley, & Dolan, 2003; O'Doherty et al., 2004; Schultz et al., 1997; Suri & Schultz, 1998),以至少同样广泛的工具选择心理学数据与这些神经数据联系起来的方式,获得了广泛但并非普遍的支持(例如,Berridge, 2007; Redgrave, Gurney, & Reynolds, 2008)。

然而,行为上复杂的实验(在Balleine et al., 2007; Dickinson & Balleine, 2002中综述)表明,这远非故事的全部。这些实验研究了在允许动物利用其学习之前改变奖励的合意性(desirability)的影响。基于模型的控制方法可以利用其对规则的显式表征,根据此类变化立即修改其选择,而无模型方法的价值仅通过预测误差(如方程7)改变,需要进一步的经验才能做到这一点(Daw et al., 2005)。有证据支持这两种控制,基于模型的选择(称为目标导向动作)在经验有限、某些类型的复杂任务以及接近最终结果的动作中占主导地位。无模型的选择(称为习惯)在更广泛的经验之后、在简单任务中以及对于远离结果的动作中是明显的。此外,通过对大鼠内侧前额叶皮层部分的选择性损伤,可以差异化地抑制这两种形式的控制(Killcross & Coutureau, 2003)。Daw等人(2005)认为,目标导向动作和习惯之间的权衡在计算上基于有限采样经验下基于模型和无模型控制的不同不确定性。

尽管更为全面,但这种综合的适用范围仍然极其有限。正如上文所暗示的,与本综述最相关的问题是,如何仅仅从一片喧嚣、令人困惑且难以分割的线索混乱中,在内部创建或推断出一个状态空间。也就是说,如何从环境经验中自动提取出相当于的要素,即控制转移和奖励的潜在支配因素。这个问题的最简单版本,与感觉神经科学和心理物理学中研究得更为深入的主题相关,我们现在将转向这些主题。

信号检测理论

图1B所示的任务,在受试者无法影响光点显示时间长度的版本中,是一个感觉辨别任务。在这里,必须使用视觉系统中运动处理区域提供的嘈杂且因此不可靠的证据,来做出尽可能好的决策以最大化奖励。它映射到规则已知的基本任务上,但与状态相关的输入仅对状态提供部分信息(因为噪声的影响)。

该任务的变体——特别是那些涉及在输入处理面临噪声时检测非常微弱的感觉信号的变体——是研究最密集的定量心理物理任务之一;正是由于这个原因,它们被用来阐明决策制定的神经基础。

计算问题








这些价值表达式仅通过信念状态成为线索 的函数,在这个意义上,信念状态在计算它们时充当线索的充分统计量。另一种说法是,信念状态满足我们强化学习分析所依赖的马尔可夫独立性属性:给定它,未来奖励预期独立于过去(在这里,是线索)。通过确定每个动作的价值预期,信念状态扮演了上一节中状态的角色,而该状态在这里是不可观测的。

那么,给定这些价值,如方程 2A 和 2B 中那样,我们可以选择一个最优策略,



算法方法




心理学与神经科学




图 7B 中的空心圆圈显示了这部分研究的显著结论。这些报告了上述贝叶斯决策理论分析的结果,应用于图 7C 中所示神经元的神经活动数据。这条所谓的神经度量曲线显示了这样一个概率:一个知道单个细胞放电率分布并做出最优决策的理想观察者会得到正确答案。这个单个细胞就已经能够支持与整个猴子所做的质量相同的决策。当然,猴子的问题是挑选出这种水平的细胞(特别是那些在给定运动方向的情况下活动尽可能独立的细胞集合;Shadlen et al., 1996),在试验持续时间内整合它们的活动,并限制噪声影响其实际决策的能力。做这些事情的难度应该减轻我们的惊讶,即猴子的整体表现并不比单个、有些随机记录的神经元好多少。

时间状态不确定性

上一节的两个例子可以结合起来,以展示如何将信念状态估计和强化学习结合起来,在 POMDP 中找到最优的利用性决策。这由图 1B 中所示任务的另一个版本举例说明,其中猴子不仅必须选择运动方向,还必须选择何时有足够的信心做出这一选择。在这里,它们必须权衡尽早做出决策的好处——即避免等待的成本——与做出错误决策并完全得不到奖励的变化。

计算问题










结合上述方程,被试应该选择 C,如果



算法问题


由于这类信念状态是通过使用模型进行推断来计算的,无模型方法无法创建它们,因此通常必须使用基于历史的表示法。然而,信念状态的马尔可夫充分性立即暗示了一种有吸引力的无模型和基于模型方法的混合,即模型可能仅用于推断当前信念状态,然后无模型方法用于基于它学习价值或策略(Chrisman, 1992; Daw, Courville, & Touretzky, 2006)。这种观点将状态表示问题与策略学习问题分开:使用模型进行状态推断解决了直接线索 c c的不足。这样做之后,使用计算简单的无模型方法(而不是费力的基于模型的动态规划)来获得价值或策略可能仍然是有利的。

当使用信念状态时,使用方程 19 更新它们也会出现算法问题。值得注意的是,用其对数来表示信念状态可能更简单,在这种情况下,用于整合每个新观测的乘法就变成了加法。在对这类推理的神经基础进行建模时,在对数域中操作概率的想法无处不在(Ma, Beck, Latham, & Pouget, 2006; Rao, 2004),包括接下来讨论的那个。然而,重要的是要注意,一般来说,信念更新不仅涉及如上所述的乘法,还涉及加法,这意味着该表达式不再通过对数简化。例如,如果可以从,方程 19 将对两种可能性求和:


因此,纯加法累积仅限于一类具有约束转移矩阵和独立观测的问题。此外,只有在二选一的情况下,归一化通常才可以通过追踪状态概率的比率、或对数比率来消除,如方程 11 中那样。

最后,在讨论部分可观测情况时,我们到目前为止一直假设模型是已知的。当然,一般来说,模型也可能从经验中学习。在可观测 MDP 中,这仅需要计数状态转移(方程 6B);然而,当状态不是直接可观测时,它们的转移显然无法被计数。一类在隐藏状态面前学习模型的算法涉及所谓的期望最大化方法(Dempster, Laird, & Rubin, 1977)。该算法对模型进行初始猜测并改进它,使用两个步骤。在第一步,即期望阶段,假设模型是正确的,并使用我们已经讨论过的推断算法来推断哪条(隐藏)状态轨迹应对观测到的线索负责。在第二步,即最大化阶段,这些关于隐藏轨迹的信念被视为正确的,然后使用类似于方程 6A 和 6B 的计数过程来推断解释它们的最佳模型。这些阶段反复交替,并且可以证明每次迭代都会改进模型,在使观测数据在其下更可能的意义上(Neal & Hinton, 1998)。实际上,这些模型学习方法需要大量数据,难以扩展到从持续的经验序列中进行实际的在线学习,并且容易陷入占据爬山更新局部最大值的次优模型。

心理学与神经科学:漂移扩散决策

在图 1B 和图 7 中描述的原始研究中,这些研究将 MT 神经元的活动与选择行为联系起来,猴子在做出运动方向的选择之前,观察随机点运动显示一段固定时间 2 秒。任务的另一个版本,即被试可以自由选择何时做出决策,一直是这里的主题。它是决策理论中最重要的进展之一的版本——即 SPRT(Gold & Shadlen, 2001, 2007; Ratcliff & Rouder, 1998; Shadlen et al., 2007; Smith & Ratcliff, 2004; Wald, 1947),这是心理学和神经科学中一个非常活跃的研究领域。






因此,实施诸如 SPRT 或与基本任务相关的其他检验,将需要对与观测相关的信念状态进行积分,外加一个看起来像信念状态上的阈值的决策规则。

图 10 显示了一个实验的示意性结果(在面板 A 中显示为卡通图),其中动物可以自由选择决策时间,通过从注视点向两个目标之一做出扫视来报告它们的决策(Gold & Shadlen, 2001, 2007; Roitman & Shadlen, 2002)。图 10B 和 10C 中的主要曲线显示了外侧顶内区(LIP)神经元的平均活动,该区域可能报告假定的积分器的输出。该区域的神经元具有眼动反应场(图 10A 中的灰色斑块);也就是说,当被试计划向本实验中采用的此类空间中的目标做出扫视时,它们会选择性地放电。图 10B 和 10C 中的曲线显示了这些神经元在试验过程中各种条件下的平均放电率。


首先考虑图 10B 的底部插图,取自 Britten 等人(1992)的数据,它显示了 MT 神经元在试验过程中对随机点运动的反应(尽管是在固定时长任务中),锁定在运动开始时刻,针对不同连贯性(颜色)和两个相反方向(实线或虚线)的试验。这实际上是查看图 7 中数据的另一种方式,并表明在开始时的瞬态反应之后,它们的放电率相当恒定。


SPRT 对信息随时间从外部来源累积的情况进行建模。然而,它和相关模型已被大量非常重要的研究(例如,Ratcliff & McKoon, 2008; Smith & Ratcliff, 2004)用于描述搜索任务等情况下的反应时间,在这些任务中,外部信息是恒定的,但与该信息相关的内部处理可能随时间展开。也有许多有影响力的连接主义(Usher & McClelland, 2001)和神经(Lo & Wang, 2006; Wang, 2002, 2006)模型,以及关于它们相互关系的数学理论(Bogacz, Brown, Moehlis, Holmes, & Cohen, 2006)。

关于 LIP 在比这更复杂的任务中相关的编码和决策的性质,存在活跃的理论和实验争论,这些任务涉及逐次试验变化的连贯性或不同选项的不同奖励或先验以及非恒定阈值(例如,Glimcher, 2004; Platt & Glimcher, 1999; Yu, 2007)。随机点运动的一个问题是,尚不清楚刺激的每个片段应该对每个运动方向产生什么似然贡献;也就是说,来自我们理想化的线索 c τ 是 MT 内部的,因此实验控制得不好。对 LIP 报告具有更离散控制线索的积分过程的检验显示了有希望但部分的结果(Yang & Shadlen, 2007),求和的对数似然比的极端值未能被完全正确地表示。

SPRT 是对决策理论的奠基性贡献,事实上,有一个子领域研究的是与我们在此提出的方法相当不同的分析方法来解决它(基本结果在 Shadlen et al., 2007 中有很好的综述)。然而,SPRT 是脆弱的,因为对任务的大多数更改都会破坏其保证。事实上,即使超过两个选项的情况也出乎意料地复杂。这就是为什么在这里,我们以面对不确定性时更一般的决策模型来构建这个问题,该模型对这项特定任务给出了类似的描述,但很容易容纳一系列详尽阐述。然而,正如已经提到的,解决方案可能极难计算甚至近似。

将随机点任务视为部分可观测的强化学习问题,也广泛地暗示了大脑可能如何解决其策略学习问题(Ahmadi & Latham, 个人交流; Gold & Shadlen, 2002):通过在信念状态表示(如这里对 LIP 的描述)上使用通用的强化学习技术——例如马尔可夫决策问题部分中描述的那些,并推测由中脑多巴胺等系统实现。在其他工作中,多巴胺系统可能通过采用信念状态表示来学习的想法也被用来解释它如何应对由线索不可预测的时间引起的部分可观测性,并解释在这种情况下多巴胺能反应的一些特征(Daw, Courville, et al., 2006)。

探索与利用

到目前为止,我们已经考虑了利用:给定到该回合时关于规则的已知信息,最大化预期单回合回报的选择。正如我们已经提到的,一个更有雄心的被试可能希望最大化终生效用,在一整系列回合中尽可能多地赚取奖励。这正是图 1C 中所示任务的目标。

这样做需要在利用与探索之间进行平衡:采取那些可能不会立即带来预期回报,但通过增进对规则的了解,可能会改善后续试验中赚取奖励前景的选择。这是一个困难的平衡,但其优雅的决策理论解决方案直接源于我们已经展开的分析。特别是,对规则的无知可以完全按照我们处理状态无知的方式来处理:通过基于信念进行规划,而不是直接基于观测进行规划。反过来,探索的价值可以像我们之前评估诸如 C 之类的信息收集(探测)动作那样被量化。

计算问题








图 11C 通过绘制选择 L 的价值如何随着其回报概率不确定性的增加而单调增加,直接说明了探索的价值如何源于不确定性,同时将它会得到回报的总体预期机会固定在 50%。在这里,智能体在开始游戏前被给予关于 L 的额外观测,其中获胜和失败的数量相等;不确定性通过减少这些数量来增加。

简而言之,探索是有价值的,因为它有可能改善未来回合的选择,从长远来看赚取更多奖励。这与上一节例子中探测以减少状态不确定性是值得的原因完全相同。原则上,同样的分析直接扩展到未知多步决策过程中的探索,如上一节所考虑的那些,在这种情况下,信念状态包括关于转移概率以及奖励的信念。在这种情况下,会出现一种不同形式的探测,即可以采取动作到达状态空间中探索不足的区域,以便了解它们。在实践中,即使是最小的此类问题的精确解也是难以处理的,因为信念状态的连续性质或高维度。

算法问题

到目前为止,我们将探索背后的计算问题描述为与雄心有关——也就是说,优化跨回合累积的奖励,而不是在每个回合内短视地利用。在这方面,该问题可以被视为与时间折扣问题有关:一个没有雄心的被试就像一个不耐烦的人,会急剧地折扣未来奖励。然而,在实践中,即使对于最低限度有耐心的被试,对探索行为的限制性约束也更可能是决策理论最优探索的极端复杂性。不同的探索行为可能源于对决策问题的不同算法方法,而不是折扣偏好或目标的差异。例如,忽略关于规则的不确定性是马尔可夫决策问题部分中讨论的许多标准强化学习算法能够工作的原因;但这同样可以被视为一种简化假设,它排除了最优探索,而不是一种短视的目标。

事实上,即使探索的决策理论分析在形式上与部分可观测性的分析等价——确实,在实际求解最优策略时导致类似的实践问题——研究人员已经开发了许多专门的方法来解决探索问题。

首先,Gittins(1989)展示了如何通过为每个动作在一个更小的(尽管仍然不平凡)子问题中单独计算一个指数(类似于 Q 值)来简化一部分探索问题。该方法利用了由问题结构产生的动作之间的一种独立性。它适用于上述类型的多臂老虎机问题,尽管仅当试验次数 N N要么是无限的(并且未来奖励以指数方式折扣)要么是未知的且具有恒定风险函数时——也就是说,每试验终止的概率恒定。

然而,大多数问题,包括多步决策问题中的探索,不能以这种方式简化。因此,在强化学习中,启发式方法是常见的,或多或少地从上述最优分析中获得定性灵感。一些方法根据动作的预期利用价值加上旨在捕捉探索额外价值的不确定性奖金来评估动作(Dayan & Sejnowski, 1996; Dearden, Friedman, & Russell, 1998; Kaelbling, 1993; Sutton, 1990)。作者们对如何估计不确定性(在这种语境下本身就不简单)以及奖金本身的确切形式存在分歧。一个特别简单的变体是新颖性奖金(例如,Ng, Harada, & Russell, 1999),它通过将未探索选项的价值估计“乐观地”初始化为高值来近似未探索选项的不确定性奖金,鼓励对它们的探索,直到发现它们的真实价值。

一个更原始的替代方案,在上述分析中基础较差,是通过在选择过程中引入某种随机性来更盲目地鼓励探索。

所有这些近似方法的一个方面是,它们通常需要仔细调整诸如随机性程度或不确定性奖金丰厚程度等因素,以便表现良好。尽管寻找最优探索策略通常不被视为一个学习问题(毕竟,目标是终身最优性),但某种学习牵涉其中,用于调整近似方法的参数以提高其性能。

心理学与神经科学

在动物行为学领域之外(例如,Mangel & Clark, 1989; McNamara & Houston, 1980; Pyke, 1984),以一些关于鸟类探索的早期工作(Krebs, Kacelnik, & Taylor, 1978)为例,关于动物或人类如何探索的直接证据相对较少。然而,有许多模型。在这方面,Kakade 和 Dayan(2002)注意到多巴胺神经元对新颖但情感中性的刺激做出爆发-暂停反应;他们提出,如果这些神经元报告的是因新颖性或不确定性奖金而被上调价值的刺激对奖励预测误差的影响,那么这种模式就可以得到解释。

随后,在图 1C 所示的任务中,Daw, O'Doherty, et al. (2006) 试图在一项 fMRI 研究中更直接地检验类似的想法,该研究中人类在一个类似于上面分析的双臂老虎机的四臂老虎机任务中为钱做选择。被试有额外的不确定性和探索压力,因为老虎机的价值不断变化。作者试图通过用包含不确定性奖金的强化学习模型拟合被试的逐次试验行为,来量化这种不确定性对探索性选择的影响,但发现没有这种影响。相反,被试的探索最好由随机探索模型来解释,即所谓的softmax,对于两个选择,它涉及方程 8 的一个变体,其中


其中 β > 0 调节竞争的强度——也就是说,动作预期价值的微小差异在多大程度上转化为其选择概率的巨大差异。因此,这个参数是权衡探索和利用的另一种更原始的方式。

神经数据支持了类似的结论。诸如 Kakade 和 Dayan(2002)的奖金模型(或者实际上,最优决策理论分析)以单一的未来预期奖励货币来量化探索和利用的价值。因此,它们预测探索价值应该像利用一样被报告——例如,通过多巴胺能尖峰。与这一预期相反,Daw, O'Doherty, et al. (2006) 发现,尽管多巴胺能传出区域如纹状体被金钱的预测和预测误差激活,但它们没有表现出可能反映探索中涉及奖金价值的额外激活。相反,当被试探索而不是利用时,独立的区域——额极,以及顶内皮层的一个区域——优先被激活(图 12)。在这里,探索被操作性地定义为选择了一个不同于被试被估计预期奖励最高的选项。

结合行为结果和其他影像学发现(这些发现表明前额叶前部区域参与处理不确定性(例如,Yoshida & Ishii, 2006),以及顶内皮层参与信念状态(如上所述)),这种神经分离表明,在这个任务中,探索不是由以共同货币报告的奖金与利用价值一起鼓励的,而是以某种方式利用了不同的神经过程。

与额极相关的那种高级调节确实有可能覆盖强大的利用驱动力;然而,我们应该强调,从这些数据中并不清楚这些区域(如果有的话)对探索有什么因果贡献。也不清楚如何将这些发现与多巴胺能神经元被新颖性激活的观察相协调(尽管当然,BOLD 激活远非多巴胺能活动的直接测量)。Kakade 和 Dayan(2002)模型以及一项后续影像研究(Wittmann, Daw, Seymour, & Dolan, 2008)提出的一种可能性是,大脑通过分配新颖性奖金而不是不确定性奖金来近似探索的价值。新颖性奖金特别容易计算——它们只需要乐观初始化——但它们只是不确定性的不完美代理。例如,这种奖金很可能不会被图 1C 和图 12 所示的任务所采用,因为那里的探索是由熟悉老虎机中变化的奖励概率所强制要求的,而不是由显式的新颖性。

最后,如果生物体确实使用某种随机探索,而不是朝向不确定性引导的探索,那么随机性程度的动态调节就变得特别关键。尽管没有关于这可能如何进行的直接证据,但理论推测集中在神经调质去甲肾上腺素作为这种控制的潜在基质上(Cohen, McClure, & Yu, 2007; Doya, 2002; McClure, Gilzenrat, & Cohen, 2006)。

结论

我们回顾了决策理论中的一些基本结果,因为它们与选择心理学和神经科学中的数据有关。我们考虑了围绕被试对其所面临任务规则以及其在任务中即时状态的无知程度的中心计算问题,也考虑了他们关于是否试图联合优化探索和利用的雄心高度。我们还考虑了许多不同的算法维度——最重要的是,区分基于模型的算法——它们直接、计算昂贵地利用(可能是估计的)任务规则来计算出最优动作——以及基于价值或策略的无模型算法,它们消除了这些复杂性,代价是在将来自世界的信息转化为良好动作方面统计效率较低。我们用许多典型的特殊情况说明了这些问题,在这些情况中我们还可以报告相关的心理和/或神经数据。

这篇综述的一个主要焦点是通过贝叶斯决策理论的媒介,突出了一大类问题之间的共性。即使某些特定问题,如 SPRT,允许特别简单的解(可以用特殊方法分析;Shadlen et al., 2007),显然直接的扩展也会把我们带回一般情况。更广泛的解决方案涉及将观测转化为关于被试在环境中状态的信念,并处理涉及多步优化的序列决策问题。我们将在最后考虑当前正在研究的一些问题类别。

从计算的角度来看,未来研究最有趣和最紧迫的方向涉及相关状态空间的构建。我们在领域概率模型的语境中强调了信念状态的概念。这提供了一个关键、清晰的基础;然而,它也带来了一对具有挑战性的问题:一个是从经验中确定此类模型的统计问题,另一个是在面对我们经常提到的潜在难处理性时进行推断的计算问题。即使近似推断也极其困难。定义并寻找最小模型是一个明显的方向;事实上,当前有很多兴趣在于利用生态相关领域的结构特性,例如各种形式的层次结构,以在这些问题上取得进展。无监督学习中也有大量工作,是思想的丰富来源。

第二个关键的计算和算法主题是一般情况下的近似。有一些明显的途径可以创建近似最优策略——例如,限制价值函数表示中基函数的数量,非常粗糙地离散化信念状态,或限制用于创建有效状态空间的过去观测历史的长度。然而,关于这些近似对控制质量的影响,几乎没有广泛的结果。

从神经和心理学的角度来看,有许多未解决的问题。一个正在积极辩论的问题涉及不确定信息(如信念状态)可能如何在神经元群体的活动中表示,并支持贝叶斯决策理论的基本计算,例如信念更新(方程 26)和预期价值的计算(方程 22)(Beck, Ma, Latham, & Pouget, 2007; Beck & Pouget, 2007; Deneve, 2008; Jazayeri & Movshon, 2006; Ma et al., 2006; Rao, 2004; Sahani & Dayan, 2003; Zemel, Dayan, & Pouget, 1998)。相反,目前尚不清楚被试在丰富领域(例如,具有多峰后验分布)中能在多大程度上执行这些操作,更不用说接近探索和利用之间的最优平衡了。

第二个重要点涉及决策中涉及的不同类机制和系统的存在与相互作用。我们提到过大鼠研究,表明基于模型的机制和目标导向控制(涉及内侧前额叶皮层和背内侧纹状体)与无模型机制和习惯控制(涉及背外侧纹状体和多巴胺能神经调质)共存,并且确实竞争控制选择(Balleine et al., 2007; Daw et al., 2005; Dickinson & Balleine, 2002; Killcross & Coutureau, 2003)。就利用而言,这两种机制代表了一个光谱的两端,权衡了学习的统计效率(倾向于基于模型的控制而非无模型控制,后者通过自举学习)和使用的计算效率(倾向于无模型方法,它们不必在线解决动态规划问题)。其他结构也可能参与——例如,海马体基于情景记忆对控制做出贡献(Lengyel & Dayan, 2008)。探索中离散区域的存在(Daw, O'Doherty, et al., 2006)从贝叶斯决策理论的角度来看不太预期,在贝叶斯决策理论中,图 9 中显而易见的探索收益是与利用收益一起计算的。

总而言之,决策理论是少数几个在以下方面存在紧密且富有成效的耦合的领域之一:(1) 来自统计学、运筹学、人工智能、经济学和工程的规范性理论,(2) 动物行为学和心理学范式中的行为结果,以及 (3) 电生理学、药理学甚至解剖学的神经数据。在一系列令人惊讶的案例中,前者的算法思想在后者的心理学和神经学中找到了相对直接的实例化,尽管这显然不一定如此,特别是当计算和算法变得更加复杂时。50 年决策分析研究的成果正以基于生物的模型的形式被积极采摘。确实,动物和人类在充满来自状态和规则不确定性的极端计算挑战的环境中做出的高质量选择,正准备为适当近似的理论提供全新的动力。

原文链接:https://link.springer.com/article/10.3758/CABN.8.4.429

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
老挝进行高层领导调整

老挝进行高层领导调整

新华社
2026-10-05 12:58:02
丁宁36岁不嫁豪门,曾因男方炫耀冠军分手,母亲不催婚态度太意外

丁宁36岁不嫁豪门,曾因男方炫耀冠军分手,母亲不催婚态度太意外

懵面女汉
2026-10-03 14:10:23
国庆第一批血亏的生意出现!卷到50元还没人住,年轻人不想当韭菜

国庆第一批血亏的生意出现!卷到50元还没人住,年轻人不想当韭菜

体育小柚
2026-10-03 12:36:20
西部鱼腩崛起!双塔轰28+6胜掘金,新科榜眼5中1,约基奇3+7划水

西部鱼腩崛起!双塔轰28+6胜掘金,新科榜眼5中1,约基奇3+7划水

你的篮球频道
2026-10-05 09:32:18
霍尔木兹要变天?阿联酋豪掷300亿美元:要把伊朗的王牌变成摆设

霍尔木兹要变天?阿联酋豪掷300亿美元:要把伊朗的王牌变成摆设

同一片海空里
2026-10-04 19:14:49
4年2.9亿,提前续约,NBA历史第一人!……

4年2.9亿,提前续约,NBA历史第一人!……

体育新角度
2026-10-04 21:06:53
印度最害怕的三个国家,现在联合起来对印度下手了

印度最害怕的三个国家,现在联合起来对印度下手了

农夫史记
2026-10-04 19:37:42
民调观察!德国最新民调出炉,近半数民众认可默克尔应对危机能力

民调观察!德国最新民调出炉,近半数民众认可默克尔应对危机能力

琴音缭绕回
2026-10-05 18:32:02
红军长征为什么留一批领导死守苏区?看到名单才明白:被留下的班底,多半是毛主席早年在苏区一手带出来的人

红军长征为什么留一批领导死守苏区?看到名单才明白:被留下的班底,多半是毛主席早年在苏区一手带出来的人

磊子讲史
2026-10-05 11:07:30
阿拉法特的错误,造就了巴勒斯坦的苦难,中国数十年前曾劝告未果

阿拉法特的错误,造就了巴勒斯坦的苦难,中国数十年前曾劝告未果

星河逍遥游
2025-03-23 15:59:52
刘銮雄妻子甘比现身上海科技展,一身造型引热议

刘銮雄妻子甘比现身上海科技展,一身造型引热议

娱你同欢
2026-10-04 20:18:51
中国为啥不想再办奥运会了?说白了,就是国际奥委会那帮人太双标

中国为啥不想再办奥运会了?说白了,就是国际奥委会那帮人太双标

荆楚寰宇文枢
2026-10-03 20:22:57
以媒称初步调查显示迪拜航空袭击者系单独作案

以媒称初步调查显示迪拜航空袭击者系单独作案

环球网资讯
2026-10-04 23:19:14
被砍伤机长再接内塔尼亚胡电话:“我被砍到视线模糊,要开门又被副驾关上”

被砍伤机长再接内塔尼亚胡电话:“我被砍到视线模糊,要开门又被副驾关上”

澎湃新闻
2026-10-04 20:15:52
拒绝清北?“小孩姐”择校标准曝光!陈妤颉:没有顶尖名校情结,个人倾向留在浙江,可以陪伴父母

拒绝清北?“小孩姐”择校标准曝光!陈妤颉:没有顶尖名校情结,个人倾向留在浙江,可以陪伴父母

开成运动会
2026-10-04 09:30:11
51岁美国偶像主持晒腹肌,评论区全在求他别练了

51岁美国偶像主持晒腹肌,评论区全在求他别练了

自愈小日子
2026-10-04 13:56:44
亚运收官!169金看着爽,懂球的却后背发凉!金牌数差距如断崖,日本83枚,韩国仅39枚

亚运收官!169金看着爽,懂球的却后背发凉!金牌数差距如断崖,日本83枚,韩国仅39枚

篮球热嗖
2026-10-05 17:45:51
女子报冰岛外国团,发现除了导游全是中国人,当事人:因为该团便宜一半就报了;北极圈地广人稀但处处是乡音,感到非常亲切

女子报冰岛外国团,发现除了导游全是中国人,当事人:因为该团便宜一半就报了;北极圈地广人稀但处处是乡音,感到非常亲切

大风新闻
2026-10-04 20:28:03
伤仲永!30岁前热刺天才1年无球可踢:业余队训练 巅峰身价1亿

伤仲永!30岁前热刺天才1年无球可踢:业余队训练 巅峰身价1亿

新英体育
2026-10-05 09:58:47
【油价大跌】超2.20元/升,今年“下跌5次”的油价,国庆假期后或“再下降”,10月15日或“跌超2毛/升”!

【油价大跌】超2.20元/升,今年“下跌5次”的油价,国庆假期后或“再下降”,10月15日或“跌超2毛/升”!

油价早知道
2026-10-05 01:43:20
2026-10-05 19:35:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
亲子
本地
数码
手机

艺术要闻

王羲之唐拓《金刚经》出土,5100多字没有任何缺损,能看一眼都是福气!

亲子要闻

公立医院“下场”带娃,并非跨界“抢生意” | 新京报快评

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

狠!三星 HBM 内存直接涨价 3 倍,网友急问:芯片、手机都要涨价吗?

手机要闻

苹果终极旗舰 iPhone20 Pro Max 彻底曝光!四曲面全玻璃 + 屏下相机

无障碍浏览 进入关怀版