网易首页 > 网易号 > 正文 申请入驻

自由能原理:一个统一的大脑理论?

0
分享至

自由能原理:一个统一的大脑理论?

The free-energy principle:a unified brain theory?

https://www.uab.edu/medicine/cinl/images/KFriston_FreeEnergy_BrainTheory.pdf



摘要 |

最近有人提出了一个自由能原理,用以解释行动、感知和学习。这篇综述从自由能的视角审视了生物学(例如神经达尔文主义)和物理学(例如信息论和最优控制理论)中的一些关键大脑理论。至关重要的是,一个关键主题贯穿于这些理论中的每一个——优化。此外,如果我们仔细观察被优化的东西,同一个量不断浮现,即价值(预期奖励、预期效用)或其补集,惊奇(预测误差、预期成本)。这正是自由能原理下被优化的量,这表明若干全局性大脑理论或许可以在一个自由能框架内得到统一。

尽管神经科学中拥有大量经验数据,但关于大脑如何运作的全局性理论却相对很少。最近提出的一个针对适应性系统的自由能原理试图为行动、感知和学习提供一种统一的解释。尽管这一原理被描绘为一种统一的大脑理论¹,但其统一关于大脑功能的不同视角的能力尚未得到确立。这篇综述试图将一些关键理论置于自由能框架之内,以期找出共同主题。我首先回顾自由能原理,然后解构若干全局性大脑理论,以表明它们如何都指向同一个基本思想。

自由能原理(框1)指出,任何与其环境处于平衡状态的自组织系统都必须最小化其自由能²。该原理本质上是关于适应性系统(即生物主体,如动物或大脑)如何抵抗一种自然的无序倾向³⁻⁶的数学表述。以下是对该原理的动机和含义的非数学处理。我们将看到,尽管动机相当直接,但其含义却复杂而多样。这种多样性使得该原理能够解释大脑结构和功能的许多方面,并赋予它统一关于大脑如何运作的不同视角的潜力。在随后的章节中,我将讨论该原理如何从这些视角应用于神经元系统。这篇综述以相当抽象和技术性的方式开始,但随后试图用更熟悉的术语来阐释这一基本思想。


动机:抵抗一种无序倾向。生物系统的决定性特征是,它们在不断变化的环境³⁻⁶中维持其状态和形态。从大脑的角度来看,环境既包括外部环境,也包括内部环境。这种秩序的维持在许多层面上都可以看到,并将生物系统与其他自组织系统区分开来;事实上,生物系统的生理学几乎可以完全归结为其稳态⁷。更准确地说,一个有机体所能处于的生理和感觉状态的范围是有限的,而这些状态定义了该有机体的表型。在数学上,这意味着这些(内感受性和外感受性)感觉状态的概率必须具有低熵;换句话说,一个系统处于少数几种状态中任何一种的概率很高,而处于其余状态的概率很低。熵也是平均自信息或“惊奇”⁸(更形式化地说,它是一个结果的负对数概率)。在这里,“一条离开水的鱼”将处于一种惊奇状态(无论在情感上还是在数学上)。一条经常离开水的鱼将具有高熵。请注意,惊奇和熵都依赖于主体:对一个主体来说令人惊奇的事情(例如,离开水),对另一个主体来说可能并不令人惊奇。因此,生物主体必须最小化惊奇的长期平均值,以确保其感觉熵保持较低。换句话说,生物系统以某种方式设法违反了涨落定理,该定理推广了热力学第二定律⁹。

自由能
一种信息论度量,它限定或限制(通过大于)在给定生成模型的情况下对某些数据进行采样时的惊奇。

稳态
开放或封闭系统调节其内部环境以将其状态维持在一定范围内的过程。

熵
从概率分布或密度中采样的结果的平匀惊奇。低熵的密度意味着,平均而言,结果相对可预测。因此,熵是不确定性的度量。

简而言之,长期(远端)的迫切要求——将状态维持在生理界限之内——转化为短期(近端)对惊奇的避免。这里的惊奇不仅涉及当前状态(当前状态无法改变),还涉及从一个状态到另一个状态的运动(这种运动可以改变)。只要这种运动反复访问一小组状态,即所谓的全局随机吸引子¹⁰,这些状态与生存相容(例如,在很小的误差范围内驾驶汽车),那么这种运动就可以是复杂而游荡的(漫游)。自由能原理所优化的正是这种运动。

到目前为止,我们所说的只是:生物主体必须避免惊奇,以确保其状态保持在生理界限之内(关于更形式化的论证,见补充信息S1(框))。但它们如何做到这一点呢?一个系统无法知道自己的感觉是否令人惊奇,而且即使它知道,也无法避免这些惊奇。这就是自由能发挥作用的地方:自由能是惊奇的上界,这意味着如果主体最小化自由能,它们就隐含地最小化了惊奇。至关重要的是,自由能可以被评估,因为它是主体能够访问的两样东西的函数:它的感觉状态,以及由其内部状态(例如神经元活动和连接强度)所编码的识别密度。识别密度是对引起某一特定感觉的原因的概率性表征。

这种(变分)自由能构造被引入统计物理学,以将困难的概率密度积分问题转化为更容易的优化问题¹¹。它是一种信息论量(像惊奇一样),而不是热力学量。变分自由能已被用于机器学习和统计学中,以解决许多推断和学习问题¹²⁻¹⁴。在这种情境中,惊奇被称为(负的)模型证据。这意味着,如果我们把一个主体视为其世界的一个模型,那么最小化惊奇就等同于最大化该主体存在的感官证据。在当前的语境中,自由能为一个基本问题提供了答案:自组织适应性系统如何避免惊奇状态?它们可以通过最小化其自由能来做到这一点。那么,这涉及什么呢?

惊奇
(惊奇或自信息。)一个结果的负对数概率。因此,一个不太可能的结果(例如,水往山上流)是令人惊奇的。

涨落定理
(统计力学中的一个术语。)研究一个远离热力学平衡的系统的熵在给定时间段内增加或减少的概率。它指出,熵减少的概率随时间呈指数级变小。

吸引子
一个动力系统在足够长的时间后演化趋向的集合。接近吸引子的点即使在小扰动下也会保持接近。

Kullback-Leibler 散度
(或信息散度、信息增益或交叉熵。)两个概率分布之间非负差异的非交换性度量。

识别密度
(或“近似条件密度”。)数据(例如,感觉输入)原因的一个近似概率分布。它是推断或反演生成模型的产物。

含义:行动与感知。主体可以通过改变自由能所依赖的两样东西来抑制自由能:它们可以通过作用于世界来改变感觉输入,或者它们可以通过改变其内部状态来改变其识别密度。这一区分恰好对应行动与感知(框1)。通过考虑自由能的三种数学等价表述,可以更详细地理解这意味着什么(关于数学处理,见补充信息S2(框))。

第一种表述将自由能表达为能量减去熵。这一表述之所以重要,有三个原因。第一,它将信息论中使用的自由能概念与统计热力学中使用的概念联系起来。第二,它表明主体可以评估自由能,因为能量是关于感觉及其被感知原因共同出现的惊奇,而熵则仅仅是主体自身识别密度的熵。第三,它表明自由能依赖于一个关于世界的生成模型,该模型以感觉及其原因共同出现的概率来表示。这意味着,一个主体必须拥有一个关于原因如何共同作用以产生感觉数据的隐式生成模型。正是这个模型既定义了主体的性质,也定义了自由能对惊奇的约束的质量。

第二种表述将自由能表达为惊奇加上一个散度项。(感知的)散度正是识别密度与给定感觉信号时感觉原因的条件密度(或后验密度)之间的差异。这个条件密度代表了对真实原因的最佳可能猜测。两个密度之间的差异总是非负的,因此自由能是惊奇的上界。因此,通过改变识别密度(而不改变感觉数据)来最小化自由能,会减少感知散度,使得识别密度成为条件密度,而自由能成为惊奇。

第三种表述将自由能表达为复杂度减去准确度,使用的是模型比较文献中的术语。复杂度是识别密度与原因的先验密度之间的差异;它也被称为贝叶斯惊奇¹⁵,是先验密度——它编码了在感觉数据被吸收之前关于世界状态的信念——与后验信念之间的差异,后验信念由识别密度编码。准确度则仅仅是在识别密度下所预期的关于感觉的惊奇。这一表述表明,通过改变感觉数据(而不改变识别密度)来最小化自由能,必须提高主体预测的准确度。简而言之,主体将选择性地采样它所预期的感觉输入。这被称为主动推断¹⁶。这一过程的一个直观例子(当它被提升到意识层面时)将是在黑暗中摸索前行:我们预期接下来可能触摸到什么,然后试图确认这些预期。

总之,自由能依赖于一个关于感觉数据如何生成的模型,以及一个关于该模型参数(即感觉原因)的识别密度。只有通过改变识别密度以改变关于被采样内容的条件期望,或者通过改变感觉样本(即感觉输入)以使它们符合期望,才能减少自由能。在接下来的内容中,我将根据一些关于大脑的关键理论来考虑这些含义。

贝叶斯大脑假说

贝叶斯大脑假说¹⁷使用贝叶斯概率论将感知表述为一个基于内部模型或生成模型的建构过程。其基本思想是,大脑拥有一个关于世界的模型¹⁸⁻²²,并试图利用感觉输入²³⁻²⁸来优化它。这一思想与分析综合法²⁰和认识论自动机¹⁹有关。在这种观点中,大脑是一台推断机器,它主动预测并解释自己的感觉¹⁸,²²,²⁵。该假说的核心是一个概率模型,它能够生成预测,感觉样本则依据这些预测受到检验,以更新关于其原因的信念。这个生成模型被分解为一个似然(给定原因时感觉数据的概率)和一个先验(这些原因的先验概率)。感知于是成为反演似然模型(从原因到感觉的映射)以获取给定感觉数据时原因的后验概率(从感觉到原因的映射)的过程。这种反演等同于最小化识别密度与后验密度之间的差异,以抑制自由能。事实上,自由能表述正是为了避开精确推断这一困难问题而发展出来的,它将其转化为一个更容易的优化问题¹¹⁻¹⁴。这为模型识别和比较提供了强大的近似技术(例如,变分贝叶斯或集成学习²⁹)。有许多有趣的问题伴随着贝叶斯大脑假说,而自由能原理可以阐明这些问题;我们将聚焦于两个。

第一个是生成模型的形式及其在大脑中如何体现。对贝叶斯处理的一种批评是,它们忽略了推断所必需的先验信念是如何形成的这一问题²⁷。然而,这一批评在层次生成模型中消解了,在这些模型中,先验本身也被优化²⁶,²⁸。在层次模型中,一个层级的原因生成较低层级的从属原因;感觉数据本身则在最低层级生成(框2)。最小化自由能有效地优化了经验先验(即给定上一层级原因时,某一层级原因的概率)。至关重要的是,由于经验先验以层级方式相互关联,它们受到感觉数据的告知,使大脑能够在线优化其先验预期。这种优化使层级中的每一层级都对其他层级负责,从而在多个描述层级上提供对感觉原因的内部一致表征。层次模型不仅在统计学中具有关键作用(例如,随机效应和参数经验贝叶斯模型³⁰,³¹),鉴于皮层感觉区的层级排列³²⁻³⁴,它们也可能被大脑所使用。


第二个问题是识别密度的形式,它由大脑的物理属性所编码,例如突触活动、效能和增益。一般来说,任何密度都由其充分统计量来编码(例如,高斯形式的均值和方差)。大脑编码这些统计量的方式,对支撑识别的各种方案施加了重要约束:这些方案范围从自由形式的方案(例如,粒子滤波²⁶和概率群体编码³⁵⁻³⁸),它们使用数量庞大的充分统计量,到更简单的形式,后者对识别密度的形状作出更强假设,从而可以用少量充分统计量来编码。最简单的假定形式是高斯形式,它只需要条件均值或期望——这被称为拉普拉斯假设³⁹,在该假设下,自由能仅仅是模型预测与被预测的感觉或表征之间的差异。最小化自由能于是对应于解释掉预测误差。这被称为预测编码,并已成为理解皮层层级不同层级之间神经元信息传递的一个流行框架⁴⁰。在这种方案中,预测误差单元将条件期望与自上而下的预测进行比较,以产生预测误差。这个预测误差被前向传递,以驱动上一层级中编码条件期望的单元,这些单元优化自上而下的预测,以解释掉(减少)下一层级中的预测误差。在这里,解释掉仅仅意味着用由自上而下预测驱动的抑制性突触输入,来抵消预测误差神经元的兴奋性自下而上输入(关于详细讨论,见框2和参考文献41,42)。自下而上的预测误差与自上而下的预测之间的这种相互交换持续进行,直到所有层级的预测误差都被最小化,并且条件期望得到优化。这一方案已被用来解释早期视觉反应的许多特征⁴⁰,⁴³,并为电生理学中的重复抑制和失匹配反应提供了一个合理的解释⁴⁴。图1提供了一个使用该方案的知觉分类示例。


这种信息传递与真实皮层层级中的功能不对称性相一致⁴⁵,其中前向连接(传递预测误差)是驱动性的,而反向连接(建模感觉输入的非线性生成)兼具驱动性和调节性特征⁴⁶。这种不对称的信息传递也是自适应共振理论⁴⁷,⁴⁸的一个特征,该理论与预测编码具有形式上的相似性。

总之,贝叶斯大脑和预测编码背后的主题是:大脑是一台推断引擎,它试图优化关于是什么导致其感觉输入的概率表征。这种优化可以利用(变分自由能)对惊奇的界来精炼。简而言之,自由能原理蕴含贝叶斯大脑假说,并可以通过该领域所考虑的许多方案来实现。几乎无一例外,这些方案都涉及大脑区域或单元之间的某种形式的信息传递或信念传播。这使我们能够将自由能原理与另一种关于感觉加工的原则性方法联系起来,即信息论。

高效编码原理

高效编码原理表明,大脑在那些表征的效率约束下,优化感觉器官与其内部表征之间的互信息(即相互可预测性)。这一思路由Barlow⁴⁹以冗余减少原理(或高效编码原理)的形式提出,后来以infomax原理⁵⁰的形式加以形式化。它已被应用于机器学习⁵¹,导致了独立成分分析⁵²之类的方法;并在神经生物学中促成了对神经元反应本质的理解⁵³⁻⁵⁶。这一原理在预测经典感受野的经验特征方面极其有效⁵³,并为稀疏编码⁵⁵和视觉层级中加工流的分离⁵⁷提供了一种原则性解释。它已被扩展以涵盖动力学和运动轨迹⁵⁸,⁵⁹,甚至被用于推断神经元加工的代谢约束⁶⁰。

最简单地说,infomax原理认为,神经元活动应以高效而简约的方式编码感觉信息。它考虑一组变量(感觉状态)与另一组变量(表征这些状态的变量)之间的映射。乍一看,这似乎排除了概率表征,因为那将涉及感觉状态与概率密度之间的映射。然而,infomax原理可以应用于识别密度的充分统计量。在这种语境中,infomax原理成为自由能原理的一个特例,它出现在我们忽略概率表征中的不确定性时(并且当没有行动时);关于数学细节,见补充信息S3(框)。通过注意到感觉信号由原因生成,这一点很容易看出。这意味着,表征这些原因就足以预测这些信号。更形式化地说,infomax原理可以依据自由能分解为复杂度和准确度来理解:当条件期望最大化准确度(或最小化预测误差)时,互信息得到优化;而效率则通过最小化复杂度来保证。这确保生成模型中没有应用过多参数,并导致对感觉数据的简约表征,该表征符合关于其原因的先验约束。有趣的是,先进的模型优化技术使用自由能优化来消除冗余模型参数⁶¹,这表明自由能优化可能为神经发育⁶²和睡眠⁶³期间大脑中发生的突触修剪和稳态提供一个很好的解释。

infomax原理涉及从感觉输入到表征的前向映射。这与优化生成模型——从原因映射到感觉输入——如何协调一致?这些视角可以通过注意到以下一点来调和:所有基于infomax的识别方案都可以被表述为优化生成模型的参数⁶⁴。例如,在稀疏编码模型⁵⁵中,隐式先验设定独立原因是从重尾分布或稀疏分布⁴²中采样的。这些模型能够如此好地预测经验观察到的感受野,这一事实表明,我们被赋予(或获得)了这样的先验预期:我们感觉的原因在很大程度上是独立且稀疏的。

总之,高效编码原理认为,大脑应优化其感觉信号与某些简约神经元表征之间的互信息。这等同于在复杂度约束下优化生成模型的参数,以最大化预测的准确度。二者都受到自由能原理的支配,而自由能原理可以被视为infomax原理的概率推广。我们现在转向更多受生物学启发的、聚焦于神经元动力学和可塑性的关于大脑功能的思想。这将把我们带入更深入的神经生物学机制,以及上述理论原理的实现。

细胞装配与相关理论

细胞装配理论由Hebb⁶⁵提出,它蕴含Hebbian——或联想性——可塑性,后者是使用依赖性或经验依赖性可塑性⁶⁶、von der Malsburg的相关理论⁶⁷,⁶⁸以及其他对Hebbian可塑性本身的形式化改进⁶⁹的基石。细胞装配理论认为,相互连接的神经元群通过突触连接的增强而形成,这种增强依赖于相关的突触前和突触后活动;也就是说,“一起激发的细胞连接在一起”。这使大脑能够从感觉器官中提取统计规律性。相关理论考虑的是突触效能及其可塑性(也称为元可塑性⁷⁰)的选择性启用,这种启用由同一物体的不同知觉属性(例如,一辆运动中红色巴士)所诱导的快速同步活动实现。这解决了经典可塑性的一个假定缺陷,即经典可塑性无法将突触前输入归因于世界中的某一特定原因(例如,红色)⁶⁷。相关理论支撑了对同步大脑活动及其在将属性关联或绑定到特定物体或原因中的作用的许多理论处理⁶⁸,⁷¹。另一个依赖联想可塑性的重要领域,是使用吸引子网络作为记忆形成和提取的模型⁷²⁻⁷⁴。那么,相关性和联想可塑性在自由能表述中处于什么位置呢?

迄今为止,我们只考虑了关于导致感觉信号的世界状态的推断,其中关于状态的条件期望由突触活动编码。然而,识别密度所涵盖的原因并不限于随时间变化的状态(例如,视觉场中物体的运动):它们还包括赋予世界因果结构的时间不变规律性(例如,物体以恒定加速度下落)。这些规律性是生成模型的参数,必须由大脑推断——换句话说,这些参数的条件期望可能由突触效能编码(这些是框2中的μθ),必须得到优化。这对应于优化大脑中的连接强度——也就是说,构成学习基础的可塑性。那么,这种学习会采取什么形式呢?结果表明,对自由能进行梯度下降(即改变连接以减少自由能)在形式上与Hebbian可塑性相同²⁸,⁴²(框2)。这是因为生成模型的参数决定了预期状态(突触活动)如何混合以形成预测。简单地说,当突触前预测和突触后预测误差高度相关时,连接强度增加,从而使预测能够更有效地抑制预测误差。

简而言之,细胞装配的形成反映了因果规律性的编码。这只是在自由能原理的特定实现(预测编码)语境中对细胞装配理论的重新表述。应当承认,预测编码中的学习规则实际上是一种delta规则,它建立在Hebbian机制之上;然而,Hebb关于细胞装配的更广泛观念是从非统计学视角提出的。现代重新表述表明,关于状态的推断(即感知)和关于参数的推断(即学习)都最小化自由能(即最小化预测误差),并用于限制与世界之间令人惊奇的交换。那么,同步化和突触的选择性启用又如何呢?

偏向竞争与注意

由突触效能编码的因果规律性控制着世界中状态的确定性演化。然而,这些状态中的随机(即随机性)波动在生成感觉数据中起着重要作用。它们的幅度通常被表示为精度(或方差的倒数),它编码了预测误差的可靠性。精度很重要,尤其是在层级方案中,因为它控制着自下而上的预测误差与自上而下的预测之间的相对影响。那么,精度在大脑中是如何编码的呢?在预测编码中,精度调节预测误差的幅度(这些是框2中的μγ),因此具有高精度的预测误差对编码条件期望的单元有更大的影响。这意味着精度对应于预测误差单元的突触增益。控制增益(并隐式编码精度)的最明显候选者是经典神经调质,如多巴胺和乙酰胆碱,这为注意和不确定性理论提供了一个很好的联系⁷⁵⁻⁷⁷。另一个候选者是快速同步的突触前输入,它降低有效的突触后膜时间常数并增加同步增益⁷⁸。这与相关理论十分契合,并呼应了最近关于同步活动在介导注意增益中作用的思想⁷⁹,⁸⁰。

总之,以突触增益形式对预期精度的优化,将注意与突触增益和同步化联系起来。这种联系是注意增益和偏向竞争理论⁸⁰⁻⁸⁵的核心,尤其是在神经调质⁸⁶,⁸⁷的语境中。到目前为止所考虑的理论只涉及感知。

充分统计量
足以参数化一个概率密度的量(例如,高斯密度的均值和协方差)。

拉普拉斯假设
(或拉普拉斯近似或方法。)对指数函数积分的一种鞍点近似,它使用二阶泰勒展开。当该函数是一个概率密度时,隐含假设是该密度近似为高斯分布。

预测编码
信号处理中用于使用线性预测(生成)模型来表示信号的一种工具。它是一种强大的语音分析技术,并最早在视觉中被考虑,用以解释视网膜中的侧向相互作用。

Infomax
一种针对将输入映射到输出的神经网络(或函数)的优化原理。它指出,该映射应在约束和/或噪声过程的条件下,最大化输入与输出之间的香农互信息。

随机
由随机效应支配的。

偏向竞争
一种由表征视觉刺激的神经元之间的竞争性相互作用所介导的注意效应;这些相互作用可以通过空间和非空间过程、以及自下而上和自上而下的过程,偏向于行为相关的刺激。

然而,从自由能原理的角度来看,感知只是使自由能成为惊奇的一个良好替代。要真正减少惊奇,我们需要行动。在下一节中,我们仍将关注细胞装配,但转向刺激—反应联结的选择与强化。

神经达尔文主义与价值学习

在神经元群选择理论⁸⁸中,神经元装配的出现是在选择压力的视角下加以考虑的。该理论有四个要素:表观遗传机制创造了一个神经元连接的初级库,这些连接通过经验依赖性可塑性得到精炼,产生一个神经元群的次级库。这些神经元群通过神经元群之间的再入信号传递而被选择和维持。与细胞装配理论中一样,可塑性依赖于相关的突触前和突触后活动,但在这里它受到价值的调节。价值由上行神经调质递质系统发出信号,并控制哪些神经元群被选择、哪些不被选择。神经达尔文主义的美妙之处在于,它将不同的选择过程嵌套在彼此之中。换句话说,它避开单一的选择单元,并利用元选择的概念(对选择机制的选择;例如,见参考文献89)。在这种语境中,(神经元)价值赋予进化价值(即适应性适合度),其方式是通过选择介导适应性刺激—刺激关联和刺激—反应联结的神经元群。价值做到这一点的能力由自然选择来保证,因为神经元价值系统本身也受到选择压力。

这一理论,特别是价值依赖性学习⁹⁰,与强化学习以及工程中的相关方法(见下文)有着深刻联系,例如动态规划和时序差分模型⁹¹,⁹²。这是因为神经元价值系统强化通向自身的连接,从而使大脑能够将某一感觉状态标记为有价值的,当且仅当它导致另一个有价值的状态时。这确保主体穿过一系列已获得价值的状态,以进入具有遗传指定先天价值的那些状态(奖赏)。简而言之,大脑最大化价值,这可以反映在价值系统(例如,多巴胺能系统⁹²⁻⁹⁶)的放电中。那么,这与自由能的优化有何关系呢?

答案很简单:价值与惊奇成反比,其意义是,一个表型处于某一特定状态的概率随着该状态价值的增加而增加。此外,一个表型的进化价值是在其所经历的所有状态上平均后的负惊奇,这其实就是它的负熵。事实上,最小化自由能(并隐含地最小化熵)的全部要点,就是确保主体将其大部分时间花在少数有价值的状态中。这意味着自由能是价值的补集,而它的长期平均值是适应性适合度的补集(在进化生物学中也称为自由适合度⁹⁷)。但主体如何知道什么是有价值的呢?换句话说,一代如何告诉下一代哪些状态具有价值(即哪些状态不令人惊奇)?

价值或惊奇由主体生成模型的形式及其隐含先验决定——这些先验规定了感觉状态的价值,并且至关重要的是,它们可以通过遗传和表观遗传机制遗传。这意味着先验预期(即初级库)可以规定少数具有先天价值的有吸引力的状态。反过来,这使自然选择能够优化先验预期,并确保它们与主体的表型相一致。简单地说,有价值的状态正是主体预期会频繁出现的状态。这些预期受到其生成模型形式的约束,而生成模型形式由遗传指定,并在主动推断下通过行为得到实现。

重要的是要认识到,先验预期不仅包括将从世界中采样到什么,还包括世界如何被采样。这意味着自然选择可能赋予主体这样的先验预期:它们将探索其环境,直到遇到具有先天价值的状态。我们将在下一节中更仔细地考察这一点,在那里,穿越状态空间的运动先验将以强化学习中的策略的形式来表述。

神经达尔文主义和自由能原理都试图在进化的语境中理解个体的躯体变化:神经达尔文主义诉诸选择过程,而自由能表述则从熵和惊奇的视角考虑集合或种群动力学的优化。这里出现的关键主题是,(可遗传的)先验预期可以将事物标记为具有先天价值(不令人惊奇);但仅仅标记状态如何能够产生适应性行为呢?在下一节中,我们将回到强化学习以及试图纯粹依据标签或成本函数来解释适应性行为的行动表述。

最优控制理论与博弈论

价值是那些基于强化学习和最优控制的脑功能理论的核心。支撑这些处理方式的基本观念是,大脑优化价值,即预期奖励或效用(或其补集——预期损失或成本)。这在行为心理学中表现为强化学习⁹⁸,在计算神经科学和机器学习中表现为动态规划的变体,如时序差分学习⁹⁹⁻¹⁰¹,在经济学中表现为期望效用理论¹⁰²。预期奖励或成本的概念在这里至关重要;这是给定某一规定行动或选择的策略时,在未来状态上预期的成本。策略规定了主体将从任何给定状态移动到哪些状态(“在连续时间中穿越状态空间的运动”)。该策略必须使用成本函数来访问稀疏的奖励状态,而成本函数只将状态标记为有成本或无成本。策略如何被优化这一问题在最优控制理论中被形式化为贝尔曼方程及其变体⁹⁹(见补充信息S4(框)),它们将价值表达为最优策略和成本函数的函数。如果一个人能够求解贝尔曼方程,他就能将每个感觉状态与一个价值相关联,并通过确保下一个状态是可用状态中最有价值的来优化策略。一般来说,精确求解贝尔曼方程是不可能的,但存在若干近似方法,范围从简单的Rescorla–Wagner模型⁹⁸到更全面的表述,如Q学习¹⁰⁰。成本在贝叶斯决策理论中也具有关键作用,在该理论中,最优决策在结果不确定性的语境下最小化预期成本;这是最优决策理论(博弈论)和行为经济学¹⁰²⁻¹⁰⁴的核心。

那么,自由能为这一图景带来了什么呢?如果我们假设最优策略对价值进行梯度上升,那么很容易证明价值与惊奇成反比(见补充信息S4(框))。这意味着自由能是预期成本(的上界),这是合理的,因为最优控制理论假设行动最小化预期成本,而自由能原理指出它最小化自由能。这很重要,因为它解释了为什么主体必须最小化预期成本。此外,自由能在强化学习的成本函数与进化生物学中的价值之间提供了一种定量而无缝的连接。最后,动力学视角为策略如何在大脑中被规定提供了一种机制性洞见:根据最优性原理⁹⁹,成本是价值的变化率(见补充信息S4(框)),这取决于感觉状态的变化。这表明,最优策略可以由关于感觉状态运动的先验预期来规定。简单地说,先验诱导一个不动点吸引子,当状态到达该不动点时,价值将停止变化,成本将被最小化。图2展示了一个简单例子,其中仅使用手臂将被拉向一个不动点(目标)的先验预期,就模拟了一个有提示的手臂运动。该图说明了计算运动控制¹⁰⁵⁻¹⁰⁹如何可以依据先验和感觉预测误差的抑制来表述(K.J.F.、J. Daunizeau、J. Kilner和S.J. Kiebel,未发表观察)。更一般地说,它展示了奖励和目标如何可以被视为主体有义务实现的行动的先验预期¹⁶(另见参考文献110)。它还表明,自然选择如何能够通过遗传指定可遗传或先天先验来优化行为,这些先验约束着经验先验的学习(框2)以及随后的目标导向行动。

应当指出,仅仅期望被吸引到某些状态可能不足以达到这些状态。这是因为一个人可能不得不经由其他状态来间接接近吸引子(例如,为了避开障碍物),或者服从对行动的物理约束。这些是强化学习和最优控制所应对的、一些更困难的获取远端奖励的问题。在这些情况下,对自由能原理所依据的密度动力学进行考察,表明只需持续移动,直到遇到一个先验吸引子(见补充信息S5(框))。这意味着通过使环境中意外的(有成本的)不动点变得不稳定来破坏它们(就像坐得不舒服时换到一个新位置)。在数学上,这意味着采用一种确保在有成本状态中具有正散度的策略(直观地说,这就像被推着穿过一种具有负黏度或摩擦力的液体)。关于经典山地车问题的一个解,见补充信息S5,它使用了一个诱导这类策略的简单先验。这个先验是关于穿越状态空间的运动(即状态中的变化)的,并强制探索,直到找到一个有吸引力的状态。这类先验可能为理解探索—利用权衡¹¹¹⁻¹¹³以及进化生物学中的相关问题¹¹⁴提供一种原则性方式。隐式使用先验来诱导动力学不稳定性,也为强调游荡动力学、亚稳性、自组织临界性和无胜者竞争¹¹⁵⁻¹²³的大脑动力学系统理论方法提供了一个关键联系。这些动力学现象在适应性行为的协同学和自创生理论¹⁵,¹²⁴,¹²⁵中具有关键作用。

最优决策理论(或博弈论。)应用数学的一个领域,关注于识别决定最优决策的价值、不确定性及其他约束。

梯度上升(或最速上升法。)一种一阶优化方案,它通过按函数在当前值处的梯度成比例地改变其自变量,来寻找函数的最大值。简而言之,就是一种爬山方案。相反的方案是梯度下降。

最优性原理最优策略具有这样的性质:无论初始状态和初始决策是什么,剩余决策相对于由第一个决策所导致的状态而言,必须构成一个最优策略。

探索—利用权衡涉及探索(未探索的领域)与利用(当前知识)之间的平衡。在强化学习中,它主要通过多臂老虎机问题得到研究。

动力系统理论应用数学的一个领域,描述由微分方程或差分方程所描述的复杂(可能是混沌的)动力系统的行为。

协同学关注远离热力学平衡的开放系统中模式和结构的自组织。它建立在序参量概念之上,Haken将这一概念推广为役使原理:即快速弛豫(稳定)模式的动力学完全由序参量(不稳定模式的振幅)的“慢”动力学所决定。

自创生指结构与功能之间的根本辩证关系。

亥姆霍兹式指一种使用生成模型来提供识别密度,并通过优化生成模型的参数来学习数据中隐藏结构的装置或方案。

总之,最优控制和决策(博弈)理论从成本或效用的概念出发,试图构造状态的价值函数,这些价值函数随后指导行动。自由能表述则从状态价值的自由能界出发,而这一界由关于隐藏环境状态运动的先验所规定。这些先验可以纳入任何成本函数,以确保有成本的状态被避免。具有最小成本的状态可以通过学习或进化,依据关于运动的先验预期以及随之而来的吸引子来设定。在这种观点中,在环境中寻找稀疏奖励这一问题,是自然界对如何最小化主体状态的熵(平均惊奇或自由能)这一问题的解决方案:通过确保它们占据一小组有吸引力的(即奖励性的)状态。

结论与未来方向

尽管本综述是刻意为了突出共同点而组织的,但它表明,许多关于大脑功能的全局性理论可以在一种亥姆霍兹式视角下得到统一,即把大脑视为其所栖居世界的一个生成模型¹⁸,²⁰,²¹,²⁵(图4);值得注意的例子包括贝叶斯大脑与计算运动控制理论的整合、预测编码与infomax原理所共享的目标函数、层级推断与注意理论、感知在自然选择中的嵌入,以及最优控制与动力系统理论中更奇特现象之间的联系。贯穿所有这些理论的恒定主题是:大脑优化一个关于惊奇或其补集——价值——的(自由能)界。这表现为感知(以改变预测)或行动(以改变被预测的感觉)。至关重要的是,这些预测依赖于先验预期(它们提供策略),这些先验预期在不同的(躯体性和进化性)时间尺度上得到优化,并定义了什么是有价值的。


自由能原理对未来意味着什么?如果它的主要贡献是整合已有理论,那么答案很可能是“并不太多”。相反,它可能提供一个框架,在其中当前的争论可以得到解决,例如多巴胺编码的是奖励预测误差还是惊奇¹²⁶,¹²⁷——这对于理解成瘾、帕金森病和精神分裂症等病症尤其重要。事实上,自由能表述已经被用来以错误推断来解释精神分裂症的阳性症状¹²⁸。自由能表述还可能为一些老问题提供新方法,这些问题可能要求重新评估传统观念,尤其是在强化学习和运动控制中。

如果自由能原理背后的论证成立,那么真正的挑战就是理解它如何在大脑中体现。这要求更好地领会层级信息传递⁴¹、特定神经元和微回路的功能作用及其所支持的动力学(例如,预测编码、注意和大脑中的动态协调之间是什么关系?¹²⁹)。在神经科学之外,工程学、机器人学、具身认知和进化生物学中许多令人兴奋的应用也自然浮现;尽管听起来有些异想天开,但想象建造一些小型的自由能机器,它们像我们的孩子一样获取并建模感觉信息,以最大化其自身存在的证据,这并不困难。

原文链接:https://www.uab.edu/medicine/cinl/images/KFriston_FreeEnergy_BrainTheory.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

桂系007
2026-10-04 16:54:08
iPhone 18 Pro Max彻底翻车,苹果社死了

iPhone 18 Pro Max彻底翻车,苹果社死了

李东阳朋友圈
2026-10-05 16:21:15
9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

大白聊IT
2026-10-02 22:29:11
贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

喜欢历史的阿繁
2026-10-05 00:15:37
王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

小方说跑步
2026-10-03 19:20:06
中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

南海浪花
2026-10-05 17:32:19
爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

乡野小珥
2026-10-05 02:08:54
百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

听雪禅
2026-10-05 16:40:07
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

利刃说史
2026-10-05 13:00:00
“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

风流女汉
2026-06-15 15:52:33
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

职场资深秘书
2026-10-05 11:38:09
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

王医生健康讲坛
2026-10-05 20:40:06
港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

草莓解说体育
2026-10-05 05:55:36
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

一娱三分地
2025-08-14 13:28:27
笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

夜深爱杂谈
2026-10-01 20:22:18
2026-10-05 22:43:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
家居
亲子
时尚
本地

教育要闻

聪明的父母,大多是“农民思维”

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

帆布鞋,今年这样穿酷极了!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版