From Conditioning to Category Learning:An Adaptive Network Model
从条件作用到类别学习:一种自适应网络模型
https://brainhealth.rutgers.edu/wp-content/uploads/2022/04/GluckBower1988.pdf
![]()
![]()
我们使用自适应网络理论,将 Rescorla-Wagner (1972) 联想学习的最小均方 (LMS) 模型扩展到人类学习和判断的现象中。在三个实验中,受试者学习将具有特定症状模式的假设患者归类为患有某些疾病。当一种疾病比另一种疾病更可能发生时,该模型预测,受试者将大幅高估针对罕见疾病的更有效症状的诊断性。实验 1 和 2 的结果为这一预测提供了明确的支持,这与概率匹配、范例提取或简单原型学习模型的预测截然不同。实验 3 将自适应网络模型与一个预测模式-概率匹配的模型进行了对比,后者是在患者总是有四种症状(从四个对立方中选出)的情况下,而不是像实验 1 中那样每种症状存在或不存在。结果再次支持了嵌入在自适应网络模型中的 Rescorla-Wagner LMS 学习规则
人类学习的过程在多大程度上源于在动物身上观察到的基本学习过程的复杂配置和精细化?人类和亚人类(低于人类的)学习这两个领域的研究有着悠久的历史,一直聚焦于基本联想学习(Ebbinghaus, 1885; Pavlov, 1927)。然而,大约20年前,动物和人类学习研究变得彼此脱节。动物研究继续主要关注基本联想过程(Mackintosh, 1983; Mackintosh & Honig, 1969; Rescorla & Holland, 1982),而人类学习(或记忆)则倾向于以信息处理和基于规则的符号操作为特征,这是一种借自人工智能的方法。
尽管存在这种分歧,许多近期的实证发现表明,人类和动物学习可能有一些共同的方面(例如,Alloy & Tabachnik, 1984; Dickinson & Shanks, 1985; Estes, 1985; Medin & Dewey, 1984)。此外,将人类认知与基本联想连接的配置联系起来的兴趣,最近因作为认知过程模型的自适应网络的发展而复苏。此类模型——也称为并行分布式处理或连接主义网络——正被开发用于模拟各种认知行为,如学习、模式识别、语音识别与产生、运动控制等等(例如,Hinton & Anderson, 1981; McClelland & Rumelhart, 1986; Rumelhart & McClelland, 1986)。这一理论运动代表了向心理学传统目标的回归,即认为复杂的人类能力源于可以在简单生物体中进行研究的基本联想过程的配置。
鉴于对动物学习的浩繁研究,以及当前用基本联想过程对认知进行建模的尝试,寻找并利用可能存在于动物和人类联想学习之间的任何对应关系,似乎显得特别及时。
动物中的联想学习
最基本且研究最充分的学习形式是经典巴甫洛夫条件反射。在经典条件反射中,一个先前中性的刺激——条件刺激(CS),例如铃声——变得与一个具有生物学意义的刺激——非条件刺激(US),例如食物或电击——相关联。早期学习理论假设,CS和US的简单时间接近或共同发生就足以产生联想学习(例如,Hull, 1943; Spence, 1956)。然而,后来的实验表明,简单的接近是不够的。CS与US形成条件反射的能力,取决于它是否提供了关于US发生的可靠且非冗余的信息(Kamin, 1969; Rescorla, 1968; Wagner, 1969)。
暗示这一原则的一个关键观察是条件反射阻断实验(Kamin, 1969)。在Kamin的实验中,一个灯光(CS)被条件化以预测电击(US)。然后,一个由灯光和音调组成的复合刺激与电击配对。令人惊讶的是,与控制组受试者(他们未接受过对灯光的预训练)相比,对音调→电击关联的学习几乎没有发生。这一结果,类似于巴甫洛夫(1927)关于一个刺激掩盖另一个刺激的研究,被称为“阻断”,因为先前对灯光→电击关联的训练,阻断了在第二阶段(灯光+音调)→电击训练期间对音调→电击关联的学习。
![]()
![]()
![]()
![]()
![]()
![]()
尽管有这些诱人的暗示表明人类和动物学习可能存在共同方面,但令人惊讶的是,几乎没有尝试在动物学习模型和人类学习模型之间建立更严格的联系。没有研究试图直接评估Rescorla-Wagner (1972) 规则是否是对人类联想学习背后算法的一个恰当描述。
认知的自适应网络模型
近年来,在认知心理学、计算机科学和神经生物学等学科中,人们对理解由大规模互连的、类神经计算元件组成的复杂网络的信息处理能力兴趣日益浓厚。在研究这些网络模型的理论家中,以下人物因证明了这些自适应网络的计算能力和心理学似真性而引人注目:Ackley, Hinton, and Sejnowski (1985), Hinton and Anderson (1981), McClelland and Rumelhart (1986), 以及 Rumelhart and McClelland (1986)。
自适应网络有若干类别,且这些网络内部有多种处理模式。与用于描述动物学习的模型最相似的网络,是那些由通过加权单向连接相连的处理单元组成的网络(不过,关于另一类模型,见Ackley et al., 1985)。这些网络通常分为一层感觉单元;一层反应单元;以及零个、一个或多个中间联想单元层。每个处理单元在每一时刻的状态由其激活值来描述,该激活值由来自其所有输入连接进入该单元的加权输入之和决定。向系统呈现一个刺激模式,对应于激活一组感觉单元。这些单元沿着它们的连接传递其加权激活值,要么直接传递给输出单元,要么传递给中间单元,中间单元再将其向前传递,最终终止于输出单元。输出单元层上的激活模式对应于系统对该输入的某种特定反应。在接收到关于每个输入模式期望输出模式的反馈后,系统调整连接上的权重,以使该输入产生更接近期望输出的输出。通过反复循环一组期望的输入-输出配对,系统“学习”到的正是那些将实现(其所能达到的)与输入-输出配对最接近匹配的权重。这些权重对应于经典学习理论中的联想强度,而根据反馈改变权重的算法对应于传统理论中的“学习规则”。
![]()
![]()
![]()
![]()
![]()
如前所述,LMS规则仅限于在线性可分离模式的基础上进行区分,其理念是相似的输入模式被映射到相似的输出模式。在相似输入模式未被映射到相似输出模式的情况下,可能需要在输入和输出节点之间增加一层额外的中间节点(“隐藏单元”)来解决区分问题(例如,见Rumelhart, Hinton, & Williams, 1986)。大量演示表明,多层网络具有学习复杂区分的巨大潜力。但这种潜力是以巨大的代价获得的;没有自然的规则来教这样的多层网络它们必须学习什么。近20年来,没有提出任何看似合理的学习规则,能使科学家们使用这些多层网络;因此,大多数科学家对使用此类网络作为学习模型失去了兴趣。
然而,最近,三个研究小组独立发现了LMS规则的泛化形式,可以合理地用于多层网络(Le Cun, 1985; Parker, 1985; Rumelhart et al., 1986)。他们发明了将输出层的权重变化反向传播通过逐层更早的单元连接层的算法。已被证明,反向传播学习变化的多层网络能够学习许多区分,例如奇偶性、异或和对称关系。从那时起,研究人员一直专注于探索这些LMS算法的信息处理潜力,试图证明它们足以解决复杂的学习问题。然而,很少有研究者探讨LMS规则是否提供了对人类如何学习的经验性准确描述。这是我们在此报告的研究的最终目标。在制定一个实验程序以开始测试LMS规则作为人类学习的一个组成部分时,我们首先探索其对概率学习期间渐近行为的预测。在这样做时,我们已经开始利用动物学习理论与自适应网络理论之间一个显著的联系。
连接动物与人类学习的模型
![]()
实验1
因为类别学习是认知心理学的一个中心主题,我们试图评估自适应网络作为受试者学习将刺激分类到类别中的模型。这也是一个基本的归纳任务,网络模型似乎很适合。我们评估的重点是比较人类学习者的表现与收敛到LMS解(由方程5提供)的网络预期渐近表现。
在我们的实验中,大学生假装是医学诊断师,阅读250名假设患者的医疗图表,每名患者由四种症状(胃痉挛、牙龈变色等)中每一种的存在或不存在来描述。学生诊断师将每位患者分类为患有两种虚构疾病中的一种或另一种,并收到关于正确诊断的反馈。在训练期间,受试者了解到哪些症状对每种疾病更具或更不具诊断性。然而,这些症状并非完全有效;也就是说,线索是概率性的,正如在多重线索概率学习(Castellan, 1977)和模糊或定义不清类别学习(Medin & Smith, 1984)的研究中那样。
为了开发受试者在此任务中表现出的网络模型,需要对以下方面做出额外假设:(a) 网络结构,(b) 网络中外部事件的表征,以及 (c) 从网络行为到人们可观察行为的映射。
图1说明了人们可以为该任务提出的最简单的一层联想网络。四种症状中的每一种都由左侧的一个输入节点表示。因为我们的任务是以两个互斥选项之间的强制选择呈现给受试者的(即,每位患者患有一种疾病或另一种),反应中只有一个自由度。因此,我们可以将输出(反应)表示为一个单一节点,在输出节点上分配正的激活值以指示对一种称为疾病R的疾病的偏好程度增加,而负的输出值指示对替代类别疾病C的偏好程度增加。从症状i到输出节点的连接具有权重,wi,反映了症状i的存在为诊断疾病R而非C提供的证据强度。这四个权重将根据方程5中的LMS规则逐次试验调整。
假设呈现患者的症状模式(一个“试验”)会在四个输入单元上引起一个激活模式(如果存在则为o~,如果不存在则为0)。类别(输出)节点然后被激活,其激活量等于a乘以从所呈现症状到那些类别节点的权重之和(即,根据方程3)。该激活反映了模型在给定症状模式的情况下对类别R(相对于C)的期望。在当前情况下,试验中的纠正反馈无论反应如何都是相同的。反馈产生的学习变化量越大,当前期望与训练信号之间的差异就越大。提供给输出节点的训练信号(图1)是实验者关于正确反应的反馈(在受试者反应之后)。假设如果类别(或疾病)R是正确的分类,那么在该试验中反馈(方程5中的~)将被设为+~;如果在给定试验中替代类别C是正确的,那么该试验的反馈将为-~。
![]()
模型中的两个参数是~和~。可以证明这两个参数仅对渐近权重和激活值产生乘法效应。因此,权重和激活值可以被视为在比率量表上测量;也就是说,它们在~/a的标量倍数内是唯一的。为方便起见,令~ = a = 1。同时假设一个单一的学习率参数/3,用于调整权重。如果将一组固定的训练模式以随机顺序多次呈现给学习模型,LMS规则的收敛特性会导致WgS(症状-疾病关联)的预期渐近水平,这些水平独立于(见附录A以及Rescoda & Wagner, 1972; Parker, 1986)。这些权重,即无参数预测,是那些使网络在训练问题上可实现的分类均方误差最小化的权重。
正如在Rescoda-Wagner(1972)公式中那样,我们假设权重和激活值将通过一个保持其序数关系的单调变换映射到决策(反应)概率中。因此,更高的输出激活值转化为选择疾病R而非疾病C的更高概率。稍后我们将提出一个具体的变换来获得选择概率。其他联想强度的度量也是可能的。我们使用的一种方法是要求受试者直接估计患者具有特定症状(例如,s~)时患有一种或另一种疾病的边际概率,而不考虑他或她的其他症状。我们将假设从s~到输出节点的权重w~越大,受试者估计患者患有疾病R而非疾病C的估计值就越高。由于强化中的对称性,正权重将反映对疾病R的偏好,而负权重将反映对疾病C的偏好。因为模型中的权重是在比率量表上指定的,这些权重到受试者疾病可能性估计的映射将被假设为仅具有序数意义。
我们将把LMS规则在我们的类别学习任务中的预测与三种竞争性类别学习模型的预测进行比较(Estes, 1986):(a) 范例模型,假设学习者存储的是每个类别的范例,然后根据新实例与每个类别存储范例的相对相似性对其进行分类(例如,Medin & Schaffer, 1978; Nosofsky, 1984);(b) 特征频率模型,假设学习者存储类别内线索出现的相对频率,然后根据其特定特征模式从每个类别产生的相对可能性对实例进行分类(Franks & Bransford, 1971; Reed, 1972);以及 (c) 原型模型,假设学习者抽象出每个类别的中心趋势(模型描述),然后根据实例与该中心原型的相似性对实例进行分类(例如,Fried & Holyoak, 1984; Homa, Sterling, & Trepel, 1981)。
当应用于我们的任务(受试者估计给定每种症状时每种疾病的概率)时,这些模型做出两种预测之一。范例模型假设受试者能够访问训练期间呈现的所有(或随机样本)范例。根据这些模型,受试者访问所有包含特定症状的存储范例,并注意该症状与疾病R同时发生的案例比例。因此,这些模型预测受试者对条件概率的估计将简单地反映在训练序列中观察到的条件症状-类别概率,这是一种“概率匹配”形式。一个忽略疾病总体基础频率变化的纯原型模型将预测,受试者对给定症状时疾病概率的估计将简单地反映给定替代疾病时症状的相对可能性,即,
![]()
在特征频率模型中,受试者被假设为记录症状(特征)与每个类别相关联的次数。如果该模型假设这些计数以类别内的相对频率形式存储,那么特征频率模型做出的预测与原型模型相同,即受试者的估计应该(错误地)反映给定替代类别时症状的相对可能性。然而,如果这些计数被直接存储,那么频率模型做出的预测与范例模型相同,即受试者的估计应该反映训练序列中的客观条件概率。
为了生成差异化的预测以比较LMS模型和替代模型,我们需要一个学习任务,其中渐近权重之间的序数关系不同于以下两者之间的序数关系:给定特征时类别的客观后验条件概率,或给定类别时特征的客观相对可能性。这就是我们在以下实验中所做的。安排这种情况的一种方式是使两种疾病的总体频率不平衡,以便一种疾病的发生频率远高于另一种。问题在于,人们的概率估计和选择是否会被LMS规则比范例、特征频率或原型模型更准确地预测。
方法
十九名受试者被训练将假设患者的医疗图表分类为两种互斥疾病类别之一。疾病名称是虚构的,但我们称它们为罕见(R)疾病和常见(C)疾病。在训练范例中,患有常见疾病的患者频率是患有罕见疾病患者的三倍。一份患者图表由从一组四种可能症状中抽取的一到四种症状组成:流鼻血、胃痉挛、眼睛浮肿和牙龈变色。
图2(左侧)显示了四种症状中每一种在患有这两种疾病中每一种的患者中发生的条件概率。每位受试者接受了一组新的训练患者,这些患者是在实验期间根据概率程序生成的。首先,每位患者被随机指定为患有罕见疾病(p = .25)或常见疾病(p = .75)。其次,给定他或她的疾病,患者的症状图表通过以下方法选择症状来生成(见图2左侧):如果患者患有罕见疾病,那么以p = .6,图表将包括症状s~;以p = .4,症状s2;以p = .3,症状s3;以p = .2,症状s4(对于患有常见疾病的患者,类似但相反)。然而,没有症状的患者——此后称为“零”患者——被从训练序列中消除。这导致给定疾病时症状的真实可能性略高于上述所示(即,给定罕见疾病时症状的概率实际上对于症状S1到s4分别为.69、.46、.35和.23,对于患有常见疾病的患者则类似但相反)。
![]()
在基础概率P(R) = .25和P(C) = .75以及图2(左侧)中的概率下,贝叶斯定理提供了分别考虑四种症状时两种疾病的条件概率(见图2右侧)。注意,对于任何单一症状,罕见疾病的客观概率总是小于或等于常见疾病的概率。因为零患者在罕见或常见疾病下可能性相同,后验条件概率的计算不受零患者消除的影响。
每位受试者接受了250个训练试验,预测疾病并在微型计算机的阴极射线管(CRT)上接收反馈。在每个试验中,一个新的患者(对应于一个症状列表)呈现在CRT上,受试者有无限的时间通过按下微型计算机上的R或C键对患者进行分类,然后在CRT上收到关于正确诊断的反馈;接着呈现下一个患者的图表。疾病由虚构名称标识,这些名称以受试者间平衡的方式分配给罕见或常见疾病。受试者被告知没有简单的规则来进行诊断,并且患者图表中症状的呈现顺序是无关的。训练后,受试者通过被要求直接估计表现出特定症状的患者患有其中一种或另一种疾病的概率来进行测试。对于每种症状和疾病,受试者被问:“在医院所有表现出[症状]的患者中,您预期其中百分之多少会患有[疾病]?”他们以0到1的量表对四种症状中的每一种给出P(R|si)和P(C|si)的数值估计,总共八个估计值。估计值通过选择11个标记为0、.10、.20…….90、1.00的键之一来做出,概率步长为.10。这些估计值是本报告中主要关注的数据。
结果与预测
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
为了比较,我们可以估计一个概率学习者的预期表现,该学习者获得每种症状模式下两种疾病的所有相关条件概率,然后为每种症状模式选择疾病以实现概率匹配(在模式-疾病水平上)。这个模式学习模型的这些概率预测是表1中列出的客观值。这些概率匹配预测与数据相关性良好(.99),平均绝对差异为 .03。LMS模型和模式-概率匹配模型做出了相当相似的预测( r = .95 )。事实上,两者之间的相关性如此之高,以至于人们可以选择方程7中的 Θ 来拟合LMS模型到模式-概率匹配(而不是数据)。当这样做时(产生 Θ = 2.8 ),然后用该 Θ 值继续预测数据,相关性(.95)由于偶然性比之前略好(由于在早期估计程序中排除了 p = 0 的点)。
这些结果的含义是双重的:(a) LMS规则和模式-概率学习模型在预测训练阶段最后阶段受试者的选择行为方面都表现相当好,并且 (b) 鉴于受试者的选择行为非常接近模式-概率匹配学习者的选择行为,受试者似乎已经尽可能好地学习了任务。第二点很重要,因为由于学习的概率性质,受试者只接受了固定数量的试验训练,而不是某个特定的标准表现。
此外,如表1所示,LMS规则和模式-概率模型在整个症状模式中做出了非常相似的选择预测。这些选择数据不允许在模式-概率学习和LMS模型之间产生强烈偏好。然而,当要求受试者直接估计给定每种症状时每种疾病的可能性时,这些模型确实变得可区分。
![]()
![]()
![]()
![]()
实验2
许多学习现象——包括掩盖、阻断以及非条件刺激的试次间呈现效应——表明动物学习的是条件刺激(CS)的列联或信息价值(Prokasy, 1965; Rescorla, 1968),而不是简单地学习CS和US的接近性(Hull, 1943; Spence, 1956)。Rescorla-Wagner(1972)模型的重要性在于,它提出了一个单一的联想过程来解释这些信息变量的作用。在第二个实验中,我们试图直接检验这个LMS网络模型的基本预测之一,即不同的线索竞争成为某一结果更有效的预测指标。
![]()
然而,LMS规则是一种竞争性学习算法,其中共同出现的线索竞争以预测结果,而那些最有效且非冗余的线索被优先增强。将LMS规则应用于实验2的设计(见附录A),我们推导出 的渐近联想强度分别为 .18、.76、-.94 和 -.20。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
或者,人们可以将理论的刺激识别为完整的症状模式,并假设这些作为完整单元与疾病类别关联。Estes (1959) 称此为模式模型。通过这种识别,实验中15个症状模式中的每一个都倾向于渐近地与疾病R关联,其概率等于当该模式发生时患者患有疾病R的可能性,即匹配实际的P(R|模式)。给定类别的实验基础率和给定每种疾病症状的独立条件概率,人们可以计算这些客观概率。正是那些客观模式概率与表1中观察到的选择比例相比非常有利。
这里可以注意到LMS模型、Estes (1959) 的两个模型和数据之间的一个奇怪对比。Estes (1959) 的成分模型对数据的预测相当差,而模式模型表现好得多,特别是对于选择比例。另一方面,将刺激识别为四个症状(成分)的LMS规则在预测模式的渐近选择比例方面做得很好。事实上,在这方面,刺激被识别为成分的LMS模型在其渐近选择预测中几乎模仿了Estes (1959) 的模式模型。两个模型之间的主要区别发生在受试者对给定每个单独症状时两种疾病概率的直接估计中。
![]()
![]()
![]()
这两种网络表示都是合理的,并且确实对应于联结主义文献中的不同立场。网络A的一个明显含义是给定模式及其补码(通过使用模式中的交替值获得)在激活方面具有强对称性。例如,如果模式I(来自表1)是![]()
并产生输出激活G,那么其互补模式(来自表1的模式F),,应该产生输出-G。有八对这样的互补模式,因此可以使用来自网络A的这种对称性预测的强测试。顺便说一句,如果受试者在他们对症状模式的诊断中匹配概率(正如他们在实验1和2中所做的那样),那么这将违反四成分模型对互补模式的预测。
![]()
![]()
![]()
方法
如前所述,重复了实验1的统计设计和程序(见图2),除了每个存在或缺失的症状(例如,发烧或无发烧)被两个互斥的特征(例如,腹泻或便秘)替换,其中每个患者总是存在其中一个。每个患者有四个症状。36名大学生受试者对250名患者进行分类,并接收反馈。训练后,受试者估计给定八个单一症状(四个互斥对)中每个症状时每种疾病的条件概率,总共提供16个估计值。
结果
直接可能性评级。主要结果是受试者对疾病R与疾病C可能性的估计。图7显示了每种症状的罕见疾病观察概率估计。实验1的数据也显示出来以供比较。从这些发现中可以得出一些结论。
![]()
![]()
![]()
概率评定似乎支持八成分LMS模型(网络B),而不是四成分LMS模型(网络A)和模式模型。八成分LMS模型和模式模型都预测在八个症状上呈现V形图,但LMS模型预测的V形在两端会上升到.5基线之上。此外,模式模型预期实验3中症状的概率估计与实验1中的相同。但事实上,这两个症状列表的两种曲线彼此显著偏离。
模式模型的支持者可能会争辩说,因为实验3涉及更多的线索(八个对四个),关联性的学习会更慢,因此受试者在250次训练试验中尚未达到渐近状态(稳定状态)。因此,可以预期他们的可能性判断不如概率匹配所预测的那样极端。虽然这种“回归偶然”的论点有一定道理,但我们注意到,它无法解释LMS模型预测的显著结果,即在给定症状s1和s4时,对罕见疾病的显著过度预期。
总体讨论
我们使用自适应网络理论来评估学习规则,以描述人类的概率类别学习。如前所述,要确定一个自适应网络模型,理论家必须指定网络架构,识别该网络中环境刺激和反应的编码,并指定自适应改变权重的规则,以便系统能够学习将每个输入模式分配给其适当的输出模式。我们采用的网络架构是强制选择任务中最简单的架构,即一层N个不同的输入单元(每个物理刺激一个),将激活直接馈送到对应于两个输出(疾病或反应)类别的一个输出单元中。我们测试了这个简单的模型,并避免了更复杂的理论选项,例如输入层和输出层之间“隐藏”的多层关联单元、循环反馈回路,或每个症状的多单元表示(关于可能性的范围,见 Rumelhart & McClelland, 1986)。令人惊讶的是,仅使用最简单的网络,最优的 LMS 权重在本文报告的三个实验中都做出了成功的预测。
简要回顾这些预测,实验1中安排的学习条件预计会导致受试者认为症状 s1 对罕见疾病的诊断性显著高于对常见疾病的诊断性(注:原文中的“s~”根据上下文为“s1”的OCR识别错误,已作修正)。这一预测得到了证实,这与替代理论形成了鲜明对比,后者预测受试者的期望将与给定每种症状时两种疾病的概率相匹配。通过使用公式8中的逻辑函数将理论强度转换为选择概率,LMS 模型的预测也合理地接近给定15种症状模式中的每一种时,罕见疾病选择比例达到渐近状态的模式。
实验1中症状 s1 对罕见疾病的错觉性诊断取决于这样一个事实:症状 s1 确实比可能出现的任何其他症状对罕见疾病具有相对更高的诊断性;LMS 学习算法利用了线索与其共同出现的竞争者相比的这种相对有效性。这一分析表明,通过提高其他症状之一对预测罕见疾病的有效性,可以大大减少 s1 诊断性的错觉。实验2中安排了与此类似的条件,并且行为结果正如预测的那样。
在实验3中,我们将LMS模型与Estes(1959)的模式模型进行了对比测试,后者在实验1和2中对症状模式的选择比例做出了非常接近的预测。
模式模型意味着,当患者-症状模式被定义为四种症状的存在或缺失时,与存在某种症状或其对立症状的情况相比,将会学习到相同的行为特征。相比之下,网络B预期对立症状实验会导致截然不同的渐近结果。
鉴于与实验1相当的关联性(contingencies),预期在实验3中使用对立症状会减弱症状s1(注:原文“s~”为OCR识别错误,依上下文修正为s1)、s2、s3和s4对两种疾病的强度差异的极端性,同时导致对互补症状s4的罕见疾病产生可靠的过度预期。在估计的疾病概率中获得了这样的结果,并且它们与模式模型预测的结果不同。
一个令人愉快的惊喜是,LMS关联强度可以很容易地转换为选择概率(通过公式7),这为症状模式的观察到的疾病选择提供了高度吻合的拟合。一个奇特之处在于,可以选择LMS权重的逻辑转换,使其与给定每种刺激模式时罕见疾病的客观概率高度相关。
事实上,这种模仿是如此准确,以至于人们会忍不住通过将LMS权重拟合到给定每种模式时罕见疾病的客观概率来估计 Θ Θ(注:原文为字母O,依前文上下文修正为希腊字母 Θ Θ);如果这样做,然后预测观察到的选择比例,那么这些预测实际上将是无参数的,因为没有数据被用来估计 Θ Θ。
再次注意这个奇特的事实:将刺激单元识别为单个症状的LMS模型,能够得出与症状模式的选择概率近乎匹配的预测,而这在Estes(1959)的理论中,只有通过将刺激单元识别为完整的症状模式才能实现。如前所述,这两个模型在预测受试者仅在每次了解一个症状的情况下对疾病概率的直接可能性估计时存在差异(例如,见图3、4和7)。
相关工作
我们的实验为学习的竞争性本质提供了证据,即线索根据其对预测类别的相对有效性来竞争关联强度。最近两项关于人类线索-相关学习的研究结果为此竞争性规则提供了类似的支持。
一个支持性的结果来自 Medin 和 Edelson (1988) 的实验,他们展示了基础率学习忽视的一种极端形式。他们呈现症状对 AB 与疾病 1 的频率是症状对 AC 与疾病 2 的三倍。正如预期的那样,当受试者接受模糊线索 A 的测试时,导致了大多数选择疾病 1。更重要的是,对新模式 BC 的冲突测试产生了令人惊讶的大多数选择疾病 2 的结果,从而逆转了 3 比 1 的基础率方向。正如 Medin 和 Edelson 指出的,LMS 学习规则解释了线索 C 与疾病 2 的关联强于线索 B 与疾病 1 的关联。因为 3:1 的基础率导致 A 主要与疾病 1 关联,它增加了疾病 2 对 AC 的可预测性。在这种情况下,LMS 规则暗示线索 B 在获取其各自的关联时将比线索 C 受到相对更多的阻塞,因此线索 C 将在 BC 冲突测试中主导 B。这就是需要解释的基础率的悖论性逆转。
在 MacMillan (1987) 的相关研究中,发现受试者只有在特征(线索)对类别的存在与缺失具有某种诊断性时,才会追踪该特征在类别内的相对频率。例如,如果 70% 的患有目标疾病的患者有胃痉挛,而没有该疾病的患者中也有 70% 有胃痉挛,受试者就会忽略这个症状,因为它对诊断疾病是无关的。更重要的是,当被要求估计患有该症状的疾病患者的比例时,受试者严重低估了实际的相对频率。MacMillan 表明,这种对无效特征相对频率的忽视是在训练过程中发展出来的,因为受试者学到了这些特征的无关性。MacMillan (1987) 总结道:“类别内的特征频率仅在它们有助于区分该类别时才会被保留。如果特征频率在区分类别成员与非成员方面是无关的,就没有必要保留按类别分类的特征频率信息”(第 38 页)。MacMillan 的结果否定了诸如 Estes (1959) 的特征频率模型和 Medin 和 Schaffer (1978) 的上下文模型等理论,这些理论存储真实的频率计数;她反而表明她的结果,即频率计数取决于线索的有效性,很好地符合了我们使用 LMS 学习规则的自适应网络模型。
模型的扩展
我们已经注意到,我们测试的网络模型具有简单的架构,并以简单、直接的方式识别刺激模式(例如一个或多个症状)。我们目前正通过计算机模拟研究对简单网络理论的几种修改或修正。一种修改假设在每次试验中,无论实验者呈现什么症状模式,都会独立地呈现一个或多个背景刺激。这个背景线索的作用与 Rescorla 和 Wagner (1972) 研究中的实验背景或“条件反射装置”相同。我们的分析表明,添加背景线索并没有提高模型预测我们数据的能力。例如,对于实验 1,带有背景线索的模型预测的概率评级与数据的偏差大约是不带背景线索模型预测偏差的两倍。此外,背景线索模型在实验 1 中预测症状将主要与罕见疾病关联,这一预测未得到数据支持。产生这种预测是因为无处不在的背景线索会与常见疾病产生强烈的关联。因此,由于 LMS 算法的竞争性质,预测的症状与常见疾病之间的关联会被减弱。为了补偿这种与常见疾病关联的减弱,背景线索模型预期症状会与罕见疾病产生更强的关联。但是这种变化模式导致背景线索模型对数据的预测比简单模型更差。
我们正在研究的另一种理论变体假设感觉单元本身通过具有可调整权重的连接相互连接。每当两个感觉单元同时开启或同时关闭时,它们之间的连接就会加强。这种感觉间连接的网络可以学习跨模式的症状-症状相关性以及症状-疾病相关性(就像我们当前的网络所做的那样)。对于单层模型来说,可能需要这样的修正来处理 Medin, Altom, Edelson 和 Freko (1982) 以及其他展示了受试者对这种症状相关性敏感性的研究结果。
总之,我们暂时接受了 LMS 误差标准,这一标准得到了实验 1、2 和 3 结果的证实。我们目前正在进行进一步的测试,以检验 LMS 规则在症状-疾病学习范式中的含义。
我们感到鼓舞的是,联结主义理论中拟合人类学习数据的 LMS 规则不仅与 Rescorla-Wagner (1972) 的条件反射模型相关联,而且它还暗示了基础率忽视现象,这一现象在判断与决策的文献中已被证明是一个稳健的现象。这种跨越不同研究领域的理论联系,对于认知心理学的目标而言尤其令人鼓舞。
原文链接:https://brainhealth.rutgers.edu/wp-content/uploads/2022/04/GluckBower1988.pdf
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.