![]()
认知神经科学前沿文献分享
基本信息
Title:Dynamic acoustic-to-categorical representations of phonemes and prosody along ventral and dorsal speech streams
发表时间:2026-07-10
发表期刊:Nature Communications
影响因子:18.1
获取原文:
1. 添加小助手:PSY-Brain-Frontier即可获取PDF版本
![]()
研究背景
当我们聆听他人讲话时,听到的并不是连续渐变的物理声波,而是能瞬间将其切分成离散的辅音或元音(音素),并听出对方是陈述还是疑问的语气(韵律)。这种将连续变化的声学线索映射为离散类别的能力,被称为范畴化感知(categorical perception),它是人类理解语音意义的基石。
然而,大脑究竟在何时、何地完成了这种“从声学到类别”的转换?经典的语音加工双流模型(dual-stream model)通常假设这是一条严格的串行流水线:语音首先在早期的初级听觉皮层进行声学特征分析,随后才在更高阶的颞叶或额叶区域被转化为抽象的语言类别。此外,以往研究大多聚焦于音素,而对于依赖音高轮廓、持续时间更长的韵律信息,大脑是否采用了相同的计算机制仍是未解之谜。
为了回答这些问题,近期发表于 Nature Communications 的一项研究借助脑磁图(MEG)和心理物理学行为实验,结合时间分辨的表征相似性分析(RSA)与多变量转移熵(mTE)技术,以前所未有的时空分辨率追踪了音素与韵律在大脑腹侧和背侧通路中的动态表征过程。这项工作不仅证实了韵律同样具有范畴化感知的心理现实性,更对传统的串行加工模型提出了实质性挑战。
研究核心总结
研究者通过对真实德语单词“Bar”和“Paar”进行声学渐变处理,构建了发声起始时间(VOT,代表音素变化)和音高轮廓(代表陈述/疑问韵律变化)的正交刺激连续体。通过精细的神经表征追踪,研究揭示了以下三个核心发现。
一、声学与类别表征在时空上是并行的,而非严格串行
经典模型预测,大脑会先处理声学细节,再将其丢弃并形成抽象类别。但本研究的 RSA 变异配分结果表明,音素和韵律的声学表征与类别表征在时间上高度重叠,且在空间上共同分布于双侧颞叶区域。
更令人意外的是,抽象的类别表征在极早期的听觉皮层(AC)就已经出现。这意味着早期感觉皮层不仅仅是简单的“特征检测器”,它已经参与到了听觉客体的范畴化构建中。大脑并没有在形成类别后就抹除声学细节,而是将两者并行维持,这可能为在嘈杂环境中进行稳健的语音识别提供了重分析的冗余信息。
![]()
Fig 1. 行为学结果证实,无论是基于发声起始时间(VOT)的音素,还是基于音高轮廓的韵律,人类都能对其进行清晰的范畴化感知。
![]()
Fig 2. 研究采用时间分辨的表征相似性分析(RSA),将大脑活动的神经表征与声学特征、类别特征的模型进行比对。二、韵律的类别表征比音素更广泛,且独特地调用了背侧通路
尽管音素和韵律都经历了并行的声学-类别转换,但它们调用的神经网络存在显著差异。音素的类别表征相对局限,主要集中在双侧听觉皮层和左侧后颞上沟(pSTS),信息流向符合腹侧通路典型的“由后向前”传递特征。
相比之下,韵律的类别表征在空间上更为广泛。在腹侧通路中,它进一步向前延伸至前颞上沟(aSTS);更关键的是,它还跨越到了背侧通路,显著激活了双侧运动前区(PMC)和右侧下额回(IFG)。信息流分析显示,aSTS 和 PMC 成为了韵律信息跨网络交互的核心枢纽。研究者推测,这可能是因为韵律在更长的时间尺度上展开,这种时间特性恰好落入了听觉-运动整合系统的最佳处理窗口,从而需要背侧通路的额外参与。
![]()
Fig 3. 音素的表征集中在双侧腹侧通路,而韵律的表征在刺激偏离后不仅出现在腹侧,还延伸至背侧通路的运动前区(PMC)和下额回(IFG)。
![]()
Fig 4. 多变量转移熵分析揭示了信息流向:音素主要在腹侧通路内由后向前传递,而韵律信息则在腹侧与背侧通路之间存在广泛的跨网络交互。
![]()
Fig 5. 变异配分结果表明,声学表征与类别表征在双侧颞叶区域存在显著的时空重叠,打破了传统的严格串行加工假设。三、任务目标自上而下特异性增强左侧 pSTS 的音素类别表征
大脑对语音的处理并非完全被动。当被试在实验中被要求专门关注并识别音素(而非韵律)时,其左侧 pSTS 对音素的类别表征(而非声学表征)得到了显著的自上而下增强。这一效应在右侧 pSTS 中并未出现。
这一结果不仅印证了左侧 pSTS 在音素范畴化和口语词汇识别中的特殊核心地位,也表明大脑能够根据当前的语言任务需求,灵活、动态地调整特定皮层区域对特定抽象层级信息的处理权重。
![]()
Fig 6. 任务调节效应显示,当被试专注于音素识别任务时,左侧后颞上沟(pSTS)对音素的类别表征得到了特异性的自上而下增强。
研究意义
这项研究在理论层面上对经典的语音感知层次模型进行了重要修正。它证明了大脑在处理基本语音构建块时,采用的是一种“声学与类别并行处理”的共享计算原则,而非简单的串行接力。这种并行机制解释了人类为何能在复杂多变的自然对话中保持极高的语音解码准确率。
在机制层面上,该工作清晰地展示了大脑如何根据不同语言元素的物理特性(如时间尺度的长短)和语言功能,灵活分配计算资源。短暂的音素依赖腹侧通路的局部网络,而持续的韵律则需要腹侧与背侧通路的广泛协同。
当然,这项研究目前仅考察了 VOT 和音高轮廓这两种特定的声学线索,且使用了孤立的单音节词。未来研究仍需进一步探索在连续、自然的真实语流中,大脑是如何将这些分布在不同网络中的音素与韵律信息重新绑定,最终构建出统一的语义与语用理解的。
分享人:饭鸽儿
审核:PsyBrain 脑心前沿编辑部
你好,这里是「PsyBrain 脑心前沿」
专注追踪全球认知神经科学的最尖端突破
视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊
每日速递「深度解读」与「前沿快讯」
科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
点击卡片进群,欢迎你的到来
一键关注,点亮星标 ⭐ 前沿不走丢!
![]()
一键分享,让更多人了解前沿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.