网易首页 > 网易号 > 正文 申请入驻

Neuron:实时强化反馈在感觉受限时提升人机接口连续控制

0
分享至


认知神经科学前沿文献分享


基本信息

Title:Real-time reinforcement for human-machine interface control

发表时间:2026-6-15

发表期刊:Neuron

获取原文:

1. 添加小助手:PSY-Brain-Frontier即可获取PDF版本



引言

康复训练、虚拟现实、假肢控制、精密力操纵——这些场景的共同点:用户要持续发出运动命令去追踪外部目标,而视觉或触觉反馈往往不完整:被遮挡、噪声干扰、传输延迟、空间分辨率有限。约 50–80% 的卒中患者伴随不同程度的感觉缺损,进一步压低了反馈的可用度。所以发展辅助性反馈策略一直是人机接口和神经康复的核心目标。

经典强化学习范式通常在动作结束后才给二元"成功 / 失败"信号,也就是动作完成时才知道结果。这种端点反馈在离散选择任务里效果不错,但在连续追踪里就显得尴尬——一次失败的轨迹里到底哪一段出了问题,操作者很难归因。既往在健康人和卒中患者中的研究也确实显示,连续任务里端点反馈对训练期和保持期都没有显著收益。归因困难之外,端点反馈对感觉受限条件下的指导价值也有限:动作已经完成,实时修正无从下手。

这组研究想测的是:把"成功 / 失败"信号搬到任务进行中实时挂出来,让操作者每时每刻都知道"当前这一刻过没过线"——这种"实时强化反馈"能不能改善连续控制?收益是否依赖感觉反馈质量?能不能跨接口、跨感觉模态、跨患者群体复制?为此作者设计了一套统一任务,并系统操控视觉与触觉反馈的完整度,从 3 档到 6 档递进,把"封顶效应"这一常见替代解释也排除掉。


实验设计与方法逻辑

全部 5 个实验共用一个 7 秒光标追踪任务:屏幕上一个移动目标,受试者通过手握力(exp 1–3、5)或右侧肱二头肌等长收缩的表面肌电(exp 4)控制光标跟随目标。每个 block 受试者要学一条新的目标运动曲线(前后各安排一些熟悉曲线),强化策略在 block 内随机或固定。

视觉反馈的撤除:每 7 秒试次里,受试者只能看到一部分光标位置:

  • exp 1 三个等级——VisionFull(全程)/ VisionHigh(5.5/7 s)/ VisionLow(2.5/7 s);

  • exp 2 把视觉切成 6 档(100/89/79/57/35/14%),强化标准改为开放循环固定阈值;

  • exp 3 独立 24 人队列重复 VisionLow;

  • exp 4 在视觉之外,再操控伺服马达在掌心提供的人工触觉反馈,组成 8 个感觉条件(V+T+ / V+T− / V−T+ / V−T−);

  • exp 5 收 18 名慢性卒中患者(6 女,58.6 ± 3.3 岁),仅 VisionFull / VisionLow,难度按患者预校准。

强化条件:ReinfON 把目标点染成绿 / 红(成功 / 失败),ReinfOFF 用视觉匹配的青 / 品红随机色块,并明确告知"无信息"。成功阈值不是固定数字,而是闭环更新——取最近 3 次(exp 3 取 4 次)同一时间点误差的中位数作为"刚刚被定义的成功"。这种个体化、动态的阈值让每个受试者都在跟自己比,避免了"难度一刀切"对感觉受限者的不公平。

样本量:88 名右利手健康人(exp 1+2 同一组 24 人,14 女;exp 3 独立 24 人,15 女;exp 4 40 人,25 女)加 18 名慢性卒中患者,合计 106 人。所有受试者预先填写 SPSRQ(敏感性奖惩量表),用以分析个体差异。Fig. 1 给出整体任务框架和实验列表。

分析:训练期与保持期误差用 LMM 比较;机制部分用 transfer entropy 估计"目标 → 光标"信息流作为在线反馈控制代理;用 KL 散度比较"成功 vs 失败"加速度分布的分离度;用变异度差异区分"成功后利用"和"失败后探索"。


核心发现

发现一:收益大小强烈依赖视觉反馈量

exp 1 三个视觉等级下 ReinfON 都比 ReinfOFF 改善训练期误差(all p<0.001),但效应量在 VisionLow(d=0.94)远大于 VisionFull(d=0.32)和 VisionHigh(d=0.29)。保持期只在 VisionLow 下 ReinfON 显著优于 ReinfOFF(d=−0.33, p<0.001),其他两档没有差异。Fig. 2 把训练期表现和训练后保持并列呈现,结论直观——


Figure 2. Main results of exp 1 (A) Motor performance across training

实时强化不是"做对就多给点",而是"在你看不清的时候帮你看清状态"。

exp 2 把视觉切成 6 档进一步收敛:ReinfON 收益只出现在 Vision57%、35%、14%(d=−0.32、−0.65、−0.63),前 3 档(100/89/79%)均无显著差异(all p>0.17)。这种"梯度式"验证比二元切分更有说服力——收益从某个临界视觉水平开始出现,并随视觉进一步减少而放大。exp 3 在独立队列中复制了 VisionLow 的训练期与保持期效应。

这里有一个常被质疑的点是:VisionFull 下没效果,会不会因为任务太简单、加什么反馈都封顶了?exp 2 的扩展训练直接否定了这一可能:同一批受试者做 150 次训练后,误差还能再降 18.7%(Fig. 3A)。也就是说,VisionFull 下没有 ReinfON 收益,是强化本身在该条件下作用有限,不是天花板。


Figure 3. Main results of exp 2 (A) Retention after extended practice of the task

发现二:跨感觉模态同样有效

如果收益仅在"看不清"时出现,那到底是视觉特殊,还是"感觉信息不足"更一般?exp 4 把控制方式改成 EMG(肱二头肌等长收缩)+ 人工触觉反馈(伺服马达在掌心),从而能独立操控视觉和触觉两条感觉通道。

当人工触觉被撤(V+T−,d=−0.11)、视觉被撤(V−T+,d=−0.18)、或两者同时撤(V−T−,d=−0.36)时,ReinfON 都能进一步降低误差;双感觉完整的 V+T+ 下没有效应(p=0.79)。Fig. 4 把"强化只对视觉受限有效"扩展为"对整体感觉信息削弱都有效"。


Figure 4. Main results of exp 4 (A) EMG interface and artificial somatosensory feedback

这一结果有两个含义。第一,"看不清"只是感觉受限的一种形式,触觉通道受限同样会触发强化的补偿作用——这把"实时强化"从一种视觉任务的技巧,推到一种跨模态的反馈设计原则。第二,训练期效应在三种受限条件下都显著,但保持期只在 V−T+ 出现增强(d=−0.26),而 V−T− 反而出现"训练期差、保持期好"的反转——可能是因为感觉全撤后控制被迫从反应式(基于持续反馈)转向前馈(基于预编程命令),前馈在短期内牺牲精度,但有助于形成可保留的内部模型。

发现三:卒中患者训练期有改善,保持期没有

exp 5 中 18 名慢性卒中患者,VisionLow 下 ReinfON 把训练期误差降低 24.14 ± 12.60 %(d=−0.46, p<0.001),方向与健康人一致。但 VisionFull 下 ReinfON 反而恶化(d=0.24, p=0.016)——作者把它归因为"信息冗余可能干扰有注意力缺损的患者"。Fig. 5 把这一边界画得很清楚。


Figure 5. Main results of exp 5 (A) Motor performance across training

患者整体在保持期没有显著学习(post-training 104.69 ± 4.78 % of pre-training),ReinfTYPE × VisionTYPE 不显著(F₁,₃₉₅.₅₄=1.75, p=0.19)。"在线更好" 不等于 "短期学习更强"——这点作者也在 Limitations 里点明,可能与年龄相关或病灶相关运动学习缺损、患侧疲劳有关。

临床意义在于:18 个试次的短期训练虽不足以建立可保留的学习,但训练期的在线控制改善本身就有价值——康复训练最需要的就是"在治疗时间里做对一点"。至于这一收益能否在更长训练或跨会话中累积,仍然开放。

发现四:机制——在线反馈控制增强 + 利用成功

Fig. 7 把机制分析集中在同一张图里。


Figure 7. Mechanistic dissection of real-time RL (A–C) Feedback control

上半部分(A–C)用 transfer entropy 估计"目标 → 光标"信息流,作为在线反馈控制代理。ReinfON 只在 VisionLow 下显著提高该指标(d=0.42),VisionFull / VisionHigh 下无效;这一感觉依赖性在 exp 2、3 中都能复现。实时强化不是给感觉信号"加亮度",而是在线反馈控制能力本身的补偿——这一点对临床转化尤其重要,因为它说明机制可能不依赖具体感觉通道,而是作用于更高层级的运动控制策略。

下半部分(E–F)分析试次后动作加速度分布(用 250 ms 视觉-运动延迟后的事件标签)。ReinfOFF 条件下受试者仍能从光标-目标距离隐式推断成败,作者据此模拟一个"虚拟强化"以分离显式强化本身的效应。结果:

  • VisionLow 下,ReinfON 让"成功 vs 失败"加速度分布的 KL 散度显著增大(d=0.43),且成功后的变异度下降(d=0.60)、失败后无变化(d=−0.071)——"利用成功",不是"失败后探索";

  • VisionFull 下却相反:失败后变异度上升(d=0.34),成功侧无变化(d=0.13)——感觉充足时,强化承担的是"提示探索"角色。

Fig. 7G 把这两条机制线串到了一起:VisionLow 下训练期"成功后变异度下降"越明显的个体,保持收益越大(稳健回归 R²=0.21, p=0.036),失败侧无对应关联(R²=0.05, p=0.31)。作者把这条相关解释为"强化通过选择性稳定成功动作促进保留"。

另一条独立证据来自个体差异:SPSRQ(敏感性奖惩量表)得分与 ReinfTYPE 在健康人(p=0.017)和卒中患者(p<0.001)中均交互——分数越高,ReinfON 下误差越小(Fig. 6)。这支持"实时强化不只是额外感觉信号,而是调动了奖励相关机制"——也呼应既往关于强化运动学习依赖纹状体活动的发现。


Figure 6. Relationship between reinforcement-related benefits and sensitivity to incentives Results from two LMM runs on the VisionLow data with the fixed effects SPSRQSCORE and ReinfTYPE in healthy subjects (pooled exp 1 and 3, n = 48, left) and stroke patients (exp 5, n = 18, right)


归纳总结和点评

结论的感觉条件性很强。VisionFull 下 ReinfON 几乎无效——它不是普适增强器,而是感觉受限时的一种补偿策略。作者在讨论中也强调:效应量随个体的激励敏感性和并行感觉质量而变化,不是"一刀切"疗法。如果未来要落地为康复方案,需要先评估患者当时的感觉状态和激励敏感性,再决定强化模态与强度。

训练期收益 ≠ 保持期收益。卒中患者在 18 个训练试次内能改善在线控制,但短期学习保留没建立。可能需要更长训练、跨试次累积、或与外周感觉反馈配合。作者也提到"躯体感觉对训练期不是必需,但对保留收益是必需"——这一结论部分回应了"强化能否独立成体系"的问题。

机制是分层的。感觉充足时,强化起到"提示探索"作用(失败后变异度上升);感觉不足时,强化切换到"利用成功"(成功后变异度下降)。这种"感觉—强化"相互作用在端点反馈研究中没有出现,更可能源自"在线"这一时间属性本身——把"成功"信号嵌入到每一个采样点,让操作者能更精细地使用它。

转化仍在早期。所有实验都是同一种 7 秒力追踪任务、视觉化的颜色强化。日常动作(切菜、操纵工具、驾驶)的感觉模式远比这复杂——连续噪声、空间畸变、时延等都未测。患者群体也未按卒中亚型 / 年龄 / 严重度分层。后续研究需要把"个体化、动态阈值"这一设计原则迁移到更接近真实场景的任务里,并比较不同感觉通道下的强化模态(触觉、听觉、本体感觉)。把"实时强化"和感觉替代、神经刺激、运动想象等手段组合,也可能产生协同效应——这些都值得在动物和早期临床中系统测试。


请打分

这篇刚刚登上 Neuron 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。


暑期提升





分享人:BQ

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿」

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
姐姐名古屋载誉归来何锦櫶染黄发接机 盼下次大赛金童玉女一起闪耀

姐姐名古屋载誉归来何锦櫶染黄发接机 盼下次大赛金童玉女一起闪耀

劲爆体坛
2026-10-01 09:55:03
“穿个底裤就出门了?”宝妈穿瑜伽短裤接孩子,网友:我一个女的都不好意看!

“穿个底裤就出门了?”宝妈穿瑜伽短裤接孩子,网友:我一个女的都不好意看!

林林先生
2026-10-02 07:45:07
维蒂尼亚:主教练的工作已经起作用了,效果非常明显

维蒂尼亚:主教练的工作已经起作用了,效果非常明显

懂球帝
2026-10-02 05:40:12
朝鲜核爆后的隐患越来越重:地下六次核试验对中国也产生了影响

朝鲜核爆后的隐患越来越重:地下六次核试验对中国也产生了影响

莫地方
2026-10-01 20:01:56
80岁黄百鸣狱中表现良好获减刑,曝已低调出狱与家人共度中秋

80岁黄百鸣狱中表现良好获减刑,曝已低调出狱与家人共度中秋

动物奇奇怪怪
2026-10-01 12:11:41
哈佛大学研究发现:人生回报率最高的,是每天坚持这两个习惯

哈佛大学研究发现:人生回报率最高的,是每天坚持这两个习惯

心理观察局
2026-07-01 07:37:28
"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

云居历史
2026-09-28 15:40:23
空姐被逼下跪求踹后续:东航发声明,知情人曝内幕,本人已上班

空姐被逼下跪求踹后续:东航发声明,知情人曝内幕,本人已上班

寒士之言本尊
2026-10-01 17:40:08
1988年援藏干部叛逃者周述武临终遗言,死后务必将骨灰送回故乡

1988年援藏干部叛逃者周述武临终遗言,死后务必将骨灰送回故乡

舆图看世界
2026-10-01 09:30:11
一夫一妻制逐渐难维持!社会学家分析:未来3种模式将成为主流

一夫一妻制逐渐难维持!社会学家分析:未来3种模式将成为主流

王二哥老搞笑
2026-09-24 07:26:29
国乒新情报:10月2日,孙颖莎未退赛!国乒2人一轮游,今天抽签!

国乒新情报:10月2日,孙颖莎未退赛!国乒2人一轮游,今天抽签!

老嗮说体育
2026-10-02 07:19:58
无敌! 9月车企销量 比亚迪46万 吉利29万 长城11万 零跑10万 鸿蒙3.7万

无敌! 9月车企销量 比亚迪46万 吉利29万 长城11万 零跑10万 鸿蒙3.7万

阿芒娱乐说
2026-10-02 01:24:09
部分葡萄牙球迷看台拼字声援:热苏斯,我们爱你

部分葡萄牙球迷看台拼字声援:热苏斯,我们爱你

懂球帝
2026-10-02 04:06:36
贺子珍始终坚信,朱道来就是自己在战乱中失散的儿子;可朱道来后来却坦言,当年他并没有把全部实情说出来。

贺子珍始终坚信,朱道来就是自己在战乱中失散的儿子;可朱道来后来却坦言,当年他并没有把全部实情说出来。

人生录
2026-10-01 16:39:34
31岁老板娘晒纹身:3个孩子侧脸加老公首字母,藏了5年

31岁老板娘晒纹身:3个孩子侧脸加老公首字母,藏了5年

时光慢旅人
2026-10-01 00:36:11
炸锅!29年首次黑八诞生,自由人淘汰山猫,韩旭登顶亚洲得分榜

炸锅!29年首次黑八诞生,自由人淘汰山猫,韩旭登顶亚洲得分榜

体育大朋说
2026-10-01 12:24:30
武汉十一长江烟花秀背后的经济大账

武汉十一长江烟花秀背后的经济大账

匹夫来搞笑
2026-10-02 01:22:26
华为Mate90三款怎么选?5999元起,别交智商税

华为Mate90三款怎么选?5999元起,别交智商税

小蜜情感说
2026-10-01 04:46:09
万万没想到!今年国庆节降价最狠的5种商品,香烟居然也榜上有名

万万没想到!今年国庆节降价最狠的5种商品,香烟居然也榜上有名

你在偷看谁
2026-10-01 20:37:34
苹果 iOS 26.7.1正式版已推送:更新关10个设置,系统流畅度暴涨20%

苹果 iOS 26.7.1正式版已推送:更新关10个设置,系统流畅度暴涨20%

辉哥说动漫
2026-10-01 07:18:49
2026-10-02 08:47:00
PsyBrain脑心前沿
PsyBrain脑心前沿
追踪脑科学新动态,聚焦认知与神经新研究
685文章数 23关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

游戏
健康
亲子
公开课
军事航空

《羊蹄山之魂》更新加入QSSR 关原回响等同步推出

刷酸祛痘,为什么有人翻车?

亲子要闻

鼓吹国外选精生子,收割大龄剩女的又一利器

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版