网易首页 > 网易号 > 正文 申请入驻

强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能

0
分享至



当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。

8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。

访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。

基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。

“止步不前”的智能

在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。


图|访谈现场(来源:YouTube)

Sutton 认为,这种静态范式混淆了知识与学习的边界。尽管模型可以记住一段对话,也可以借助外部知识库回答最新问题,但这些都不等于真正的学习。

这是因为上下文只是暂时改变模型当前能够看到的信息,模型内部的知识结构并未随之更新。另外,当对话结束或窗口被清空后,这些信息也可能随之消失。

这一区别在产品端并不明显。一个 AI 助手可以根据用户反馈修改答案,甚至借助记忆功能表现得越来越了解用户,给人一种“它正在学习”的感觉。但如果模型权重没有变化,那么它只是利用当前提供的信息完成推理,并没有形成可以长期保留的新认识。

不过,让模型继续更新参数,也没有想象中简单。Khurram Javed 等人在《Nature》发表的研究显示,标准深度学习模型在接连学习新任务时,吸收新知识的能力会逐渐下降。研究人员将这种现象称为“可塑性损失”,也就是模型训练得越久,反而越难学会新的东西。

为解决这一问题,现有训练方式往往会采用大量混合数据。Khurram Javed 解释,现有训练通常借助大批量数据,减弱单个样本对原有能力的冲击。但随着真实经验不断增多,而智能体需要保存并反复训练全部历史数据,计算和存储成本将答复增加。

合成数据因此被不少研究者视为一种解决方案。既然高质量的人类数据有限,就让模型自动生成题目、回答或模拟环境,再用这些内容训练下一代模型。

不过,Sutton 在访谈中将这种路径称为一个“巨大的错误”。在他看来,它扩大了数据规模,却没有改变 AI 依赖外部数据生产者的基本方式。

Sutton 指出,任何模拟环境都只能保留现实的一部分,许多因素很难被完整写入模拟器。合成的世界可以很大,但它仍然由有限规则构成,与现实的复杂程度存在差距。

在访谈中,Sutton 又以自动驾驶为例。企业可以让车辆在模拟环境中行驶数十亿公里,再由工程师根据真实路测调整系统。他认为,更合理的路径应当是让车辆直接从驾驶经验中发现预测偏差、修正环境模型,并将新的认识用于下一次决策。

这也是 Sutton 重提“苦涩的教训”的原因。他认为,能够利用更多计算资源、从数据中自主发现规律的通用方法,最终将胜过植入大量专家知识的系统。例如,AlphaGo Zero 未使用人类棋谱训练,仅凭自我对弈便击败此前的 AlphaGo。

大语言模型在一定程度上延续了这条路线。尽管它没有依靠专家逐条编写规则,而是从大规模文本和计算中学习语言结构。但 Sutton 认为,互联网文本终究是由人类整理出来的有限知识,如果模型始终依赖更多文本和人工反馈,它的进步仍会受到人类数据供给能力的限制。

不过,Sutton 也明确表示,他并不主张抛弃已有知识。而问题在于,当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历检验和修正它们。

他预测,当前大模型可能只覆盖了智能的四分之一,剩余部分还包括感知、行动、规划,以及在长期经验中持续改变自身的能力。缺少这些环节,模型即使再博学,也只能停留在上线时的状态。

Oak Lab 要实现持续学习

Sutton 团队认为,实现真正的持续学习,核心在于解决深度学习中的灾难性遗忘问题。朴素的单样本权重更新会快速覆盖原有知识,让模型失去之前积累的能力,这也是过去持续学习难以落地的核心障碍。

为解决这一问题,他们提出两个关键的技术方向:第一个方向是“步长优化”,通过为不同参数设置不同的更新速度,已经承载稳定知识的参数变化较慢,需要学习新内容的部分则可以更快调整。第二个是“生成与检验”,即不断提出新的内部特征或神经单元,再检验它们是否有助于模型学习。

基于上述思路,团队提出“持续反向传播”算法,相关成果此前已于《Nature》发表。这种算法在标准反向传播的基础上,持续加入少量随机初始化的新单元,再由反向传播检验其价值。Sutton 认为,如果将这一机制与步长优化结合,有望形成新一代持续深度学习算法。

不过,这类算法不能直接套用在已经训练好的静态模型上,而要用它们从头训练新的基础模型。模型在积累知识的同时,也会学习今后应当如何更新自身,从而有望在吸收新知识时减少对原有能力的破坏。

持续深度学习只是第一步,更长远的目标是让模型自主构建抽象与世界模型。Sutton 认为,当前的 AI 系统要么使用人类预设的规则模型,要么只能做低层级的时序预测,目前还无法自主生成高层抽象并基于抽象进行规划推理。

Sutton 团队最大的野心,是构建覆盖从微观细节到宏观决策的全谱系知识系统。真正的心智应该可以持续更新,同时始终保持内在的自洽与连贯,不会因为持续学习陷入混乱。


图|Oak Lab首页(来源:公司官网)

这也正是 Oak Lab 的核心使命。这家成立于 2026 年 7 月的初创公司,目标是在五到十年内打造出万亿参数规模、运行功耗仅 20 瓦的持续学习心智模型。

20 瓦大致和人类大脑的功耗水平相当,这意味着智能的提升不再单纯依赖算力堆砌,而是通过算法效率的飞跃实现。

针对这一目标,Sutton 按照摩尔定律作出估算:如果计算效率每 18 个月提高一倍,10 年大约可以带来两个数量级的提升。这意味着,假如现在能以约 2,000 瓦实现相应规模,未来将可能将功耗降至 20 瓦。

不过,最终形态不会是一个无所不能的单一心智。由于没有任何单个系统可以学完所有知识,同一种基础架构会衍生出大量不同的实例。按照两人的设想,同一种基础架构会产生多个智能体,它们因所处环境和自身经历不同,形成各自的知识与能力。

谈到公司的未来,Khurram Javed 表示,Oak Lab 初期不会追求快速扩张。新范式需要团队成员对研究方向形成高度共识,因此公司将从小规模团队起步,再逐步扩充至数个核心小组,以保持研究效率和方向一致。

参考资料:

1.https://www.youtube.com/watch?v=xH7U7w9Qzlo

2.https://oaklab.ai/mission

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

可达鸭面面观
2026-09-10 17:23:31
中日风波已全面升级,中方准时下达最后通牒,日本仅剩10天二选一

中日风波已全面升级,中方准时下达最后通牒,日本仅剩10天二选一

据说说娱乐
2026-09-13 11:41:28
前巴萨中卫、带西班牙人队降级、武磊前教练批穆氏皇马:无法控制比赛!

前巴萨中卫、带西班牙人队降级、武磊前教练批穆氏皇马:无法控制比赛!

福酱的小时光
2026-09-14 07:28:06
影响市场重大事件:美联储加息“靴子”将落地,A股或迎反攻行情;上海“明珠星座计划”启动,全栈国产化打造吉瓦级天基计算星座;纳斯达克100指数将提高SpaceX权重

影响市场重大事件:美联储加息“靴子”将落地,A股或迎反攻行情;上海“明珠星座计划”启动,全栈国产化打造吉瓦级天基计算星座;纳斯达克100指数将提高SpaceX权重

每日经济新闻
2026-09-14 06:21:05
宏远速递!新主帅怒吼陈家政,杨溢被打出鼻血,朱芳雨表示值回票价

宏远速递!新主帅怒吼陈家政,杨溢被打出鼻血,朱芳雨表示值回票价

多特体育说
2026-09-14 07:30:03
AI 巨头释放“降速”信号:芯片股周一或率先遭抛售

AI 巨头释放“降速”信号:芯片股周一或率先遭抛售

云头条
2026-09-13 21:21:48
电子青楼的崩塌

电子青楼的崩塌

视觉志
2026-09-12 14:52:28
名宿怒喷!曼联王牌离谱操作!曼市德比巨大争议

名宿怒喷!曼联王牌离谱操作!曼市德比巨大争议

奶盖熊本熊
2026-09-14 07:41:49
存款别贪多,70岁以后达到这三个数额,家庭已然幸福

存款别贪多,70岁以后达到这三个数额,家庭已然幸福

你在偷看谁
2026-08-21 21:51:40
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
2000名游客来横店拍短剧,人均花费218元起,60岁大妈在宫廷剧饰演格格:“人生第一次,太好玩了”

2000名游客来横店拍短剧,人均花费218元起,60岁大妈在宫廷剧饰演格格:“人生第一次,太好玩了”

极目新闻
2026-09-13 11:47:12
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
江苏小伙车祸夺走两条人命,拿不出190万赔偿,他的选择令人动容

江苏小伙车祸夺走两条人命,拿不出190万赔偿,他的选择令人动容

牛锅巴小钒
2026-09-14 03:01:20
敬一丹离世,她最大的牵挂不是别的,而是相守41年的丈夫王梓木

敬一丹离世,她最大的牵挂不是别的,而是相守41年的丈夫王梓木

放开他让wo来
2026-09-13 11:30:00
一路走好,9月未过半,5位名人去世,脑出血、癌症,个个身份不凡

一路走好,9月未过半,5位名人去世,脑出血、癌症,个个身份不凡

翰飞观事
2026-09-13 14:13:56
彻查!信号强烈!中央升级反腐“天网”!

彻查!信号强烈!中央升级反腐“天网”!

职场资深秘书
2026-09-13 13:25:48
夏天的最后一站,中国男篮要从亚运会带走什么?

夏天的最后一站,中国男篮要从亚运会带走什么?

体坛周报
2026-09-13 20:13:09
蔡琳否认因语言不通离婚,坦言长期争吵耗尽了能量,连生娃都是自己开车去医院

蔡琳否认因语言不通离婚,坦言长期争吵耗尽了能量,连生娃都是自己开车去医院

电影侦探社
2026-09-12 15:51:45
德国20座城市爆发示威,15万人上街反对选择党,要求立即取缔

德国20座城市爆发示威,15万人上街反对选择党,要求立即取缔

铁锤侃侃而谈
2026-09-14 01:01:31
尼昂:10年前与勇士签下一份训练营合同对我影响巨大

尼昂:10年前与勇士签下一份训练营合同对我影响巨大

北青网-北京青年报
2026-09-14 07:37:03
2026-09-14 08:03:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17238文章数 515213关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店主举报文物遗失后"停业":想弄清举报人用心何在

头条要闻

烧烤店主举报文物遗失后"停业":想弄清举报人用心何在

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

教育
本地
房产
公开课
军事航空

教育要闻

规律问题应用题,一个视频学会!

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗总统强硬发声:伊朗不会向美国投降

无障碍浏览 进入关怀版