网易首页 > 网易号 > 正文 申请入驻

孩子只听几千万个词就能学会语言,大模型为什么做不到?

0
分享至


(来源:麻省理工科技评论)

据我们目前所知,人类彼此交谈至少已有 10 万年。在这漫长的时间里,世界上只有一种存在,能够把人类语言学到近乎完美流利:人类的孩子。

现在,出现了第二种。ChatGPT 发布不过四年,我们已经习惯了与手机和电脑自然对话。Claude、DeepSeek 和 ChatGPT 等大语言模型,语言能力已经足够流畅,甚至可以相当逼真地模拟人类交流。

但问题在于,机器学会语言所需要的数据,远远超过人类。一个大语言模型在训练中接触的文字量,可以达到一个人学习母语过程中所接触语言量的数万乃至数十万倍。而孩子通常在一岁左右,就已经开始掌握语言。

斯坦福大学认知科学家迈克尔·C·弗兰克(Michael C. Frank)用一个夸张但形象的比喻形容这种差距:“我们仍然需要烧掉一整片森林、刮遍人类知识的全部积累,才能在机器上重现一个孩子在客厅里一年左右就能完成的发展里程碑。”这种差距被称为数据效率鸿沟(data efficiency gap)。它提出了一个同时困扰认知科学家和 AI 研究者的问题:为什么孩子能够用如此有限的数据,学会如此复杂的语言?

过去十年,大语言模型能力提升的一条核心路径,就是不断扩大模型和训练数据规模。Meta 两年前发布的 Llama 3.1,在预训练阶段使用了 15 万亿个 token。乔治城大学认知科学家、语言学家伊桑·戈特利布·威尔科克斯(Ethan Gotlieb Wilcox)估计,最前沿模型使用的数据量可能还要高出一个数量级。

但互联网数据终究有限。随着高质量文本逐渐被消耗,可供模型继续扩张的数据资源可能在未来十年开始逼近瓶颈。孩子却提供了另一种可能。一个成长在语言环境丰富家庭里的孩子,到青春期前大约会听到 1 亿个词;如果加上阅读,到 20 岁时接触的语言总量可能达到 3 亿词左右。这个数字与现代大模型相比,仍然小得惊人。

威尔科克斯形容,Claude 接触过的语言量,大致相当于一整座城市一代人所经历的语言总和。如果把训练现代大模型用过的文字全部打印出来,纸张堆起来可以超过国际空间站;而一个孩子青春期前接触的 1 亿个词,堆起来只有大约 20 米高。

因此,越来越多研究者开始尝试逆向工程儿童学习语言的方式。如果能够弄清楚孩子为何可以从有限经验中快速学习,也许就能设计出数据效率更高的 AI 模型。这不仅可能降低大模型对海量训练数据的依赖,也有助于视频学习、机器人学习,以及为数据稀缺的少数语言训练 AI 系统。

与此同时,AI 也正在反过来成为研究人类认知的实验工具。

科学家可以把关于儿童学习的不同理论写进模型,再观察它们是否真的能够从有限数据中学会语言。这或许有助于回答认知科学中长期存在的一些问题:人类是否天生拥有某种“语言本能”?仅凭经验,一个孩子能否学会语言?我们理解语言的方式,究竟源自人类特殊的生物结构,还是反映了某些更普遍的学习规律?

因此,孩子和大模型之间巨大的数据效率差距,表面上是一个 AI 工程问题,背后追问的却是一个更古老的问题:人类究竟是怎样学会语言的?



孩子为什么能用更少的数据学会语言?

大多数人只有在成年后学习第二语言时,才真正意识到语言有多难。过去完成时、卷舌音、鼻化元音、属格、短语动词,甚至名词阴阳性,都足以让人头疼。但孩子学习母语似乎轻松得多。幼儿通常只需要听过大约 1,000 万到 3,000 万个词,就开始说出符合语法的句子。“这简直像奇迹一样。”斯坦福大学认知科学家弗兰克说,“如果你只用 3,000 万词训练 GPT-2,得到的是一个胡言乱语生成器,而不是一个孩子。”

孩子究竟是怎么做到的,至今仍是一个谜。人类语言的句法并不简单。句子可以递归、嵌套,仅靠有限的词汇,人们就能组合出近乎无限的表达。问题在于,孩子实际接触到的语言只是其中很小一部分,却能够从有限输入中推断出背后的规则。

20 世纪 50 年代,MIT 语言学家诺姆·乔姆斯基(Noam Chomsky)对此提出了一个影响深远的解释:人类可能天生就具备某些语言规则。当时,心理学家 B.F. 斯金纳(B.F. Skinner)认为,语言主要依靠环境刺激、模仿和强化习得。乔姆斯基则提出著名的“刺激贫乏论(poverty of the stimulus)”:语言,尤其是句法结构如此复杂,而儿童接触到的样本又如此有限,仅凭经验似乎不足以解释他们为何能够掌握语法。

加州大学欧文分校语言学家理查德·富特雷尔(Richard Futrell)将乔姆斯基的核心观点概括为:语言不可能仅仅依靠统计规律学会。这一思想后来发展为“生成语法”,并长期主导美国语言学界,也影响了早期人工智能研究。20 世纪 50 至 60 年代,研究人员试图把语法规则直接写进计算机程序,让机器按照明确规则理解和生成语言。这种符号主义路线持续了几十年,却始终没能解决大规模自然语言处理问题。

真正的转折发生在神经网络重新兴起之后。进入 2010 年代,随着算力提升和互联网数据爆发,机器开始能够直接从海量文本中学习语言规律。2018 年和 2019 年,基于 Transformer 的 BERT 和 GPT-2 相继出现,证明大规模统计学习确实能够处理复杂语言。2022 年 ChatGPT 的成功,则让这一点变得更加明确。

大语言模型并不是人脑。它们没有人类大脑经过进化形成的生物学结构,本质上仍然是强大的统计学习系统。但恰恰是这种过去被认为“不可能真正学会语言”的系统,最终学会了句法,能够写诗、对话,并通过复杂的语法测试。

“无论你对 AI 多么怀疑,有一点大家都很惊讶:这些模型确实学会了语法。”加州大学伯克利分校发展心理学家艾莉森·戈普尼克(Alison Gopnik)说,“很多人此前并不认为,仅仅观察大量语言的统计规律,就能够推断出语法。”

这也让一个更关键的问题浮现出来:既然机器可以依靠海量数据学会语言,那么,如果只给它孩子实际接触到的数据量呢?能不能训练出一个只接触数千万词,却仍然真正掌握语言的“婴儿尺度”模型?



把大模型缩小到“婴儿尺度”

加州大学圣迭戈分校语言学家亚历克斯·沃斯塔特(Alex Warstadt)还记得 BERT 和 GPT-2 刚出现时,语言学界受到的冲击。2019 年,他还是纽约大学的博士生。语言模型仅靠大量文本就能学会英语,这件事本身已经对乔姆斯基式语言理论提出了挑战。但不少语言学家仍然怀疑,大语言模型究竟能不能帮助我们理解人类如何习得语言。最主要的质疑是:模型使用的数据实在太多了。

“过去几乎没有人在接近人类的数据规模上训练语言模型,更别说出现让人印象深刻的结果。”沃斯塔特说。但在他看来,这恰恰值得尝试。如果把关于儿童语言学习的不同假设放进模型,再观察它们在有限数据下究竟能学到什么,也许就能反过来检验这些理论。

2022 年,沃斯塔特与 AI 研究者莱舍姆·霍申(Leshem Choshen)等人发起了 BabyLM,一项专门研究“小数据语言学习”的年度竞赛。BabyLM 要求参赛模型只能使用接近儿童语言经验规模的数据:标准赛道是 1 亿词,幼儿尺度赛道只有 1000 万词。训练材料包括儿童读物、日常对话、电影字幕、维基百科,以及真实的亲子对话记录。

训练完成后,模型还要接受一系列类似心理语言学实验的语法测试。比如,研究者会给出一组只有动词单复数不同的句子。人读到不合语法的 “is” 时,会明显觉得不对;对于模型,研究者则用“惊异度(surprisal)”来判断,它是否也认为这个词出现在这里很反常。

BabyLM 已经推翻了一些原本很符合直觉的设想。比如“课程学习(curriculum learning)”:先让模型接触简单内容,再逐渐增加难度,就像孩子先听简单语言,再慢慢接触复杂表达。这个方法在第一届 BabyLM 中很受欢迎,但实际效果并没有预期的那么好。

波士顿大学计算机科学家亚伦·穆勒(Aaron Mueller)说,这种思路之所以吸引人,是因为它看起来很符合人类学习语言的过程,“但 Transformer 似乎并不需要按照这样的顺序安排数据,也能有效学习。”更有意思的是,目前表现最好的 BabyLM 模型,并没有刻意模仿婴儿。

2024 年的冠军模型 GPT-BERT 仍然是一个 Transformer:一部分像 GPT 一样预测下一个 token,一部分像 BERT 一样补全被遮挡的词。它只用大约 1 亿词训练,却在 BabyLM 的一项测试中超过了 Meta 的 Llama 2 70B,而后者使用的数据量约是它的 1.5 万倍。

当然,这并不意味着 BabyLM 已经追上了现代大模型。很多参赛模型甚至无法流畅生成文本,即使是 GPT-BERT,和今天的商业模型相比也仍然显得笨拙。更关键的问题在于:这些模型虽然拥有“婴儿尺度”的数据量,却并不是以婴儿的方式学习。孩子并不是只靠文字认识世界。他们同时在看、在听,也在不断和周围环境互动。所以,一些研究者开始认为,要真正缩小机器和儿童之间的数据效率差距,可能不能只研究如何“少读一些文本”,还要让模型开始像孩子一样,通过眼睛和耳朵认识世界。



从婴儿的第一视角看世界

大约 15 年前,弗兰克在斯坦福建立实验室时,研究人员其实还不太清楚,婴儿眼中的世界究竟是什么样。直到发展心理学家开始给孩子戴上头戴式摄像机,他们才第一次真正看到婴儿的日常视角。结果和成年人想象的很不一样。“孩子看到的世界要集中得多。”弗兰克说,“他们手臂很短,所以东西总是在眼前;而且他们生活在一片‘膝盖森林’里。”

弗兰克很快意识到,这些第一视角的视频不仅可以用来研究儿童,也可以拿来训练机器学习模型,检验孩子究竟如何从现实世界中学会语言。为此,他和同事启动了 SAYCam 项目,招募 3 名婴儿,在他们 6 个月到两岁半之间,每周记录约两小时的第一视角视频,并将这些数据公开。2024 年,普林斯顿大学认知科学家、AI 研究者布伦登·莱克(Brenden Lake)和团队用 61 小时 SAYCam 原始视频训练了一个模型,让它学习识别物体,并把物体和相应的词联系起来。

这项实验触及了发展心理学中的一个长期问题:孩子学习语言时,是否必须依赖某些先天偏好?例如,一种观点认为,婴儿第一次听到“shoe”时,会倾向于认为它指的是整只鞋,而不是鞋带这样的局部。但莱克团队并没有给模型预先加入这类规则,它依然学会了从视频中识别物体,并将它们与词语对应起来。“事实证明,仅靠比很多理论设想的少得多的东西,就已经可以开始学习语言。”莱克说。不过,他也强调,训练结束后,“我们并没有得到一个两岁的孩子”。

问题可能部分出在数据上。SAYCam 每周只能记录几个小时,而真实的孩子每天都在持续看、听、触摸,并与周围的人互动。研究者拿到的,要么只是一个孩子生活中很小的切片,要么是多个孩子零散数据的集合,与真实、连续的成长经历仍有很大差距。现在,这个限制正在开始松动。

普林斯顿大学神经科学家乌里·哈森(Uri Hasson)花了五年时间,记录 17 名儿童出生后前 1,000 天的生活。参与家庭在除卧室和浴室之外的生活区域安装摄像头和麦克风,几乎每天记录约 12 小时。如此庞大的视频和音频数据,过去几乎无法处理,而新的 AI 转录和视频分析工具让它第一次变得可行。“这是第一次,我们真正拥有了孩子所接受的输入。”哈森说,“而这还只是开始。”这也把问题往前推进了一步:要缩小机器和儿童之间的学习效率差距,模型可能不仅需要更少的数据,还需要获得更接近真实儿童的感官经验。



还缺了什么?

到目前为止,让模型通过视频学习语言,效果仍然有限。文本模型只要接触足够多的数据,就能表现得相当流利;但用儿童视频训练的多模态模型,还远没有达到这样的水平。莱克团队的模型目前只能学会“球”“猫”这类简单词汇,BabyLM 参赛者尝试把视觉信息加入训练,也没有带来明显提升。

加州大学伯克利分校发展心理学家戈普尼克认为,问题可能在于:孩子并不是被动地接收世界,而是在主动选择自己的学习经验。“孩子一直在探索,也一直在做实验。”她说。戈普尼克团队的研究发现,很多看似普通的儿童游戏,其实都是在学习因果关系。孩子会主动尝试不同的动作,观察世界如何回应,再一点点理解什么行为会带来什么结果。哈佛大学发展认知科学家伊丽莎白·博纳维茨(Elizabeth Bonawitz)还指出,孩子不仅会主动探索,也会意识到自己“还不知道什么”,并试着补上这些知识空白。更重要的是,他们是在社会环境中学习的。

她的研究发现,当孩子知道一个成年人是在有意“教自己”时,会用不同的方式理解信息。他们考虑的不只是“对方告诉了我什么”,还会判断“对方为什么要告诉我这些”。这和今天大多数模型的学习方式很不一样。模型通常是在相对孤立的环境中,被动接收已经准备好的数据。

因此,一些研究者开始设想:如果模型能够主动寻找信息、发现自己的知识盲区,尝试使用语言并观察其他“说话者”的反应,甚至在模拟的社会环境中学习,它们会不会学得更高效?去年的 BabyLM 已经允许模型通过与其他模型互动来学习,但目前这类“社交模型”的表现还没有超过传统方法。

在头部 AI 实验室中,Meta 对儿童学习方式表现出了比较明显的兴趣,尤其是在视频训练方面。Meta 研究人员参与了 BabyLM 的多模态赛道,还与弗兰克等学者推出了新的基准,用来研究模型如何从婴儿第一视角视频中学习。不过整体来看,前沿 AI 实验室还没有大规模转向模仿儿童学习。戈普尼克认为,真正吸收发展心理学经验的,可能会是 Transformer 之后的下一代 AI 架构。

机器学习领域长期以来更关心“什么方法有效”,而不是复刻人脑本身。但对数据效率的关注正在上升。2026 年 3 月,Q Labs 推出的 NanoGPT Slowrun benchmark 就和 BabyLM 有着相似目标,只是不再强调儿童语言习得,而是把问题直接落在数据效率上。

这件事也有很现实的意义。沃斯塔特希望,更高的数据效率能够降低 AI 的训练门槛,让没有巨额算力和数据资源的大学、研究机构,也能训练出有竞争力的模型。GPT-BERT 的设计者之一、奥斯陆大学机器学习研究员大卫·塞缪尔(David Samuel),则更关心小语种。和英语相比,捷克语、挪威语等语言可用于训练模型的数据要少得多,一些萨米语甚至只有数千万 token,差不多就是一个幼儿接触语言的规模。“问题是,”他说,“我们怎么才能让这些小语种,也拥有和英语模型一样强的语言模型?”

但缩小数据效率鸿沟最吸引人的地方,或许还不只是让 AI 变得更便宜,而是帮助我们重新理解人类自己。博纳维茨一开始也怀疑,大语言模型究竟能不能告诉我们多少关于人类认知的事情。毕竟,大脑和 LLM 差异巨大:人有身体,神经元是活细胞,大脑会随着学习和年龄不断变化,而大模型通常在预训练完成后就基本固定下来。

但她后来开始改变看法。与其把模型当成人脑的复制品,不如把它看成一种新的比较对象,就像比较心理学家通过研究动物来理解人类心智一样。

沃斯塔特、弗兰克、威尔科克斯、莱克和哈森等研究者,已经开始把语言模型当作一种“语言实验对象”。研究人员可以在人类儿童身上无法进行的实验中操纵模型,比如改变它接触两种语言的比例,或者完全不让它接触某一类语法结构,再观察它最终学会了什么。

富特雷尔打了一个很形象的比方:这有点像教一个外星人学会人类语言,然后打开它的大脑,看看里面到底发生了什么。过去,人类一直是唯一能够使用复杂语言进行对话的存在。现在,第一次出现了另一种既不是人、也不是动物的“语言使用者”。正如沃斯塔特所说,大语言模型第一次不只是一种 language model,也开始成为研究语言的一种“模式生物(model organism)”。

https://www.technologyreview.com/2026/08/24/1141740/kids-machines-language-learning/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彩票出现断崖式暴跌,暴跌1700亿!“2元中500万”为什么没人信了?

彩票出现断崖式暴跌,暴跌1700亿!“2元中500万”为什么没人信了?

青眼财经
2026-09-03 19:32:22
一字跌停,超50万封单,爆炒“立案调查股”,现在谁都出不去!

一字跌停,超50万封单,爆炒“立案调查股”,现在谁都出不去!

财经智多星
2026-09-03 13:27:00
普京:希望结束战争而非临时冻结,俄方随时准备与任何愿意参与谈判的人进行谈判

普京:希望结束战争而非临时冻结,俄方随时准备与任何愿意参与谈判的人进行谈判

每日经济新闻
2026-09-02 21:47:42
重创:乌克兰对俄罗斯空域发动绞杀战!莫斯科近百架航班取消

重创:乌克兰对俄罗斯空域发动绞杀战!莫斯科近百架航班取消

项鹏飞
2026-09-02 19:26:59
美国炸鸡巨头中国首店开业:90元一桶、日均八九百单,代排费炒至150元

美国炸鸡巨头中国首店开业:90元一桶、日均八九百单,代排费炒至150元

蓝鲸新闻
2026-08-31 18:12:13
央视直播美网第二轮时间表!9月4日,郑钦文,布云朝克特冲击32强

央视直播美网第二轮时间表!9月4日,郑钦文,布云朝克特冲击32强

薇说体育
2026-09-03 15:38:07
38岁技术总监被辞仅得7万,秒退所有工作群,次日231个未接来电

38岁技术总监被辞仅得7万,秒退所有工作群,次日231个未接来电

磊子讲史
2025-06-21 14:14:16
9100万用户流失!百度的搜索帝国,正在塌陷

9100万用户流失!百度的搜索帝国,正在塌陷

大佬灼见
2026-09-02 15:53:06
救母骨髓配型发现非亲生,女子崩溃发帖求助:我从哪里来

救母骨髓配型发现非亲生,女子崩溃发帖求助:我从哪里来

扬子晚报
2026-09-02 22:17:30
“是个“狠人”!27岁小伙用筋膜枪震腰近半小时排出结石,医生:但他的肾脏破裂了

“是个“狠人”!27岁小伙用筋膜枪震腰近半小时排出结石,医生:但他的肾脏破裂了

小强热线
2026-09-02 20:59:25
大量照片和聊天记录流出!孙宇晨和景甜的瓜彻底反转了

大量照片和聊天记录流出!孙宇晨和景甜的瓜彻底反转了

七阿姨爱八卦
2026-09-02 08:54:10
世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

扶苏聊历史
2026-09-02 18:25:39
网传“贵州秋假连着中秋国庆连休13天?”辟谣→

网传“贵州秋假连着中秋国庆连休13天?”辟谣→

环球网资讯
2026-09-03 19:26:12
这才是DLSS 5的正确用法:美乳性感女主更吸睛了

这才是DLSS 5的正确用法:美乳性感女主更吸睛了

游民星空
2026-09-02 17:13:47
黄渤意外受伤,本人发声

黄渤意外受伤,本人发声

南方都市报
2026-09-03 21:26:27
《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

3DM游戏
2026-08-29 11:32:21
四川绵阳市北川县附近发生5.2级左右地震

四川绵阳市北川县附近发生5.2级左右地震

新京报
2026-09-03 19:47:26
日本高中职员约少女情趣酒店找乐子,警察到场傻眼了,发现50具尸体遭逮捕。。

日本高中职员约少女情趣酒店找乐子,警察到场傻眼了,发现50具尸体遭逮捕。。

日本物语
2026-09-02 22:02:36
莫言:动不动就发火的人,没有一个是智者——生活多半过得一团糟糕

莫言:动不动就发火的人,没有一个是智者——生活多半过得一团糟糕

杏花烟雨江南的碧园
2026-09-03 14:15:03
中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

细说职场
2026-09-02 19:22:46
2026-09-03 23:15:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17185文章数 515199关注度
往期回顾 全部

教育要闻

广东海洋大学27年保研290人,滨海农业学院领跑,海洋与气象学院最抢眼

头条要闻

尼旅游部长呼吁外国游客来旅游:洪水只影响部分地区

头条要闻

尼旅游部长呼吁外国游客来旅游:洪水只影响部分地区

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

科技要闻

英伟达129亿美元拿下Hugging Face

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

房产
教育
亲子
家居
军事航空

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

教育要闻

华中农业大学举行2026研究生开学典礼

亲子要闻

试管婴儿与妈妈打过的800多针合影,看过的人都沉默了…

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版