网易首页 > 网易号 > 正文 申请入驻

孩子只听几千万个词就能学会语言,大模型为什么做不到?

0
分享至


(来源:麻省理工科技评论)

据我们目前所知,人类彼此交谈至少已有 10 万年。在这漫长的时间里,世界上只有一种存在,能够把人类语言学到近乎完美流利:人类的孩子。

现在,出现了第二种。ChatGPT 发布不过四年,我们已经习惯了与手机和电脑自然对话。Claude、DeepSeek 和 ChatGPT 等大语言模型,语言能力已经足够流畅,甚至可以相当逼真地模拟人类交流。

但问题在于,机器学会语言所需要的数据,远远超过人类。一个大语言模型在训练中接触的文字量,可以达到一个人学习母语过程中所接触语言量的数万乃至数十万倍。而孩子通常在一岁左右,就已经开始掌握语言。

斯坦福大学认知科学家迈克尔·C·弗兰克(Michael C. Frank)用一个夸张但形象的比喻形容这种差距:“我们仍然需要烧掉一整片森林、刮遍人类知识的全部积累,才能在机器上重现一个孩子在客厅里一年左右就能完成的发展里程碑。”这种差距被称为数据效率鸿沟(data efficiency gap)。它提出了一个同时困扰认知科学家和 AI 研究者的问题:为什么孩子能够用如此有限的数据,学会如此复杂的语言?

过去十年,大语言模型能力提升的一条核心路径,就是不断扩大模型和训练数据规模。Meta 两年前发布的 Llama 3.1,在预训练阶段使用了 15 万亿个 token。乔治城大学认知科学家、语言学家伊桑·戈特利布·威尔科克斯(Ethan Gotlieb Wilcox)估计,最前沿模型使用的数据量可能还要高出一个数量级。

但互联网数据终究有限。随着高质量文本逐渐被消耗,可供模型继续扩张的数据资源可能在未来十年开始逼近瓶颈。孩子却提供了另一种可能。一个成长在语言环境丰富家庭里的孩子,到青春期前大约会听到 1 亿个词;如果加上阅读,到 20 岁时接触的语言总量可能达到 3 亿词左右。这个数字与现代大模型相比,仍然小得惊人。

威尔科克斯形容,Claude 接触过的语言量,大致相当于一整座城市一代人所经历的语言总和。如果把训练现代大模型用过的文字全部打印出来,纸张堆起来可以超过国际空间站;而一个孩子青春期前接触的 1 亿个词,堆起来只有大约 20 米高。

因此,越来越多研究者开始尝试逆向工程儿童学习语言的方式。如果能够弄清楚孩子为何可以从有限经验中快速学习,也许就能设计出数据效率更高的 AI 模型。这不仅可能降低大模型对海量训练数据的依赖,也有助于视频学习、机器人学习,以及为数据稀缺的少数语言训练 AI 系统。

与此同时,AI 也正在反过来成为研究人类认知的实验工具。

科学家可以把关于儿童学习的不同理论写进模型,再观察它们是否真的能够从有限数据中学会语言。这或许有助于回答认知科学中长期存在的一些问题:人类是否天生拥有某种“语言本能”?仅凭经验,一个孩子能否学会语言?我们理解语言的方式,究竟源自人类特殊的生物结构,还是反映了某些更普遍的学习规律?

因此,孩子和大模型之间巨大的数据效率差距,表面上是一个 AI 工程问题,背后追问的却是一个更古老的问题:人类究竟是怎样学会语言的?



孩子为什么能用更少的数据学会语言?

大多数人只有在成年后学习第二语言时,才真正意识到语言有多难。过去完成时、卷舌音、鼻化元音、属格、短语动词,甚至名词阴阳性,都足以让人头疼。但孩子学习母语似乎轻松得多。幼儿通常只需要听过大约 1,000 万到 3,000 万个词,就开始说出符合语法的句子。“这简直像奇迹一样。”斯坦福大学认知科学家弗兰克说,“如果你只用 3,000 万词训练 GPT-2,得到的是一个胡言乱语生成器,而不是一个孩子。”

孩子究竟是怎么做到的,至今仍是一个谜。人类语言的句法并不简单。句子可以递归、嵌套,仅靠有限的词汇,人们就能组合出近乎无限的表达。问题在于,孩子实际接触到的语言只是其中很小一部分,却能够从有限输入中推断出背后的规则。

20 世纪 50 年代,MIT 语言学家诺姆·乔姆斯基(Noam Chomsky)对此提出了一个影响深远的解释:人类可能天生就具备某些语言规则。当时,心理学家 B.F. 斯金纳(B.F. Skinner)认为,语言主要依靠环境刺激、模仿和强化习得。乔姆斯基则提出著名的“刺激贫乏论(poverty of the stimulus)”:语言,尤其是句法结构如此复杂,而儿童接触到的样本又如此有限,仅凭经验似乎不足以解释他们为何能够掌握语法。

加州大学欧文分校语言学家理查德·富特雷尔(Richard Futrell)将乔姆斯基的核心观点概括为:语言不可能仅仅依靠统计规律学会。这一思想后来发展为“生成语法”,并长期主导美国语言学界,也影响了早期人工智能研究。20 世纪 50 至 60 年代,研究人员试图把语法规则直接写进计算机程序,让机器按照明确规则理解和生成语言。这种符号主义路线持续了几十年,却始终没能解决大规模自然语言处理问题。

真正的转折发生在神经网络重新兴起之后。进入 2010 年代,随着算力提升和互联网数据爆发,机器开始能够直接从海量文本中学习语言规律。2018 年和 2019 年,基于 Transformer 的 BERT 和 GPT-2 相继出现,证明大规模统计学习确实能够处理复杂语言。2022 年 ChatGPT 的成功,则让这一点变得更加明确。

大语言模型并不是人脑。它们没有人类大脑经过进化形成的生物学结构,本质上仍然是强大的统计学习系统。但恰恰是这种过去被认为“不可能真正学会语言”的系统,最终学会了句法,能够写诗、对话,并通过复杂的语法测试。

“无论你对 AI 多么怀疑,有一点大家都很惊讶:这些模型确实学会了语法。”加州大学伯克利分校发展心理学家艾莉森·戈普尼克(Alison Gopnik)说,“很多人此前并不认为,仅仅观察大量语言的统计规律,就能够推断出语法。”

这也让一个更关键的问题浮现出来:既然机器可以依靠海量数据学会语言,那么,如果只给它孩子实际接触到的数据量呢?能不能训练出一个只接触数千万词,却仍然真正掌握语言的“婴儿尺度”模型?



把大模型缩小到“婴儿尺度”

加州大学圣迭戈分校语言学家亚历克斯·沃斯塔特(Alex Warstadt)还记得 BERT 和 GPT-2 刚出现时,语言学界受到的冲击。2019 年,他还是纽约大学的博士生。语言模型仅靠大量文本就能学会英语,这件事本身已经对乔姆斯基式语言理论提出了挑战。但不少语言学家仍然怀疑,大语言模型究竟能不能帮助我们理解人类如何习得语言。最主要的质疑是:模型使用的数据实在太多了。

“过去几乎没有人在接近人类的数据规模上训练语言模型,更别说出现让人印象深刻的结果。”沃斯塔特说。但在他看来,这恰恰值得尝试。如果把关于儿童语言学习的不同假设放进模型,再观察它们在有限数据下究竟能学到什么,也许就能反过来检验这些理论。

2022 年,沃斯塔特与 AI 研究者莱舍姆·霍申(Leshem Choshen)等人发起了 BabyLM,一项专门研究“小数据语言学习”的年度竞赛。BabyLM 要求参赛模型只能使用接近儿童语言经验规模的数据:标准赛道是 1 亿词,幼儿尺度赛道只有 1000 万词。训练材料包括儿童读物、日常对话、电影字幕、维基百科,以及真实的亲子对话记录。

训练完成后,模型还要接受一系列类似心理语言学实验的语法测试。比如,研究者会给出一组只有动词单复数不同的句子。人读到不合语法的 “is” 时,会明显觉得不对;对于模型,研究者则用“惊异度(surprisal)”来判断,它是否也认为这个词出现在这里很反常。

BabyLM 已经推翻了一些原本很符合直觉的设想。比如“课程学习(curriculum learning)”:先让模型接触简单内容,再逐渐增加难度,就像孩子先听简单语言,再慢慢接触复杂表达。这个方法在第一届 BabyLM 中很受欢迎,但实际效果并没有预期的那么好。

波士顿大学计算机科学家亚伦·穆勒(Aaron Mueller)说,这种思路之所以吸引人,是因为它看起来很符合人类学习语言的过程,“但 Transformer 似乎并不需要按照这样的顺序安排数据,也能有效学习。”更有意思的是,目前表现最好的 BabyLM 模型,并没有刻意模仿婴儿。

2024 年的冠军模型 GPT-BERT 仍然是一个 Transformer:一部分像 GPT 一样预测下一个 token,一部分像 BERT 一样补全被遮挡的词。它只用大约 1 亿词训练,却在 BabyLM 的一项测试中超过了 Meta 的 Llama 2 70B,而后者使用的数据量约是它的 1.5 万倍。

当然,这并不意味着 BabyLM 已经追上了现代大模型。很多参赛模型甚至无法流畅生成文本,即使是 GPT-BERT,和今天的商业模型相比也仍然显得笨拙。更关键的问题在于:这些模型虽然拥有“婴儿尺度”的数据量,却并不是以婴儿的方式学习。孩子并不是只靠文字认识世界。他们同时在看、在听,也在不断和周围环境互动。所以,一些研究者开始认为,要真正缩小机器和儿童之间的数据效率差距,可能不能只研究如何“少读一些文本”,还要让模型开始像孩子一样,通过眼睛和耳朵认识世界。



从婴儿的第一视角看世界

大约 15 年前,弗兰克在斯坦福建立实验室时,研究人员其实还不太清楚,婴儿眼中的世界究竟是什么样。直到发展心理学家开始给孩子戴上头戴式摄像机,他们才第一次真正看到婴儿的日常视角。结果和成年人想象的很不一样。“孩子看到的世界要集中得多。”弗兰克说,“他们手臂很短,所以东西总是在眼前;而且他们生活在一片‘膝盖森林’里。”

弗兰克很快意识到,这些第一视角的视频不仅可以用来研究儿童,也可以拿来训练机器学习模型,检验孩子究竟如何从现实世界中学会语言。为此,他和同事启动了 SAYCam 项目,招募 3 名婴儿,在他们 6 个月到两岁半之间,每周记录约两小时的第一视角视频,并将这些数据公开。2024 年,普林斯顿大学认知科学家、AI 研究者布伦登·莱克(Brenden Lake)和团队用 61 小时 SAYCam 原始视频训练了一个模型,让它学习识别物体,并把物体和相应的词联系起来。

这项实验触及了发展心理学中的一个长期问题:孩子学习语言时,是否必须依赖某些先天偏好?例如,一种观点认为,婴儿第一次听到“shoe”时,会倾向于认为它指的是整只鞋,而不是鞋带这样的局部。但莱克团队并没有给模型预先加入这类规则,它依然学会了从视频中识别物体,并将它们与词语对应起来。“事实证明,仅靠比很多理论设想的少得多的东西,就已经可以开始学习语言。”莱克说。不过,他也强调,训练结束后,“我们并没有得到一个两岁的孩子”。

问题可能部分出在数据上。SAYCam 每周只能记录几个小时,而真实的孩子每天都在持续看、听、触摸,并与周围的人互动。研究者拿到的,要么只是一个孩子生活中很小的切片,要么是多个孩子零散数据的集合,与真实、连续的成长经历仍有很大差距。现在,这个限制正在开始松动。

普林斯顿大学神经科学家乌里·哈森(Uri Hasson)花了五年时间,记录 17 名儿童出生后前 1,000 天的生活。参与家庭在除卧室和浴室之外的生活区域安装摄像头和麦克风,几乎每天记录约 12 小时。如此庞大的视频和音频数据,过去几乎无法处理,而新的 AI 转录和视频分析工具让它第一次变得可行。“这是第一次,我们真正拥有了孩子所接受的输入。”哈森说,“而这还只是开始。”这也把问题往前推进了一步:要缩小机器和儿童之间的学习效率差距,模型可能不仅需要更少的数据,还需要获得更接近真实儿童的感官经验。



还缺了什么?

到目前为止,让模型通过视频学习语言,效果仍然有限。文本模型只要接触足够多的数据,就能表现得相当流利;但用儿童视频训练的多模态模型,还远没有达到这样的水平。莱克团队的模型目前只能学会“球”“猫”这类简单词汇,BabyLM 参赛者尝试把视觉信息加入训练,也没有带来明显提升。

加州大学伯克利分校发展心理学家戈普尼克认为,问题可能在于:孩子并不是被动地接收世界,而是在主动选择自己的学习经验。“孩子一直在探索,也一直在做实验。”她说。戈普尼克团队的研究发现,很多看似普通的儿童游戏,其实都是在学习因果关系。孩子会主动尝试不同的动作,观察世界如何回应,再一点点理解什么行为会带来什么结果。哈佛大学发展认知科学家伊丽莎白·博纳维茨(Elizabeth Bonawitz)还指出,孩子不仅会主动探索,也会意识到自己“还不知道什么”,并试着补上这些知识空白。更重要的是,他们是在社会环境中学习的。

她的研究发现,当孩子知道一个成年人是在有意“教自己”时,会用不同的方式理解信息。他们考虑的不只是“对方告诉了我什么”,还会判断“对方为什么要告诉我这些”。这和今天大多数模型的学习方式很不一样。模型通常是在相对孤立的环境中,被动接收已经准备好的数据。

因此,一些研究者开始设想:如果模型能够主动寻找信息、发现自己的知识盲区,尝试使用语言并观察其他“说话者”的反应,甚至在模拟的社会环境中学习,它们会不会学得更高效?去年的 BabyLM 已经允许模型通过与其他模型互动来学习,但目前这类“社交模型”的表现还没有超过传统方法。

在头部 AI 实验室中,Meta 对儿童学习方式表现出了比较明显的兴趣,尤其是在视频训练方面。Meta 研究人员参与了 BabyLM 的多模态赛道,还与弗兰克等学者推出了新的基准,用来研究模型如何从婴儿第一视角视频中学习。不过整体来看,前沿 AI 实验室还没有大规模转向模仿儿童学习。戈普尼克认为,真正吸收发展心理学经验的,可能会是 Transformer 之后的下一代 AI 架构。

机器学习领域长期以来更关心“什么方法有效”,而不是复刻人脑本身。但对数据效率的关注正在上升。2026 年 3 月,Q Labs 推出的 NanoGPT Slowrun benchmark 就和 BabyLM 有着相似目标,只是不再强调儿童语言习得,而是把问题直接落在数据效率上。

这件事也有很现实的意义。沃斯塔特希望,更高的数据效率能够降低 AI 的训练门槛,让没有巨额算力和数据资源的大学、研究机构,也能训练出有竞争力的模型。GPT-BERT 的设计者之一、奥斯陆大学机器学习研究员大卫·塞缪尔(David Samuel),则更关心小语种。和英语相比,捷克语、挪威语等语言可用于训练模型的数据要少得多,一些萨米语甚至只有数千万 token,差不多就是一个幼儿接触语言的规模。“问题是,”他说,“我们怎么才能让这些小语种,也拥有和英语模型一样强的语言模型?”

但缩小数据效率鸿沟最吸引人的地方,或许还不只是让 AI 变得更便宜,而是帮助我们重新理解人类自己。博纳维茨一开始也怀疑,大语言模型究竟能不能告诉我们多少关于人类认知的事情。毕竟,大脑和 LLM 差异巨大:人有身体,神经元是活细胞,大脑会随着学习和年龄不断变化,而大模型通常在预训练完成后就基本固定下来。

但她后来开始改变看法。与其把模型当成人脑的复制品,不如把它看成一种新的比较对象,就像比较心理学家通过研究动物来理解人类心智一样。

沃斯塔特、弗兰克、威尔科克斯、莱克和哈森等研究者,已经开始把语言模型当作一种“语言实验对象”。研究人员可以在人类儿童身上无法进行的实验中操纵模型,比如改变它接触两种语言的比例,或者完全不让它接触某一类语法结构,再观察它最终学会了什么。

富特雷尔打了一个很形象的比方:这有点像教一个外星人学会人类语言,然后打开它的大脑,看看里面到底发生了什么。过去,人类一直是唯一能够使用复杂语言进行对话的存在。现在,第一次出现了另一种既不是人、也不是动物的“语言使用者”。正如沃斯塔特所说,大语言模型第一次不只是一种 language model,也开始成为研究语言的一种“模式生物(model organism)”。

https://www.technologyreview.com/2026/08/24/1141740/kids-machines-language-learning/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一脸狰狞,表情油腻,还硬在央视剧集演刑警,网友称真不害臊吗?

一脸狰狞,表情油腻,还硬在央视剧集演刑警,网友称真不害臊吗?

往史过眼云烟
2026-08-24 09:39:16
广东正式官宣!杜锋出任总教练,朱芳雨转任荣誉顾问,宏远迎来新时代

广东正式官宣!杜锋出任总教练,朱芳雨转任荣誉顾问,宏远迎来新时代

多特体育说
2026-08-24 20:35:45
听听恒大前员工心里话:真实的许家印,和你想的完全不一样

听听恒大前员工心里话:真实的许家印,和你想的完全不一样

花小猫的美食日常
2026-08-23 05:03:59
周琦落选亚运男篮名单引热议,记者:无伤病且积极恢复,渴望为国效力

周琦落选亚运男篮名单引热议,记者:无伤病且积极恢复,渴望为国效力

赛场速报局
2026-08-24 12:44:53
北大教授梁建章建议,暂时找不到工作的年轻人,可以先结婚生孩子

北大教授梁建章建议,暂时找不到工作的年轻人,可以先结婚生孩子

米果说识
2026-08-24 09:34:20
前队友韦斯特:詹姆斯和他妈妈会打电话来关心我 鼓励我振作起来

前队友韦斯特:詹姆斯和他妈妈会打电话来关心我 鼓励我振作起来

罗说NBA
2026-08-24 20:50:55
“无座票为何和二等座同价”,12306回应:无座票全称为“无固定座位票”,与二等座属于同一席别、同一等级,目前无法单独降低无座票票价

“无座票为何和二等座同价”,12306回应:无座票全称为“无固定座位票”,与二等座属于同一席别、同一等级,目前无法单独降低无座票票价

都市快报橙柿互动
2026-08-24 12:43:58
订单接到手软!98年姑娘月进账18万元,凌晨四点就起床开工,“欠了几万个没发货”

订单接到手软!98年姑娘月进账18万元,凌晨四点就起床开工,“欠了几万个没发货”

台州交通广播
2026-08-22 19:07:31
“甲醛白菜”报应来了!已经发不出去货了,为这个男人点赞!

“甲醛白菜”报应来了!已经发不出去货了,为这个男人点赞!

皮蛋儿电影
2026-08-24 12:21:08
卓伟曝大瓜!疑似朴树婚内出轨后净身出户,周迅被牵连,扯出5角恋

卓伟曝大瓜!疑似朴树婚内出轨后净身出户,周迅被牵连,扯出5角恋

180视角
2026-08-24 22:37:00
闹大了!扶老人反被索赔,协议书内容曝光,媒体发声:一万九人道赔偿款哪有“人道”

闹大了!扶老人反被索赔,协议书内容曝光,媒体发声:一万九人道赔偿款哪有“人道”

Mr王的饭后茶
2026-08-24 19:00:37
20.7万!特斯拉新车突然官宣:9月3日 ,正式发布

20.7万!特斯拉新车突然官宣:9月3日 ,正式发布

科技堡垒
2026-08-24 12:23:17
好心施救反赔1.9万元!湖南老人进店休息离世索赔事件,律师解读争议

好心施救反赔1.9万元!湖南老人进店休息离世索赔事件,律师解读争议

新民周刊
2026-08-24 18:59:39
直落三局胜出!中国女排3-0完胜伊朗队,夺亚锦赛小组赛两连胜

直落三局胜出!中国女排3-0完胜伊朗队,夺亚锦赛小组赛两连胜

全景体育V
2026-08-24 20:56:39
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
向太回应“是否有可能和周星驰相逢一笑泯恩仇”:“有可能,但做回好朋友是不可能的”

向太回应“是否有可能和周星驰相逢一笑泯恩仇”:“有可能,但做回好朋友是不可能的”

韩小娱
2026-08-24 20:03:16
全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

文刀贰
2026-08-24 18:09:23
关税战打到最后,全世界会发现,折腾了半天,中美关税是10%

关税战打到最后,全世界会发现,折腾了半天,中美关税是10%

福建睿平
2026-08-24 07:47:30
拳王邹市明自曝:去年投入到直播行业,一天站10个小时,不到5个月拿了公司的劳模奖

拳王邹市明自曝:去年投入到直播行业,一天站10个小时,不到5个月拿了公司的劳模奖

韩小娱
2026-08-23 09:07:25
宇树回应机器人运动会百米预赛小组垫底:很遗憾,精力主要集中在‌量产产品‌的研发与交付

宇树回应机器人运动会百米预赛小组垫底:很遗憾,精力主要集中在‌量产产品‌的研发与交付

齐鲁壹点
2026-08-24 10:51:13
2026-08-25 00:28:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17132文章数 515197关注度
往期回顾 全部

教育要闻

建邺区高中军训进行时:烈日下的青春,最挺拔

头条要闻

一家自驾3500公里送娃报到 "送子求学"淋成"逆子求学"

头条要闻

一家自驾3500公里送娃报到 "送子求学"淋成"逆子求学"

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

科技要闻

宇树科技,3天跌了1000亿

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

教育
本地
游戏
家居
亲子

教育要闻

足启新程逐绿茵,筑梦少年绽芳华!2026年济南市校园足球夏令营圆满举办

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

《GTA6》黑客投票结果遭篡改?国外玩家炸锅

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

四个比赛项目,四种协作模式 这项亲子水上嘉年华“划”出不一样的夏日欢乐

无障碍浏览 进入关怀版