你可能也好奇过:为什么一个三四岁的小孩,不用背单词、不用刷题库,就能叽里呱啦说出一口流利的母语?而咱们手里那些动辄烧掉几千万度电、吞下整个互联网的AI大模型,学说话却要"吃"掉海量数据,还时不时冒出几句让人哭笑不得的"AI味"中文。
这事儿,科学家最近又拿出来念叨了一遍,而且越念叨越觉得不可思议:人类小孩在语言学习这件事上,居然把目前最聪明的人工智能按在地上摩擦。更扎心的是,他们至今没完全搞明白,孩子到底是怎么做到的。
![]()
数据效率差距:AI的"笨办法"
![]()
先说个概念,这叫"数据效率差距"。什么意思呢?就是说,人类小孩和AI大模型在学会一门语言这件事上,消耗的"学习资料"数量,差了得有十万八千里。
一个大型语言模型,比如Meta开源的Llama 3.1,在预训练阶段就"啃"掉了15万亿个token(你可以理解成词块)。而一个在语言环境丰富的家庭里长大的孩子,到青春期可能也就听过1亿个词左右。就算加上阅读量,到20岁撑死也就3亿词。
这差距有多大?斯坦福大学的认知科学家迈克尔·弗兰克打了个比方:为了复现一个小孩在自家客厅里、用一年时间就完成的语言里程碑,AI得"烧掉一片森林,刮走全人类知识的总和"。
乔治城大学的认知科学家和语言学家伊桑·戈特利布·威尔科克斯则说,如果把训练现代大语言模型用到的所有文字打印出来,堆成的纸堆能超过国际空间站的高度。而一个孩子听到的1亿个词,摞起来大概也就20米高。
AI的"饭量"与人类的"天赋"
过去十年,语言模型变聪明的主要方式,就是变大、变胖、吃得更多。前沿模型可能在预训练时用了比Llama 3.1多10倍的数据。但问题来了:互联网上能用的公开数据就那么多,照这个吃法,可能到2030年代,AI就要"断粮"了。
而小孩呢?他们用少得可怜的数据,就完成了对语言的完美掌握。人类互相说话至少10万年了,在这漫长的历史里,世界上唯一能把一门人类语言学到完美流利程度的,就是人类小孩。
![]()
这不禁让人想问:孩子到底有什么"独门秘籍"?
科学家想"偷师",但还没偷到
既然孩子这么厉害,那科学家当然想反向工程,看看能不能从孩子的学习方法里,给AI找条新路。如果能搞清楚孩子是怎么用这么少的数据学会语言的,那AI的训练效率说不定能提升好几个数量级。
但现实是,这个"秘籍"目前还是个黑匣子。弗兰克教授承认,AI的进展确实惊人,但代价也惊人。威尔科克斯教授也感叹,Claude见过的语言量,相当于一座城市整整一代人说的话。
所以,现在的局面有点尴尬:机器在语言上表现得越来越像人,但学习方式却一点也不像人。我们造出了能聊天的AI,却依然没弄明白,自家那个流着口水、话都说不利索的小家伙,是怎么轻松赢过这些庞然大物的。
这大概就是科学的魅力吧——总有些最日常的现象,藏着最深的谜题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.