![]()
想象一下,你养了一个孩子,从出生起就只让他读小学课本,从来不让他碰任何超纲的书。他会不会自己偷偷学会微积分?会不会某天突然懂了量子力学?
这个问题听起来有点荒诞,但如果把"孩子"换成"语言模型",这其实是一个非常严肃的科学问题。
现在的大语言模型都是在整个互联网上训练出来的。它们读过维基百科、读过学术论文、读过网络论坛里从初中数学题到量子场论的一切内容。这就带来一个麻烦:当你想知道一个模型到底"学会了"什么、又是怎么学会的,你根本没法确定它以前有没有见过类似的东西。
这不是一个无关紧要的细节问题。
举个例子,如果你想测试一个模型能不能通过强化学习学会新的数学推理能力,但这个模型的训练数据里本来就混杂了海量数学论坛帖子,你怎么知道它展现出来的"推理能力提升",到底是真的学会了新东西,还是仅仅把训练数据里本来就有的答案给"背"出来了?
这个问题在学术界已经争论了很久。已经有研究发现,很多所谓的"强化学习带来的推理能力提升",其实只是把预训练阶段已经潜藏的知识给重新激活了,并没有真正产生新能力。还有研究显示,如果不小心让模型在训练时接触过和测试题类似的内容,评测分数会被严重灌水,让人误以为模型能力"涌现"了,实际上只是背题背多了。
这就是这篇论文想解决的核心问题:怎么才能确切知道一个模型"见过"什么、"没见过"什么?
把整个互联网上的知识边界,砍到小学五年级
以往学术界解决这个问题的思路,大多是从考试出题的角度下手。既然不知道模型训练时见过什么,那我就出一些足够刁钻、足够新的题目,让模型没法靠"背"来蒙混过关。像GPQA、Humanity's Last Exam这些高难度评测集,走的都是这个路子。
但这个思路有个绕不开的天花板:你永远不知道模型的训练数据里到底藏了什么。
出题人今天觉得这道题够新颖,但没准哪个网络角落早就讨论过类似的题目,模型可能早就"偷看"过答案了。而且,随着越来越多的题目被公开讨论,今天新颖的题目,明天可能就不新颖了,你得不断地出新题、换题库,跟模型的"记忆力"打地鼠游戏。
这篇论文的团队换了一个思路:与其在考试出题上做文章,不如直接控制模型能看到的教材。
这就好比,与其在孩子长大后不断出新题来判断他是不是提前偷看过答案,不如干脆从小就把他关在一个只有小学课本的房间里长大,这样他会什么、不会什么,一目了然,根本不需要猜。如果不这么做,你面对的永远是一个黑箱:模型给出了一个惊艳的回答,你却永远说不清楚这是它自己"悟"出来的,还是它曾经在某个网页上刷到过一模一样的答案。
于是研究团队做了一件事:他们从一个叫FineWeb-Edu的88B token的网络教育文本大语料库里,用一套多阶段过滤流程,专门筛出只符合美国小学(K到五年级,也就是通常说的K-5)课程标准的内容,构建出一个叫LittleCurriculum的88B token纯净语料库,然后用它从零训练出一个5B参数的语言模型,取名叫LittleLearner。
K-5*:美国教育体系里的"幼儿园到五年级"阶段,大致对应中国的学前班到小学五年级,是这篇论文划定的知识边界。
这个模型从没见过任何超出小学范围的内容,包括高中数学、大学物理、专业术语,甚至一些复杂的历史事件。团队想看看的是:在这样一个知识边界完全透明、完全可控的沙盒里,模型的能力增长到底是怎么发生的。
怎么从互联网里"洗"出一个干净的小学生
说起来容易,做起来极难。
FineWeb-Edu*:由HuggingFace团队发布的一个网络教育内容数据集,是从更大规模的网络爬虫语料中筛选出的教育相关文本,常被用作语言模型预训练的高质量数据源。
网络文本是极度混乱的,一篇讲"猫是哺乳动物"的科普短文,和一篇讨论量子力学的论坛帖子,可能长得差不多,都是几百字的说明性文字。你要怎么用程序自动区分"这是小学知识"还是"这是大学知识"?
研究团队设计了一条五级过滤流水线,一层一层往下筛。
第一层叫年龄习得预过滤,用的是一个叫Age-of-Acquisition(AoA)的语言学指标。
Age-of-Acquisition(AoA)*:心理语言学中的一个指标,衡量一个单词通常是在人生的哪个年龄段被学会的。比如"猫"这个词可能3岁就学会了,而"量子"这个词可能要到十几岁甚至更晚才接触到。
研究团队测试了好几种衡量文本难度的指标,包括常见的Flesch-Kincaid可读性公式、Dale-Chall公式、词汇丰富度等等,结果发现AoA的区分度是最强的。用统计学的话说,AoA能解释掉41.3%的年级差异方差,是所有测试指标里最高的,第二名的Dale-Chall只有23%。
但AoA有个问题:FineWeb-Edu里10%的单词根本查不到AoA分数,因为这个词表只收录了3万个常见词。团队想了个补丁方案,用词频信息(一个叫WordFreq Zipf的指标)去插值预测那些查不到的词的AoA值,这样能把没有覆盖到的词汇比例压到很低。
这个补丁方案挺聪明的,因为语言学研究早就发现,一个词多常见和它多小就被学会,这两者是高度相关的:越常用的词,小孩越早接触到。
有了这层粗筛,第二层是训练一个分类器来做精细判断。这一步的难点在于,你得先有一批打好标签的数据去训练分类器,而人工标注几千万条文本是不现实的,所以团队用了LLM-as-a-Judge的方法,让一个大模型(Gemini Flash)来给样本打标签。
LLM-as-a-Judge(LLMJ)*:用一个已经训练好的大语言模型来充当"裁判",对内容进行分类或打分,而不是靠人工标注。这样能大规模、低成本地生成标注数据。
但即便用AI裁判,把FineWeb-Edu里将近70亿条样本全部标一遍,按Gemini Flash的定价算下来要花费约4600万美元。这笔钱显然花不起,所以团队只标注了一小部分作为训练集,再用这部分数据训练出更便宜、更快的分类器(先用轻量的FastText过一遍,再用更强但贵50倍的ModernBERT精筛一遍)去处理海量剩余数据。
这个过程好比先请一位专家医生给一小批病例做诊断,然后用这些诊断结果训练出一套自动诊断系统,去处理医院里成千上万的其他病例。专家亲自看完所有病例是不现实的,但用专家的判断去"教"一套自动化系统,就变得可行了。如果没有这一步,团队要么被迫用便宜但粗糙的规则去筛(漏掉太多细节),要么砸几千万美元请AI逐条精判(预算爆炸),两条路都走不通。
筛完之后还有第四层:符号过滤。这一层专门用正则表达式扫描文本里有没有出现二次方程、求和符号Σ、积分符号∫这类明显超纲的数学记号。虽然这类内容在语料里本来就很少见,这一步只额外剔除了约0.1%的文档,但团队认为这是一道必要的保险丝,因为这些符号一旦出现,几乎肯定意味着内容超出了小学范围。
最后一层是频率采样。团队发现筛完之后剩下的语料还是比训练目标(80B token左右)要大,与其随便再抽样一部分,不如借这个机会进一步收紧边界:找出那些"高度偏向超纲内容"的高频词汇(比如某些专业术语),把包含这些词的文档优先剔除掉。
整套流水线走完,效果如何?团队用一个叫CommonCoreText的验证集来检验,这是他们专门构建的一个包含课本和推荐读物的基准数据集,每篇文章都标好了对应的年级。
结果相当亮眼:这套流水线把超纲内容(Beyond-K-5)的保留率压到了0%,同时还保留了约35%的合规小学内容(K-5)。
这里有个值得琢磨的设计取舍:为什么只保留了35%的小学内容,剩下65%的合规内容也被误删了?
团队的解释是,这是一个精度优先的设计。他们宁可牺牲一部分"漏网之鱼"式的合规内容,也要确保绝对不会让超纲内容混进去。如果放松过滤标准去多捞一些小学内容,那些漏网的超纲内容风险也会同步上升,而这恰恰是整个实验设计里最不能妥协的底线。团队还做了人工核查,发现那些被误删的合规文档往往篇幅更长、词汇也更复杂,这符合过滤系统的行为逻辑。
为了验证这套流水线不是只在自家验证集上表现好,团队又拿了一个完全独立的外部数据集WeeBit来做交叉检验,这个数据集从没参与过流水线的设计和调优。结果显示,6000篇超纲文章里只有2.48%被误留下来,人工检查后发现,其中真正涉及超纲概念的只有3篇,占比0.05%,剩下的大多是网页爬取产生的噪声内容,或者压根没什么教育价值的文本。
团队还做了另一道保险检查:用126个从课程标准里摘出来的、明显属于六年级以上的专业词组(比如"动能"、"文本证据"、"勾股定理")去扫描整个保留下来的语料,结果只有0.09%的文档命中了这些词组。
训出来的"小学生"模型,真的只会小学的东西吗
数据洗干净了,接下来就是训练模型。
研究团队采用了Qwen3的架构,训练出一个5B参数的模型,取名LittleLearner,训练用了8张NVIDIA B200 GPU,跑了100个小时。
为了对照,团队还训了一个完全相同架构、相同规模,但吃的是未经筛选的完整FineWeb-Edu数据的模型,叫UNFILTERED,作为基准对照组。此外还拿了谷歌开源的Gemma 2B模型来做外部参照,这个模型规模相近,但训练数据量高达2T token,是LittleLearner的25倍。
第一件要验证的事:这个模型的语言能力是不是真的和年龄挂钩了?
团队用了一个叫CLEAR的数据集来测试,这个数据集里的文本难度是由真实教师根据Bradley-Terry方法打分排序的。
Bradley-Terry模型*:一种统计方法,通过大量两两比较的结果,把一系列物品按"强度"或"难度"排出一个连续的分值序列。这里用来给文本的阅读难度打分排序。
结果非常清晰:随着文本难度上升,LittleLearner的"困惑度"(用一个叫bits-per-byte,BPB的指标衡量)稳步上升,说明它对越难的文本越陌生。而UNFILTERED和Gemma 2B的困惑度曲线几乎是平的,说明这两个见多识广的模型对难易文本都一视同仁,处理起来没什么压力。
Bits-per-byte(BPB)*:一种衡量语言模型对文本"熟悉程度"的指标,数值越低说明模型越容易预测这段文本,也就是越"熟悉"这类内容;数值越高则说明模型越陌生、越困惑。
这个对比很说明问题:因为UNFILTERED和LittleLearner用的是完全相同的训练配方,唯一的区别就是数据经没经过筛选,所以这种曲线分化只能归因于数据本身,而不是模型架构或训练方式的差异。
数学能力测试也讲了同样的故事。团队用CoMTA数据集(真实学生和AI辅导系统的对话记录)来测,把里面的对话按数学类别分成小学范围和超纲范围(代数、三角、微积分)。结果显示,LittleLearner在小学数学上和另外两个模型表现相当,但一到超纲数学立刻掉链子,困惑度飙升,而UNFILTERED和Gemma 2B在超纲数学上依然游刃有余。
科学知识测试用的是Jeopardy(一档美国知识问答电视节目)的科学题库,按美国科学课程标准NGSS分成小学范围和超纲范围。
结果非常戏剧性:LittleLearner在小学范围科学题上的准确率有17%左右,但一到超纲题目直接掉到接近0%。反观UNFILTERED,两个区间的表现相差不大,都在30%左右。这个断崖式下跌,几乎就是一条刀切般的边界线,恰好卡在了K-5的知识范围上。
数学推理能力的测试则更细致。团队用了一个叫MathCAMPS的数据集,这套题目是按美国Common Core课程标准(CCSS)里的每一条具体条目专门生成的合成题,可以精确对应到"三年级要学会两位数乘法"这种颗粒度。
Common Core State Standards(CCSS)*:美国各州普遍采用的K-12教育课程标准,规定了每个年级学生应该掌握的具体知识点,比如"5.NBT.B.7"这个编号对应的就是五年级要学会小数乘法。
结果显示,LittleLearner在K到三年级的题目上表现和其他模型不相上下,但从四年级开始差距逐渐拉大,到了八年级,即便让模型采样1024次去碰运气(这个术语叫pass@1024,意思是允许模型尝试1024次,只要有一次答对就算成功),LittleLearner答对的题目数量也只有UNFILTERED的不到一半。
这里有个特别有意思的细节:模型的能力提升轨迹,并不严格遵循人类课程设计的顺序。
比如按照人类的学习逻辑,一位数除法应该是多位数除法的基础,先学会前者才能学后者。但LittleLearner在"多位数除以两位数"上的表现,反而比"多位数除以一位数"更好,完全反过来了。类似地,四年级的多位数乘法它学得比五年级的进阶版本还熟练。
这提醒我们一件容易被忽略的事:人类设计的课程顺序,是基于人类大脑的认知发展规律排的,但语言模型的学习机制完全是另一套逻辑,它更依赖训练数据里某类问题出现的频率和模式的规律性,而不是所谓的"由浅入深"。这也是为什么论文反复强调,LittleLearner不能被当成一个"数字版的十二岁小孩"来理解,它只是一个知识范围受限的模型,具体表现出来的能力曲线,是模型本身的学习机制和数据分布共同决定的。
三个问题:放大模型、后训练、给提示,能不能突破这道墙
验证完LittleLearner确实是个"知识边界清晰"的模型之后,真正有意思的实验才开始。
研究团队想问的问题是:既然这个模型的知识边界是被数据严格圈定的,那我们能不能用一些常见的技术手段,把它"撬"出这个边界?
第一个尝试:放大模型规模能不能行?
团队分别训练了0.6B、1.3B、5B三种规模的LittleLearner,然后放到MathCAMPS上测试。结果显示,在K-5范围内,模型越大,表现越好,这个符合直觉。有意思的是,在最小的0.6B规模下,LittleLearner居然比同等规模的UNFILTERED表现还好一些。
团队给出的解释是:因为LittleLearner的参数里没有被高中代数、微积分这些用不上的东西占用容量,所以它能把有限的"脑容量"更专注地用在小学范围的推理上,反而产生了一种"术业有专攻"的优势。
但这个优势在模型变大之后就消失了:随着参数规模增加,两个模型在K-5范围内的表现逐渐拉平。而在超纲范围,尤其是完全脱离K-5知识范围的八年级题目上,不管模型放大到多少,LittleLearner始终原地踏步,几乎没有任何提升。
这个结果其实挺震撼的,因为它说明放大模型规模这个几乎被所有人视为"提升AI能力的万能钥匙"的手段,在这里遇到了一堵实打实的墙。规模能让模型把已有的知识用得更好,但没法凭空生出从没见过的知识。
这就好比给一个只学过加减法的孩子请更贵的家教、报更多的补习班,他确实能把加减法做得又快又准,但如果他压根没接触过"未知数"这个概念,再多的补习班也没法让他自己领悟出如何解方程。规模解决的是"熟练度"问题,而不是"从无到有"的知识获取问题。
第二个尝试:后训练(也就是先做监督微调SFT,再做强化学习GRPO)能不能行?
监督微调(SFT)*:Supervised Fine-Tuning的缩写,指用人工标注好的问答对或对话数据,进一步训练一个已经预训练好的模型,让它学会按照特定格式或风格回答问题。
GRPO*:Group Relative Policy Optimization的缩写,一种强化学习算法,通过让模型对同一个问题生成多个候选答案,再根据答案质量的相对好坏来调整模型,是近年来提升大模型推理能力的常用手段之一。
团队先用K-5范围的数据对LittleLearner做SFT,然后在GRPO阶段做了一个对照实验:一组继续只用K-5范围的题目训练,另一组换成不设限的超纲题目训练。同时给UNFILTERED也做了一套匹配的后训练流程作为参照。
结果显示,在K-5范围内,后训练确实能让两个模型的表现都比训练前有明显提升,UNFILTERED提升得稍微更多一点。但在超纲范围,LittleLearner的提升幅度很有限,而UNFILTERED的提升幅度大得多,这让两者之间原本就存在的差距进一步拉大了。
最关键的发现是:不管是用K-5数据还是超纲数据去做GRPO训练,LittleLearner在超纲范围的表现都差不多,没有本质区别。
这说明什么?说明就算你直接把超纲题目喂给模型去做强化学习训练,它依然没法学会解决这些题目,因为它压根不具备解决这些问题所需要的底层知识和概念,给再多的题目练手也是徒劳。这就像让一个从没学过英语单词的人反复刷英语阅读理解题,刷题本身不会凭空教会他单词的含义,他能提高的只是蒙题的技巧,而不是真正的理解力。
第三个尝试:上下文学习(也就是在提问时给几个示范例子)能不能行?
上下文学习(ICL)*:In-Context Learning的缩写,指不修改模型参数,仅通过在提问时提供几个示例(也叫few-shot examples),引导模型模仿示例的思路来回答新问题的方法。
团队为MathCAMPS的每一个课程标准手写了三道新题和对应的思路示范,然后测试给LittleLearner这些示范之后,它在超纲范围的表现会不会提升。
结果是:在K-5范围内,给几个示范能带来小幅提升;但在超纲范围,几乎没有任何提升。团队还试了几种不同风格的示范写法(比如更简洁的算式风格 vs 更自然的叙述风格),发现效果都差不多,没有一种示范方式能真正打开超纲能力的大门。
有个细节值得一提:团队观察到,给了示范之后,模型输出的风格确实会被"带偏",比如回答会变得更简短、更贴近示范的格式。这说明模型确实在"模仿"示范的表面形式,但这种模仿并没有转化为真正的推理能力提升。
这三个实验放在一起看,传递出一个相当一致的信号:规模、后训练、上下文学习,这三种目前业界最常用的"提升AI能力"的手段,在这个受控实验里,都只能在已有知识边界内部把表现打磨得更好,却没有一种能真正突破这道边界,把模型带到它从没见过的知识领域里去。
真正决定模型能力天花板的,是预训练阶段吃进去的数据,而不是后续这些花样翻新的调优手段。
这个"沙盒"能拿来做什么
这篇论文的价值不仅仅在于证明了上面这几个实验结论,更重要的是它搭建了一个可以反复使用的实验平台。
研究团队在论文里畅想了好几个可以拿这个沙盒继续深挖的方向。
比如强化学习的探索边界问题:既然LittleLearner的知识底子完全透明,那如果用强化学习、自我对弈、搜索这些手段去驱动它突破小学范围,学会更高年级甚至竞赛级别的数学,这种"突破"是不是就能被干净地归因于强化学习本身,而不再有"它其实早就见过答案"的嫌疑?这为验证强化学习到底能不能带来真正的新发现,提供了一个小规模但足够纯净的实验场。
再比如持续学习和可解释性研究:因为模型的知识背景是完全已知的,如果之后再往里灌入新的概念(比如负数、代数符号),就可以精确追踪模型学习新知识的效率、会不会遗忘旧知识、新旧知识之间会不会互相干扰。这在过去用网络规模数据训练的模型上几乎无法研究,因为你根本不知道模型"以前"到底知道些什么。
还有教育科学和人机对比的角度:虽然LittleLearner的知识边界是照着人类课程划定的,但论文特别强调,这不代表这个模型的学习方式和人类儿童一样。前面提到的"除法学习顺序颠倒"就是个活生生的例子。但正因为知识范围是明确可控的,研究者反而可以更精确地对比机器和人类儿童在学习相同内容时,到底走了怎样不同的路径,犯了怎样不同的错误。
写在后面
读完这篇论文,让我印象最深的一个细节其实是那个"除法顺序颠倒"的发现,LittleLearner在两位数除法上表现得比一位数除法还好,尽管人类教育里前者明明是后者的进阶版。
这个反常现象戳破了一个我们可能一直下意识相信的假设:如果一个AI表现得像个"懂事的小学生",那它内部的学习路径大概也是按照人类课程那种循序渐进的逻辑走的。但事实证明完全不是这样,模型的能力增长曲线完全是另一套逻辑,取决于数据里某类模式出现的频率和结构,跟人类认知发展的"由易到难"没有必然联系。
这也让我重新想了一下"用课程给AI分级"这件事本身的局限性。论文里也承认,年级标签在衡量语言模型的难度时并不总是可靠的,因为同一个年级里相邻的课程条目,可能对人类来说是"熟练度"的差异,但对模型来说却是完全不同的挑战。
这提醒我,用人类的框架去理解AI的行为,本身就是一种需要小心的类比,它有用,但边界在哪里,可能比我们想象的要近得多。
Q&A
Q1:LittleLearner是什么?
A:LittleLearner是一个只训练了5B参数、只用小学到五年级(K-5)课程范围数据训练出来的语言模型,由MPI-IS和ETHZ的研究团队开发,目的是构建一个知识边界完全透明可控的实验沙盒。
Q2:为什么放大模型规模、做后训练、给提示例子都没法让LittleLearner学会超纲知识?
A:论文的多组实验一致显示,这三种手段都只能在模型已有的知识范围内提升表现,无法凭空补上模型从没接触过的知识,说明真正决定能力天花板的是预训练数据本身,而不是后续调优手段。
Q3:LittleCurriculum这个数据集是怎么筛出来的?
A:研究团队从FineWeb-Edu网络语料出发,经过年龄习得指标预筛、大模型标注训练分类器、符号规则过滤、频率采样这五道工序,最终筛出88B token、几乎不含超纲内容的纯净小学课程语料库。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.