网易首页 > 网易号 > 正文 申请入驻

一个只用"干净数据"训练出来的1B模型,是怎么打平4B对手的

0
分享至


你有没有想过一个问题:如果全世界的大模型都在疯狂吃数据,吃到连数据来源是不是合法都顾不上了,那有没有人愿意慢下来,只吃"干净"的那部分?

2026年8月,一个丹麦研究团队交出了答案。他们做的这个模型叫Mimir v1,只有10亿参数,训练数据全部来自161个经过许可、能公开查证来源的数据集。听起来像是自缚手脚的实验,但结果却让人意外:这个模型在丹麦语任务上打败了几乎所有同量级和更大量级的对手,英语任务上也只比4B参数的Qwen 3.5落后0.3分。

这件事的反直觉之处在于,行业默认的规律是数据量和数据自由度决定模型上限。谷歌、OpenAI这些巨头训练大模型时,数据基本是能抓多少抓多少,很少去纠结每一条数据的授权状态。而Mimir团队反其道而行,先给自己戴上镣铐,再看看能跳多高。

一个绕不开的现实问题:小语种没有"垃圾数据"可用

先说说这件事到底难在哪。

大语言模型的训练通常分两步,先在海量原始文本上做预训练,让模型学会语言的基本规律,然后再用高质量的指令数据做后训练,让模型学会听懂人话、给出有用回答。

预训练*:让模型在海量文本上学习语言统计规律的第一阶段训练,通常需要几万亿token的数据量。

后训练*:在预训练模型基础上,用相对少量但质量更高的数据进一步调整模型行为的过程,也叫指令微调。

问题是,预训练这一步对数据量的胃口大得惊人,动辄需要几万亿token。像英语这样的"资源丰富语言",互联网上有取之不尽的文本可以喂,哪怕不那么在意授权问题,量级也撑得起来。但丹麦语呢?作为一个只有几百万人使用的语言,公开、合法、高质量的丹麦语文本本身就稀缺,如果还要求全部可授权,那预训练阶段几乎无米下锅。

丹麦基金会模型项目(Danish Foundation Models)就是卡在这个死结上的机构。这个由南丹麦大学、奥胡斯大学等机构组成的项目,一直坚持只用许可数据做研究,可正因为这份坚持,他们迟迟拿不出一个真正从零训练、完全合规的基座模型供社区使用。

这就好比一个厨师立志只用有机认证食材做菜,可市场上有机认证的丹麦语食材少得可怜,巧妇难为无米之炊。如果他放弃原则去黑市场采购,倒是能做出丰盛的大餐,但那就违背了他开这家店的初衷。如果坚持原则,他可能永远开不了张。

Mimir团队想到的办法是绕开这道坎:既然预训练阶段需要的天量数据是最大的瓶颈,那能不能干脆压缩甚至跳过传统意义上的预训练,把主要精力和数据都投入到后训练阶段?

这就要说到他们选择的架构了。

HRM架构:为什么这次不是传统Transformer堆叠

Mimir用的底层架构叫HRM-Text,全称Hierarchical Reasoning Model,来自Wang等人2026年发表的论文《HRM-Text: Efficient pretraining beyond scaling》。

HRM(层级推理模型)*:一种通过"高层循环+低层循环"的分层结构模拟推理过程的模型架构,目标是用更少的预训练数据实现和大规模预训练相当的效果。

这个架构最大的卖点,正如论文标题所说的"超越scaling的高效预训练",是它试图证明模型能力不完全靠堆数据堆出来,某种程度上可以靠结构设计"抵消"数据量的劣势。具体到Mimir的配置,模型设置了2个H-cycle(高层循环)和3个L-cycle(低层循环),配合截断反向传播(truncated backpropagation)限制在5步以内。

这套机制听起来抽象,但换个角度理解会清楚很多。传统的Transformer处理一个问题,基本上是"一遍过",从输入到输出走一条直线。而HRM引入的层级循环,更像是让模型在给出答案前,先在脑子里过几遍草稿,高层想大方向,低层填细节,来回琢磨几轮再定稿。

这就好比你解一道数学题,普通模型是拿到题目直接写答案,写完就交卷。而HRM式的模型是先在草稿纸上列个大概思路(这是高层循环在干的事),然后针对每一步细节反复推敲(这是低层循环在干的事),来回打磨几轮才落笔。如果不这样做会怎样?论文里给出了直接对照:原始HRM-Text 1B在Math & Code任务上的平均分只有46.9分,而经过Mimir团队重新训练调整后的版本冲到了64.1分,提升了36.7%。这说明单纯有这个"打草稿"的结构还不够,怎么喂数据、喂什么数据,同样决定了这个结构能不能真正发挥作用。

模型的具体参数配置是隐藏层大小1536,32层网络,12个注意力头,前馈扩展因子为4。位置编码用的是RoPE(旋转位置编码),θ值设为10000。这些数字对普通读者来说可能意义不大,但它们共同定义了一个体量恰好在10亿参数级别的模型骨架,为后面讨论"这么小的模型怎么打赢更大的对手"打下参照系。

161个数据集怎么拼出一份"及格又合规"的菜单

如果说架构是骨架,那数据就是血肉。Mimir的数据工作是这篇论文里最值得细看的部分,因为它回答了一个核心问题:不用违规数据,具体要怎么凑出足够的训练语料?

答案是精打细算地拼凑161个数据集,总共凑出704.79亿token(每个epoch)的语料库。这个规模和动辄几万亿token的主流大模型预训练语料比起来,差了几个数量级,但对于一个后训练为主导的模型来说,已经是相当扎实的体量。

这些数据被分成八大类。丹麦语指令与知识类占比最高,达到22.07%,其中最大的单一贡献者是一个叫laerebogen(丹麦语里"教科书"的意思)的数据集,贡献了8.32B token,但这个数字本身是经过4倍重复放大的,原始数据只有2.08B token。

数据重复(repetition)*:为了增加某个稀缺数据集在训练中的曝光次数,人为将其在每个训练周期里多次采样使用的做法,常用于弥补小语种或高质量数据量不足的问题。

这里藏着一个很实际的取舍。8个小体量的丹麦语数据集被重复采样10次,才勉强凑够训练所需的覆盖度。这就像一家只有5道招牌菜的小餐馆,为了让顾客觉得菜单丰富,把这几道菜换着花样呈现,红烧的、清蒸的、凉拌的,本质食材没变,但换个做法让厨房显得更有底气。如果不做这种重复处理,丹麦语相关的训练信号会因为原始数据太少而被英语数据彻底淹没,模型很可能在丹麦语任务上表现平平。

英语指令类占19.26%,主要来自Dolci、Tulu 3和Nemotron这几个开源指令数据集家族。Sapient混合数据集占17.02%,这是一个打包了107个子集合的仓库,来源包括Flan、Platypus和tasksource这些经典的NLP基准数据。数学与推理类占14.76%,其中最大的贡献者是OpenMathInstruct-2,贡献了6.6B token。

这里出现了整篇论文最有意思的设计,叫"移植数据集"(transplant dataset)。

移植数据集*:当原始数据集因授权问题不符合使用标准时,研究者用大模型重新生成一份内容相似但完全合规的替代数据,经过人工审核后拿来"顶替"原数据的做法。

事情的起因是这样的:Sapient原始训练数据里那107个子集合,很多来自Flan NIV2、Platypus这类经典基准,但这些数据的授权状态并不完全干净,不符合丹麦基金会模型项目的许可标准。团队没有选择直接放弃这部分数据,而是想了个办法,用Gemma4 31B模型重新生成内容相似、但来源完全可控的合成数据,再经过质量审核筛选,最终产出了70个"Sapient-synth"移植数据集,贡献了75M token。

这就好比一家餐厅发现某道招牌菜用的调料涉嫌走私,又不想直接砍掉这道菜影响顾客体验,于是让厨师根据记忆和公开配方重新研发一版口味相近但食材来源正规的替代品,经过反复试吃调整后重新上桌。如果不做这一步,团队要么被迫用有问题的数据(违背项目初衷),要么直接砍掉这部分任务类型(损失训练信号的多样性)。审核通过率因类别不同差异很大,从个位数百分比到接近百分之百都有,说明这种"重新造一份"的思路并不是每次都容易成功,但至少提供了一条折中路径。

更值得说道的是,团队在这次数据重组里做了一个方向性的转变。原始Sapient数据里充斥着大量选择题式任务,也就是从A、B、C、D里选一个正确答案。这类任务对模型来说相对容易应付,因为本质上是分类问题。但团队刻意把训练重心从"选择题"转向"自由生成",也就是让模型直接写出答案,而不是挑选项。这个转变的意义在于,它让训练难度实质性提高了,因为自由生成要求精确匹配(exact match)打分,比选择题的容错空间小得多。论文里提到,像"task590-amazonfood-summary-correction-classification"这样原本是分类任务的题目,被重新生成成了要求模型写出完整答案的生成式任务。

数据处理还细分了七种形式,包括直接重新格式化的"reformatted"、经过筛选的"curated + reformatted"、AI生成并审核的"synthetic + audited"、工具调用格式的"tool-call formatted"、翻译并审核的"translated + audited",还有一小部分是通过协议获得、不能公开分享的"agreement-supplied"数据,比如来自丹麦皇家图书馆(DBC)和法律数据库Lex.dk的内容。

语言分布上,英语占了68.62%,丹麦语占24.74%,双语混合数据占6.54%。这个比例说明尽管项目主打丹麦语能力,实际训练语料里英语依然是主力,这也解释了为什么模型的英语能力没有因为专注丹麦语而被牺牲。

训练细节:3周时间,8块B200显卡

Mimir用的分词器是Gemma-4的分词器,而不是原始HRM-Text使用的自定义分词器。这个选择配合了Gemma 4的对话模板,让模型学习现代对话式AI的结构规范。

训练用的是全分片数据并行(FSDP),计算精度用bfloat16,梯度聚合用fp32保证数值稳定。优化器是经典的AdamW,峰值学习率3×10??,2000步线性预热后保持恒定。全局批量大小262144 token,在8块accelerator(加速器)上跑,每块的批量大小是16384,对应4个长度为4096的上下文窗口。

整个训练过程跑了165万步,用了8块NVIDIA B200 GPU(每块180GB显存),耗时不到3周,平均每步耗时约1.1秒。

这个训练规模,放在动辄需要几千张GPU训练几个月的主流大模型语境下,显得相当"轻量"。这也印证了HRM架构的核心卖点:用结构上的巧思,换取对算力和数据规模的更低依赖。

战绩单:20个基准测试里,Mimir表现如何

说了这么多设计思路,最终还是要看考试成绩。团队把Mimir拿去和一堆同量级、以及更大量级的模型对比,覆盖英语、数学与代码、丹麦语三大类共20个基准测试。

对比的模型阵容里,1B级别的有原始HRM-Text 1B、Qwen 3.5 0.8B、Gemma 3 1B、OLMo 2 1B;2到3B级别的有Qwen 3.5 2B、SmolLM3 3B;4到5B级别的有Qwen 3.5 4B、Gemma 4 E2B(这个模型总参数5B,但实际激活参数只有2.3B,是个"稀疏"设计);还有8到9B级别的Munin系列模型作为丹麦语专项对照。

英语测试结果里,Mimir在BoolQ(是非问答)、Winogrande(代词消歧)、DROP(阅读理解推理)三项上拿到了所有对手里的最高分,DROP的F1分数达到83.1分。整体平均分69.0,只比排名第一的Qwen 3.5 4B(69.3分)低0.3分,却比自己的前身HRM-Text 1B(66.1分)高出不少。

数学与代码类测试,Mimir的GSM8K(小学数学应用题)准确率达到89.9分,是所有测试模型里的第二高分,仅次于Gemma 4 E2B思考模式的90.3分。HumanEval(代码生成)拿到56.7分,超过了参数量是自己2倍的Qwen 3.5 2B(47.6分)。整体平均分64.1,比HRM-Text的46.9分高出36.7%。

丹麦语测试是Mimir表现最亮眼的战场。它在DaLA(语法评估,96.1的F1分数)、GEC(语法纠错,85.6的精确匹配分)、WikiQA(问答,66.8的精确匹配分)三项上都拿到最高分,在Nordjylland News(新闻摘要)上也接近最佳表现。整体平均分56.8,是所有20个模型(跨越1B到9B所有量级)里最高的,比排名第二的Qwen 3.5 4B(49.2分)高出7.6个百分点,甚至超过了参数量是自己8到9倍的Munin系列模型(这些模型平均分在43.9到45.6之间)。

具体拆开来看丹麦语各项,最能说明问题的是GEC语法纠错这一项。Mimir拿到85.6分,而排名第二的Qwen 3.5 4B只有42.6分,差了整整一倍。这个差距意味着什么?意味着在丹麦语语法纠错这个具体任务上,Mimir几乎是"降维打击",而不是险胜。

这背后其实和前面提到的数据构成有关。丹麦语指令与知识类数据占了训练语料的22%还多,其中大量是像laerebogen这种经过精心处理、还被重复采样4次的高质量丹麦语教材数据。这就像一个专攻某个细分领域考试的学生,虽然总体知识面不如那些什么都学一点的同学广,但在自己主攻的科目上,靠着反复刷题和精读教材,硬是把这门课刷到了年级第一。

不过Mimir也不是没有短板。论文自己也承认,在数学与代码这个大类上,仍然落后于Gemma 4 E2B(这个模型虽然叫E2B,有效激活参数2.3B,但整体架构可能经过了更充分的数学能力强化训练)。这说明用结构创新加合规数据的思路,目前还没能在所有维度上都做到无懈可击,尤其是需要复杂多步推理的数学与编程任务,可能天然更依赖庞大的预训练数据积累。

评测怎么做的:一些容易被忽略的细节

评测部分有几个技术细节值得一提,因为它们直接关系到这些分数的可信度。

所有测试都用温度0(贪婪解码,也就是每次都选概率最高的词,不做随机采样)配合固定随机种子4242进行,保证结果可复现。多数模型走的是vLLM服务化推理,搭配FlashInfer加速库,唯独Mimir因为需要正确处理PrefixLM结构和Gemma 4对话模板,用的是FlashAttention。团队交叉验证过vLLM+FlashAttention4和Hugging Face Transformers两条推理路径,结果基本一致(除了一些数值精度上的细微差异),最终选择报告Transformers的结果,方便别人复现。

Gemma 4被拆成了两种模式测试,一种是不开思考链的普通模式,一种是开启思考链、生成500到650个思考token后再给出最终答案的模式。这也是为什么表格里能看到"Gemma 4 E2B"和"Gemma 4 E2B (think)"两行数据,思考模式在英语和丹麦语任务上普遍表现更好,但在数学任务上反而不总是占优(比如MATH测试思考模式只有49.1分,不如非思考模式的64.2分)。

所有基准测试都是通过英国AI安全研究院(AI Security Institute)开发的Inspect AI框架跑的,这也算是给这份成绩单加了一层第三方工具的背书。

团队没藏着掖着的短板和下一步计划

论文的结论部分挺坦诚,没有把Mimir包装成完美无缺的产品。

团队明确指出两个局限。第一,在数学与代码领域,Mimir依然落后于参数量更大的Gemma 4。第二,尽管Mimir是用Gemma 4的对话模板从零训练的,作为对话助手的实际使用体验,距离真正的行业顶尖水平还有差距。

未来的方向上,团队提到了三件事。一是研究HRM架构本身的扩展规律,也就是这套层级推理机制放大到更大参数规模时表现会怎样。二是尝试引入强化学习,论文原话是这个方向"目前还没有人在HRM架构上探索过",算是给同行留了个明确的研究空白。三是继续扩充数据集,朝着完全开放许可的方向努力。

这个坦诚的态度本身也值得说一句。很多技术报告倾向于把自己的成果包装成全方位领先,但Mimir团队直接承认了"数学不如4B模型"和"对话体验不如顶尖水准"这两个硬伤,这种做法某种程度上比虚假的完美更有说服力。

Q&A

Q1:Mimir v1是什么?

A:Mimir v1是丹麦基金会模型项目开发的一个10亿参数语言模型,基于HRM(层级推理模型)架构从零训练,训练数据完全来自161个经过许可、合法可查的数据集,主打丹麦语和英语能力。

Q2:Mimir v1和HRM-Text原版比提升了多少?

A:提升幅度不小。数学与代码类任务上,Mimir的平均分从HRM-Text的46.9分提升到64.1分,涨幅36.7%。丹麦语任务平均分从21.7分提升到56.8分,差距更为悬殊,说明数据构成的优化对最终表现影响巨大。

Q3:Mimir v1的训练成本高吗?

A:相对主流大模型来说不算高。团队用8块NVIDIA B200 GPU,训练了165万步,耗时不到3周,语料库总量约704.79亿token,比动辄几万亿token的传统大模型预训练规模小得多。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贪污上亿,假慈善,身体出问题?54岁的韩红到底动了谁的蛋糕?

贪污上亿,假慈善,身体出问题?54岁的韩红到底动了谁的蛋糕?

吃青菜长高
2026-07-06 19:25:32
“韩沛颖说刘浩存14岁就跟某某某导了”上热搜,演员韩沛颖道歉:直播中情绪上头措辞欠妥,导致刘浩存女士被误解,对此深感自责

“韩沛颖说刘浩存14岁就跟某某某导了”上热搜,演员韩沛颖道歉:直播中情绪上头措辞欠妥,导致刘浩存女士被误解,对此深感自责

鲁中晨报
2026-08-24 12:02:03
出手了,广东队重磅三个消息:周鹏签约谈崩,徐杰一步到位,两人试训失败,他想要两年合同,不是贪那点钱,是不想一年一签、年年心里没底

出手了,广东队重磅三个消息:周鹏签约谈崩,徐杰一步到位,两人试训失败,他想要两年合同,不是贪那点钱,是不想一年一签、年年心里没底

看海听风u
2026-08-24 15:56:30
中国3大通血管食物,洋葱排第3!第1名天天见,可惜很多人不知道

中国3大通血管食物,洋葱排第3!第1名天天见,可惜很多人不知道

江江食研社
2026-08-22 22:30:04
恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

聚焦真实瞬间
2026-08-25 04:36:34
外协崛起,国乒遇危机?王曼昱正式退出,王励勤面临抉择

外协崛起,国乒遇危机?王曼昱正式退出,王励勤面临抉择

懂球社
2026-08-23 22:22:35
听说高市早苗都乐疯了,日本又押对了,中国代表团正常去名古屋参加亚运会,之前网上好多抵制、退赛的传言,结果现实打脸

听说高市早苗都乐疯了,日本又押对了,中国代表团正常去名古屋参加亚运会,之前网上好多抵制、退赛的传言,结果现实打脸

扶苏聊历史
2026-08-24 16:24:09
中国构建“黄金大外环”激活经济新走廊

中国构建“黄金大外环”激活经济新走廊

新华社
2026-08-24 08:36:14
山东,大爷用自己种的葡萄酿酒,被罚款 60000元,他拒绝缴纳,大爷:我自己的葡萄,还犯法了?

山东,大爷用自己种的葡萄酿酒,被罚款 60000元,他拒绝缴纳,大爷:我自己的葡萄,还犯法了?

背包旅行
2026-08-24 11:37:08
上海爸爸想将名下房产转给澳籍女儿! 结果被罚款, 拘留2个月

上海爸爸想将名下房产转给澳籍女儿! 结果被罚款, 拘留2个月

澳微Daily
2026-08-24 15:57:04
阜阳理工学校副县级校长汪兴国接受纪律审查和监察调查

阜阳理工学校副县级校长汪兴国接受纪律审查和监察调查

安青传媒
2026-08-24 12:39:26
最可怕的事情出现,全世界达成共识:我国不会打仗,可以随意挑衅

最可怕的事情出现,全世界达成共识:我国不会打仗,可以随意挑衅

历史点行
2026-08-23 14:45:24
菲律宾飞机再闯黄岩岛!算账:我方海警牺牲,菲方丢了几根香蕉?

菲律宾飞机再闯黄岩岛!算账:我方海警牺牲,菲方丢了几根香蕉?

面包夹知识
2026-08-23 22:07:03
中秋节前,我国或将迎来四大涨潮:除鸡蛋外,这三样也要涨价了!

中秋节前,我国或将迎来四大涨潮:除鸡蛋外,这三样也要涨价了!

时尚的弄潮
2026-08-24 06:40:44
与影帝离婚,她带俩儿子回上海娘家住大别墅,如今43岁也越来越美

与影帝离婚,她带俩儿子回上海娘家住大别墅,如今43岁也越来越美

梦醉为红颜一笑
2026-08-25 04:44:24
“棒棒糖医生”,走了

“棒棒糖医生”,走了

新京报
2026-08-24 13:33:02
纳指收跌0.76% 存储、光通信板块下挫

纳指收跌0.76% 存储、光通信板块下挫

财联社
2026-08-25 04:13:14
许家印传出惊人消息!佛山迎来史上最暴跌最暴跌楼盘

许家印传出惊人消息!佛山迎来史上最暴跌最暴跌楼盘

广佛选房师李秋颜
2026-08-22 11:40:54
内娱最“恐怖”的演员出现了:一个角色,整整垄断十年

内娱最“恐怖”的演员出现了:一个角色,整整垄断十年

草莓解说体育
2026-08-24 15:16:37
坏了!18号台风沙德尔锁定我国,27日登陆福建,江浙沪能松口气?

坏了!18号台风沙德尔锁定我国,27日登陆福建,江浙沪能松口气?

老牛讲
2026-08-24 12:57:52
2026-08-25 05:40:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9632文章数 568关注度
往期回顾 全部

科技要闻

宇树科技,3天跌了1000亿

头条要闻

美政府宣布对伊朗经济制裁措施 加大施压

头条要闻

美政府宣布对伊朗经济制裁措施 加大施压

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

汽车要闻

可城可野可旅行 捷途旅行者 7 双车成都车展开启小订

态度原创

旅游
本地
手机
公开课
军事航空

旅游要闻

不靠古镇不靠洱海,大理小众村落,凭一片古树林惊艳世人!

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

手机要闻

折叠屏iPhone即将登场,苹果秋季新品发布会何时举办?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版