![]()
近日,德国 AI 公司 Aleph Alpha 发布新一代开放权重模型 Kolibri,将其定位为面向政府、工业和航空航天等受监管领域的“主权 AI”。
![]()
不过,随模型公开的 189 页技术报告披露,在监督微调(SFT)数据生产过程中,智谱 GLM-5.2、GLM-5.3 和阿里 Qwen3.8-27B,被列为生成数据以及重新生成部分开放数据的主要模型。
Kolibri 采用 MoE 架构,总参数量为 781 亿,每个 Token 激活 34.6 亿参数,最高支持 100 万 Token 上下文,以 Apache 2.0 许可证开放权重。
Aleph Alpha 称,该模型由德国团队端到端开发,在德国和芬兰的基础设施上训练,掌握从数据整理、模型架构、预训练、后训练到评测的完整开发流程,并将这种能力称为“完整供应链完整性”。
技术报告 3.1.1 节披露了其后训练数据的具体生产方式。
Aleph Alpha 明确表示,用于生成这些数据以及重新生成部分开放数据的主要模型包括 GLM-5.2、GLM-5.3、Qwen3.8-27B。
![]()
不同模型根据各自特点承担不同任务,例如较小模型处理长上下文任务速度更快,而较大模型更适合生成较强的推理轨迹。
其中一项重要工作是重新生成 NVIDIA Nemotron 的部分开放数据。
Aleph Alpha 称,团队抽查候选训练数据时发现,一些答案质量参差不齐,其中包括科学问题的错误答案,直接用于训练甚至会导致模型基准测试成绩下降。
为此,团队以 Nemotron-Instruction-Following-Chat-v1 和 Nemotron-SFT-Instruction-Following-Chat-v2 的数据作为种子,使用 GLM-5.2 和 GLM-5.3 重新生成答案。
对于 Nemotron-SFT-Instruction-Following-Chat-v2 中关闭推理的子集,团队还专门生成不包含推理过程的答案,并通过用户模拟器按照原始用户的表达方式和意图继续提问,将单段对话扩展至最多 50 轮,以弥补开放数据中长对话样本不足的问题。
Nemotron-SFT-Science-v2 中的合成科学选择题,则由 Qwen3.8-27B 重新生成答案。
GLM 和 Qwen 还参与了其他类型的 SFT 数据生产。
在德语通用聊天数据中,GLM-5.3 用于生成带推理过程的回答,Qwen3.8-27B 用于生成不带推理过程的回答。
德语工具调用数据则使用 GLM-5.2 搜索德语维基百科,并生成相应的问答和工具调用轨迹。
数学和科学数据同样使用 GLM-5.3。
Aleph Alpha 先让模型将高难度数学和科学题改写成自然德语,再由另一个 GLM-5.3 实例求解,只有最终答案与原始参考答案一致的数据才会保留。
在软件工程数据生产中,GLM-5.2 被用于探索 SWE-rebench V2 中的代码仓库并生成修复补丁;GLM-5.3 则被用于向 Python 项目注入小型 Bug、生成 Bug 报告,再由另一个 GLM-5.3 实例尝试完成修复。
技术报告还披露了 Kolibri SFT 数据池的构成。
整个数据池包含 57 个数据集、2200 万条样本和 3358 亿 Token,覆盖聊天、代码、数学、长上下文、工具调用、科学以及安全与对齐七个领域。
按 Token 计算,其中 36.1% 为原样使用的开放数据,31.7% 为经过重新生成答案、补充合成推理或翻译的开放数据,另外 32.1% 为 Aleph Alpha 自行生成的数据。
接近三分之二的数据经过重新生成、加工或由 Aleph Alpha 自行生产。
最终模型并非简单将整个数据池训练一遍。
Aleph Alpha 使用 MergeMix 为不同类型的数据确定混合比例,报告总结显示,Kolibri 后训练首先进行了累计 5370 亿 Token 的 SFT,随后又在超过 120 万项内部整理任务上进行强化学习,覆盖推理、工具使用、指令遵循、代码和检索等能力。
报告没有披露 GLM-5.2、GLM-5.3、Qwen3.8-27B 分别生成了多少 Token,也没有给出这些数据占最终 SFT 训练量的具体比例。
Kolibri 的基础模型则由 Aleph Alpha 自行训练。
模型首先在 768 块 NVIDIA B200 GPU 上完成 20 万亿 Token 的预训练,序列长度为 16K,耗时 21 天;随后进行 3.44 万亿 Token 的中期训练和 2000 亿 Token 的长上下文扩展,总训练规模接近 24 万亿 Token。
为了获得最终 20 万亿 Token 的预训练数据,其数据流水线最初处理了超过 200 万亿 Token 的原始数据。
![]()
![]()
德语占最终预训练 Token 的 21.3%,约 4.3 万亿 Token。
论文进一步披露,约 24%、即 4.8 万亿 Token 的预训练数据具有合成来源,包括改写和翻译。这些合成数据也并非全部由 GLM 和 Qwen 生成,例如部分英语 Common Crawl 数据使用 Gemma-4-26B-A4B 进行合成改写。
从最终性能看,Aleph Alpha 自己的评测显示,Kolibri 英语和德语综合得分分别为 75.5 和 70.8,在其比较的同等激活参数规模 MoE 模型中表现领先。
作为 Kolibri 后训练数据生成模型之一的 Qwen3.8-27B,则分别达到 80.2 和 79.9,高于 Kolibri,不过其每个 Token 激活的参数量接近 Kolibri 的 8 倍。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.