10月3日,德国统一日。我们发布新模型:Kolibri。
Kolibri 是一款英德双语混合专家(MoE)Transformer,总参数 780亿,激活参数 30亿。它支持最高 100万 token 的上下文长度。模型完整权重已在 Hugging Face 上开放下载,按 Apache 2.0 许可条款使用。
![]()
它不是从石头里蹦出来的
Kolibri 是模型训练工作持续迭代的结果。团队先搭建了一条模型训练管线,并通过构建 Kolibri Origin 来验证它——Origin 是一个总参数 300 亿、激活 30 亿的模型,上下文窗口短得多,只有 6.5 万 token。Kolibri 走的是同一条管线:从数据摄入与清洗,到消融实验、预训练、后训练,再到最终评测。这条管线支撑了数百次消融实验,并实现了稳定的预训练——当硬件故障或数据连接中断时,不需要人工介入。团队持续监控训练指标,并标准化了自定义基准的监控流程。官方称,花在搭建和迭代这条管线上的时间是一笔有价值的投资——这一点既体现在 Kolibri 比 Kolibri Origin 好多少,也体现在两者发布间隔之短。
卖给谁,解决什么问题
Kolibri 是一款专用语言模型,面向受监管领域的主权关键任务,包括公共管理、工业和航空航天。团队针对德语、推理、数学、智能体行为以及客户在生产中需要的其他能力对 Kolibri 做了专门优化。这种专门化的目标,是优化客户具体用例中的表现。通过专门化,客户能在自己的 AI 运营中获得贴合自身情境的表现,并监控其经济影响,让 ROI 保持可衡量、随时间增长。
只有专门化还不够,主权同样重要。在官方看来,主权包含两个维度:模型是怎么造出来的,以及它如何交到客户手里。官方提供完整的供应链完整性,从数据摄入、预训练、后训练到最终评测,每一步决策都可追溯,并提供透明度。客户拥有完全的部署自由和知识产权安全,因此合规性成为模型自带的一种属性。
Kolibri 针对广泛行业的特定领域语言、监管和流程现实做了性能优化。它小而高效的体量,让客户可以灵活地在本地高效运行,无需把内部数据发送给第三方推理服务。官方用 780亿总参数中的 30亿激活参数,来优化模型能力与部署成本之间的权衡。官方称,Kolibri 在质量对服务成本的帕累托前沿上,英语和德语都是如此——没有对比模型能在同等服务成本下给出更高质量,或在更低成本下给出同等质量。
能力表现
在数学、代码、接地和长上下文任务上,官方称 Kolibri 能对标激活参数最多到自己四倍的模型,例如 Nemotron 3 Super。官方给出的对比表中,Kolibri 的几项数据为:AIME 2025 96.9,AIME 2025(DE)87.5,AIME 2026 96.0,AIME 2026(DE)90.0,GPQA(diamond)84.3,GPQA(diamond, DE)81.3,AA-Omniscience Index -32.8。智能体任务方面:BrowseComp 29.4,τ³-bench banking 38.1,τ²-bench retail 69.9,τ²-bench airline 76.7,τ²-bench telecom 94.7,BFCL v4 overall 61.4。代码方面:LiveCodeBench v6 85.9,HumanEval+ 92.7。长上下文方面:LongBench Pro 64.5,AA-LCR 68.3。官方说明,这些基准分数展示在统一的 0–100 尺度上,越高越好。
不会答就说不会
公开基准测不出垂直行业的真实需求,因此官方搭建了自己的内部评测套件,覆盖对客户重要的垂直领域,例如德国公共部门、航空、制造和汽车行业。每套评测都复刻这些行业所需的技能、工作流和边界情况,配套的合成训练环境让团队在这些评测上持续改进 Kolibri,全程不碰客户数据。
还有一个细节:Kolibri 用弃权数据和 Merlin-Arthur 协议训练过,当答案不在上下文中时,它被训练成会说“我不知道”。官方称客户看重并主动要求这一功能。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.