德国AI实验室Aleph Alpha发布了一款叫Kolibri的开源模型。参数总量78B,但每次推理只激活3.46B,走的是MoE架构,上下文窗口拉到100万token,权重以Apache 2.0协议开放。
这几个数字放在一起,指向的是一件事:长上下文和高推理效率,被塞进了同一个模型里。官方说法是,Kolibri"针对长上下文和推理效率做了优化",同时支持显式推理模式和工具调用。
![]()
3.46B激活意味着什么
78B是模型的总容量,3.46B是每次前向计算真正调用的部分。MoE的思路是把参数拆成多个专家,按需唤醒,而不是每次都用全部权重。对使用者来说,直接结果是推理成本按激活量算,而不是按总量算。
100万token的上下文窗口,则决定了这个模型能吃下多长的输入。长文档、大代码库、多轮长对话,都属于这个窗口要覆盖的场景。Aleph Alpha把"长上下文"和"推理效率"并列写进优化目标,说明这两项在训练阶段就是一起考虑的。
一个双语分词器,21.3%德语预训练token
Kolibri团队专门做了德语/英语双语分词器,并在整个训练过程中持续加入原生德语数据,最终德语占预训练token的21.3%。
这个比例不是随手填的。分词器决定文本怎么切、切完怎么进模型,双语分词器意味着德语不会被英语的切分规则硬拆。而21.3%的德语预训练占比,说明这不是一个英语模型加一点德语微调,而是从预训练阶段就把德语当作一等公民。
对德语使用者来说,这解决的是模型在母语上"能说但不地道"的老问题。
从第一天就按欧盟规则设计
Aleph Alpha在说明中提到,Kolibri从底层设计开始就考虑了欧盟AI法案、通用人工智能行为准则和GDPR,版权法是其中一项工作重点。
合规在这里不是发布后补的手续,而是训练前的约束条件。版权法被单独点出,说明训练数据的来源和处理方式,是这个模型设计的一部分,而不是事后声明。
欧洲开源模型的又一张牌
Aleph Alpha是德国AI实验室。素材中的说法是,除Mistral之外,它可能是欧盟第一个达到这一性能水平的通用模型。这个判断本身带着"可能",但指向的趋势很清楚:欧洲做开源模型的实验室在变多。
Apache 2.0的授权方式,意味着权重可以下载、可以在自己的硬件上跑、可以商用。对不想把数据送出去的团队来说,这是可选项之一。
78B总量、3.46B激活、100万上下文、21.3%德语token、Apache 2.0——这几个数字拼起来,是Kolibri目前能确认的全部轮廓。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.