一个78B参数的模型,推理时只激活3.46B。Aleph Alpha发布的Kolibri,把这个数字摆在了台面上。
更关键的是后半句:模型权重以Apache 2.0许可开放,可以在自有硬件上运行。Cohere转发了这条发布消息。
![]()
稀疏激活的账怎么算
78B是总参数量,3.46B是每次推理实际调动的部分。两者之间的差距,决定了这个模型跑起来需要多少算力。
最高1M tokens的上下文窗口,是Kolibri另一项被点名的能力。长上下文加上稀疏激活,指向的是同一件事:让大模型在自有硬件上跑得动。
欧洲打造,权重开放
发布信息里标注了"欧洲打造"。Apache 2.0意味着权重开放,使用者可以下载、部署、在自己的机器上运行,不需要把数据送出去。
对于在意数据流向的团队,这个许可方式本身就是选择理由。Kolibri把参数规模、激活成本、上下文长度和授权条款放在了一起。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.