Reflection AI Inc. 今日推出Beam,一个拥有5010亿参数的开源大语言模型。
此次发布距离这家初创公司以250亿美元估值完成融资仅过去几个月。大约同一时间,Reflection AI据报道与SpaceX Corp.签署了一项63亿美元的协议,租用英伟达GB300 NVL72设备。这些设备每台包含72张显卡,Reflection AI用它们训练了Beam。
![]()
基准测试对比
Reflection AI将Beam与GLM-5.2进行了基准测试对比,后者是一个参数量多出约2500亿的开源大语言模型。该公司认定,Beam在某些任务上表现更好,同时硬件用量仅为对方的三分之一到四分之一。此外,Reflection AI表示,Beam的性能接近Qwen 3.8-Max,后者参数量超过2万亿。
此次发布尤其值得关注,因为开源生态中许多最先进的大语言模型出自中国公司,包括Qwen 3.8-Max和GLM-5.2。Beam是首个由美国初创公司推出、并展现出相当或更好性能的开源模型。不过,免费大语言模型仍落后于Anthropic PBC的Claude Fable 5.1等前沿模型。
训练流程
Reflection AI开发Beam的起点是训练一个相对较小的原型模型,随后创建了一系列 successively 更大、能力更强的算法。这一工作流程最终产出了Beam Base,即Beam所基于的底座。
Reflection AI使用6144张显卡的集群开发了Beam Base,训练数据量为23.8万亿token,来源包括公开网络和商业渠道。据Reflection AI称,该数据集包含大量软件代码。公司为每种编程语言创建了定制过滤器,以剔除低质量文件。
Reflection AI在不到四周内完成了Beam Base的开发。随后进行了中期训练,这是一个扩展模型上下文窗口并增强推理能力的优化过程。该阶段为训练流程中第三个、也是最吃硬件的阶段奠定了基础。
强化学习阶段
Reflection AI启用了1万张GB300显卡,用它们启动了13亿个强化学习沙箱。沙箱是AI模型学习新技能的虚拟环境。Beam的沙箱针对生成代码、搜索网页和运行AI智能体等任务进行了优化。
Reflection AI表示,该项目的强化学习阶段仅用了四周。公司通过开发防止故障中断工作流的软件,避免了不必要的延误。据Reflection AI称,其集群在训练期间出现的71个错误中,实现了8分钟的中位恢复时间。
Beam最初通过早期访问计划提供。Reflection AI计划于本月晚些时候发布其权重、文档和微调工具。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.