开源大模型阵营又迎来一位挑战者。Rohan Paul在X平台发文介绍,Ornith-1.5系列模型正式发布,覆盖9B Dense、35B MoE和397B MoE三个规模档位。其中最受关注的是397B MoE版本,在四项基准测试中均超过Claude Opus 4.8。
四项基准的具体差距
![]()
从公开数据看,Ornith-1.5在Terminal-Bench 2.1上拿到86.1分,对比Claude Opus 4.8的85分;SWE-bench Verified上以86分对85.8分;WideSearch上以80.8分对72.9分,领先幅度最大;BrowseComp上以86.6分对84.3分。四项全部胜出,且差距并非微弱。
值得注意的细节是,Ornith-1.5并非单纯靠参数规模取胜。397B MoE的权重规模与Claude Opus 4.8同属一个量级,但训练策略上做了明显调整。官方描述称,这一代模型把任务生成、智能体设计和解决方案生成放进了同一个强化学习循环里。
训练逻辑的变化
传统强化学习流程中,任务设计通常由人工完成,模型只负责在给定任务上优化策略。Ornith-1.5的做法不同:模型自己提出任务,自己编写用于评分的脚手架,自己生成解决方案的rollout,再通过GRPO算法把奖励信号反向传播到这三个阶段。这意味着任务生成环节不再依赖大量人工设计。
官方说明中提到,Ornith-1.5会从一个环境或代码库出发,配合高层级任务指令,然后在模型当前能力边界附近搜索可训练的任务。这种自生成课程机制,让仓库和可验证环境成为比静态示例更有价值的训练输入。
对开源社区意味着什么
这一设计思路的潜在影响在于,训练数据的价值排序可能发生变化。拥有更丰富任务生成和验证环境的实验室,即使不依赖最大规模的人工数据集,也可能在模型迭代速度上获得优势。计算资源开始购买课程质量,而不仅仅是更多梯度更新。
Ornith-1.5在开源模型中达到了同规模下的领先水平,官方称其性能与Claude Opus 4.8相当。对于关注开源模型进展的开发者来说,这套自生成任务的训练框架,或许比基准分数本身更值得研究。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.