8月19日,AI研究组织Ornith一口气放出了三款开源模型,组成完整的Ornith-1.5系列。从最大规模的397B MoE模型,到能在智能手机上运行的9B轻量版本,全部以MIT License开源,Hugging Face上同步开放下载。
这个系列的特别之处在于训练方法。Ornith在训练过程中引入了自我改进循环——模型在学习过程中自己提出高难度任务,反复迭代实现性能的自主提升。换句话说,模型不是被动地吃数据,而是主动给自己出题。
![]()
旗舰版397B:多项基准测试超过Claude Opus 4.8
![]()
系列中最大的是Ornith-1.5-397B,一个总参数3970亿的MoE(混合专家)模型。Ornith公布的基准测试对比显示,在与Ornith-1.0-397B、DeepSeek-V4-Flash-0731、GLM-5.2以及Claude Opus 4.8的对比中,Ornith-1.5-397B在多项测试里超过了Claude Opus 4.8。
这意味着开源模型在旗舰级性能上又往前推了一步。此前Ornith-1.0已经达到Claude Opus 4.7水平,这次1.5版本直接对标4.8,迭代速度相当快。
35B-A3B:激活30亿参数,打赢同级别Dense模型
中间档的Ornith-1.5-35B-A3B是总参数350亿、激活参数30亿的MoE模型。对比对象包括Ornith-1.0-35B-A3B、Qwen3.6-35B-A3B、Muse-Glimmer-30B和Gemma-4-31B。
结果有点意思:作为MoE架构,它反而在测试中超过了同为30B级别的Dense(稠密)模型Muse-Glimmer-30B和Gemma-4-31B。MoE架构的优势在于只激活部分参数,推理成本更低,如果性能还能压过同尺寸Dense模型,性价比就出来了。
9B轻量版:量化后手机可跑
![]()
最受关注的可能是Ornith-1.5-9B,一个90亿参数的Dense模型。在对比测试中,它面对的参数更大的Qwen3.6-35B-A3B和Gemma-4-31B,在大多数测试里都超过了Gemma-4-31B——参数只有对方的三分之一不到。
更关键的是,Ornith还提供了一个名为Ornith-1.5-9B-Mobile的量化版本,专门为智能手机运行设计。也就是说,一个能在手机上跑的模型,性能还能跟31B级别的模型掰手腕,这对端侧AI应用来说是个不小的信号。
开源策略:MIT License全放
三款模型全部以MIT License发布,属于相当宽松的开源协议,商用基本没有障碍。Ornith官方同步在Hugging Face上架了模型集合,包括他们自己做的量化版本。
从产品布局看,Ornith-1.5系列覆盖了三个典型场景:397B面向云端高算力需求,35B-A3B适合单卡推理,9B-Mobile则瞄准端侧部署。一套模型家族打通从数据中心到手机的全链路,这种打法在开源模型里并不多见。
值得留意的是,Ornith-1.5的训练方法——自我改进循环——如果真能在训练中持续提升模型能力,后续版本的迭代速度可能会更快。开源模型的性能天花板,正在被一次次刷新。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.