一个只有4B参数的开源模型,在智能体、代码和数学三大核心能力上,正面击败了体积两到三倍于自己的对手。这不是实验室里的理想数据,而是Spark-X2.5-4B交出的实测成绩单。
在智能体评测中,Spark-X2.5-4B在τ³-bench上拿到30.4分,而Qwen3.5-9B只有9.3分,Gemma4-12B为13.3分。BrowseComp测试中,它以40.9分的成绩遥遥领先于对手的8.3分和10.0分。此外,它在MCP-Atlas、VitaBench2.0和Workspace Bench上分别取得54.6、25.2和31.2的成绩。
![]()
小模型的大算力时代
代码能力是这次评测中最具冲击力的部分。在SWE-Bench Pro上,Spark-X2.5-4B拿下44.4分,而Qwen3.5-9B为33.8分,Gemma4-12B仅为21.9分。SWE-Bench Multilingual测试中,它以53.3分位居小组第一。SWE-Bench Verified也取得了41.6分的成绩。
数学领域同样表现亮眼:AIME 2026得分90.7,HMMT Feb 2026得分81.2,IMO-AnswerBench得分74.2,每一项都领先于体积更大的同类模型。
生态适配是另一张牌
除了基准测试的数字,Spark-X2.5-4B在工程落地层面也做了布局。它深度集成了Codex、Claude Code、OpenClaw和Hermes等主流智能体框架,这意味着开发者可以直接把模型接入现有的工作流,不需要额外适配。
同系列的1.7B版本也在2B级模型中展现了竞争力。目前,Spark-X2.5系列已开放GitHub和Hugging Face下载,同时提供MaaS API服务。
小模型追平大模型的故事,这次有了更具体的注脚。当参数规模不再是唯一衡量标准,评测数据正在重新定义"够用"的边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.