网易首页 > 网易号 > 正文 申请入驻

36局赢35局,中国开源决策模型把Jev拉下榜首

0
分享至

成立不到5个月,第二次拿出震动业界的东西。上海AI公司StartLux(原点星辉)在9月30日正式发布决策模型StartLux-Decision,一口气推出0.8B、2B、4B、9B和27B五档版本,并提供支持本地部署的量化模型,完全开源。

最能说明问题的是一场国际象棋。对手是近期受到关注的Jev 1.13,双方看到相同棋盘状态,不借助额外搜索,每一步都由模型直接选择。最终StartLux-Decision-27B完成将死,这样的棋局,StartLux在36局中赢下35局。


榜单上的6分差距

在独立的Decision Index 0.2.1中,StartLux-Decision的27B版本得分63.88,38项基准里有31项高于Jev的最新版本Jev 1.13,综合得分对比为63.88对57.91,领先公开榜首近6分。在另一套七项测试中,StartLux-Decision-27B平均准确率达到91.82%。

需要说明的是,上述成绩为StartLux团队基于公开评测工具、对照2026年9月28日Decision Index公开榜单快照完成的自测结果;七项公开测试来自上海AI Lab Intern-Decision团队的评测集,与Decision Index是两套相互独立的口径。

这不是这家公司第一次拿出让人意外的成绩。上一次,StartLux-27B的本地模型在工信部中国信通院测试中超过284B的DeepSeek-V4-Flash,并以约1/60的参数量基本打平DeepSeek-V4-Pro。

为什么Agent需要一种专门负责判断的模型

先看StartLux-Decision实际在做什么。在一个客服工单Demo里,系统收到这样一条消息:「订单已经被重复扣款两次,但系统仍然显示未支付。」传统生成式AI通常会先理解问题并生成一段分析,而StartLux-Decision可以在一次请求中同时完成三项明确判断:分流团队、处理时效及严重等级。

这里体现了Decision Model与普通生成模型最直观的区别:它不需要先生成自然语言再由程序解析,而是直接针对开发者提供的候选项进行选择、是非判断或等级评分。

这类能力放进Agent后,作用会更加明显。在购物Demo中,用户给Agent的要求是购买「最便宜、免运费的8节装AA电池,并寄到家庭地址」。系统综合考虑型号、数量、价格和配送条件,每轮由StartLux-Decision根据当前页面状态判断下一步操作及任务是否完成,执行操作后更新页面状态并继续判断,直至完成下单并通过任务条件检查。

类似的模式也出现在办公协作Demo中。任务是把指定成员邀请到Design团队,并设置为Editor,模型需要依次选对团队、成员和角色,随后判断邀请流程是否已经完成。

这几个Demo的共同点在于,答案空间是相对明确的。浏览器控件、客服部门、工具列表均已提前定义。不同于LLM擅长的开放式内容生成,大量Agent步骤的需求非常短小,比如Yes/No、三选一、五级评分或工具选择。

如果把时间往回拨,会发现这里发生了一个很有意思的循环。传统软件时代,工程师会把业务拆成大量规则,金额大于多少进入哪条流程,出现某种状态触发什么操作,不同用户进入哪个权限分支,系统很精细,但大量逻辑需要人工提前写好。LLM出现以后,大量这种显式逻辑被模型吸收,开发者开始直接把自然语言和环境状态交给大模型,让同一个模型完成理解、分类、判断、规划和生成。

到了Agent阶段,AI重新开始分工——确定性流程交给代码,搜索交给Embedding,复杂规划交给Reasoning Model,而高频选择则开始出现Decision Model这样的专用模型。

毫秒级的速度账

算力也随之开始更精细地分配。StartLux公布了一组速度测试:在单卡H200、BF16、本地HTTP和短请求条件下,StartLux-Decision-4B一次回答三个问题平均耗时26毫秒;0.8B和2B分别为12.2毫秒和15.5毫秒。团队还使用CUDA Graph、快速线性注意力算子,并把多个问题合入一次前向计算,以降低重复计算和调用开销。

当一次Agent任务包含几十个判断节点时,每一步究竟需要多少计算,很快就会影响整个Agent的响应速度和运行成本。这也解释了为什么Decision Model会在短时间内快速升温。它处理的很多事情看起来都很小:选择一个工具、判断任务有没有结束、检查某条信息应该进入哪条流程、决定页面下一步点击哪里。可一旦Agent开始长时间、规模化运行,这些小判断反而可能成为整个系统里调用最频繁的一层。

今年9月,机器之心曾经和StartLux联合创始人兼CTO郭权玮聊过一次「本地×RSI」。当时一个很重要的问题是:StartLux所说的「本地AI」究竟是什么?郭权玮给出的边界很宽:包含模型、量化、推理系统、硬件适配,以及上层的Agent Harness、工具、搜索和持续学习,团队的目标是将这些能力尽可能部署在用户本地设备上。

这与单纯在本地运行一个离线模型有着本质区别。一个长期运行的本地Agent必须面对诸多系统级挑战:显存与内存约束、模型精度选择、不同任务在4B/9B/27B之间的调度、长上下文管理、步骤中断后的恢复机制、Memory的存取策略,以及高阶判断的开销平衡。StartLux-Decision正是为填充其中特定层级而推出的组件。

在StartLux的系统划分中,StartLux-27B承担通用能力层,Decision Model专注于高频决策,上层部署Agent与Memory,底层则由量化、推理系统和硬件适配支撑。这种架构设计始于现实的算力约束:个人电脑的硬件资源存在明确边界。与云端可通过GPU集群扩展模型规模不同,本地系统必须在有限显存、内存、带宽及功耗下长期运转,因此「单位算力如何高效率分配」成为核心问题。

此前StartLux在27B模型上的后训练实验已体现出这一逻辑。郭权玮将模型参数形容为一个高维空间,规模决定容量,而训练则是在重构容量中的能力分布。实验显示,针对Agent能力后训练后,GPQA从83.33升至90.40,DeepSearchQA从47.04升至59.39,Tau3-Banking也有所提升;但与此同时,GAIA从57.57降至45.70,IFEval亦出现下降。这一现象表明:在固定参数量下,不同能力之间存在资源重新分配,训练过程本质上是在决定参数更倾向于处理何种任务。

Decision Model则更进一步:将频繁调用且目标明确的特定任务,交由专用的轻量化模型处理。这也是StartLux推出五种规格的原因,以覆盖不同设备与场景,同时提供BF16、Q8_0和Q4_K_M三种GGUF量化文件。

以4B规格为例,Q8_0文件大小约4.48GB。在团队公布的231道公开JevBench量化复测中,其与原始权重的决策一致率达100%,均答对204题;压缩至约2.71GB的Q4_K_M版本后,决策一致率为98.3%,答对201题。

在实际的本地Agent系统中,这种规格分化具备明确的工程意义。一个长期运行的个人AI系统可能同时调度多种模型:低延迟判别由小型Decision Model完成,复杂推理交付大模型,检索由专业模块承载,长期记忆依赖Memory,而跨应用操作则由Agent Harness协调。模型正逐步转变为计算系统中的不同处理单元。

此外,概率输出也是其关键特性。StartLux-Decision可输出候选项的概率分布,使系统能够建立路由与分流策略。若模型在已知任务上的置信度达标,系统直接执行后续逻辑;若多个候选项概率接近,则可补充信息、转交更强模型或触发人工确认。不过,概率本身仍需结合具体业务场景校准,对于支付、删除、权限修改等高风险操作,原有的授权确认机制不可或缺。

3天跑通一次Auto Research

再来看一个非常引人注意的数字:3天。根据团队公布的信息,这次从确定Decision Model方向到完成首轮模型研发与验证,大约用了3天。对于一个模型项目而言,这一周期相当紧凑。

这得益于RSI思路下,StartLux长期构建的Auto Research研发体系:AI已经进入数据构造、训练、评测和失败分析等研发环节,这在StartLux近期的两次模型研发中被连续证明。

在此前的机器之心专访中,郭权玮曾对「70%实验执行由AI参与」这一数据作出解释:若仅统计配置生成、训练启动、Eval运行与结果整理等机械性工程,自动化率已超95%;而70%指的是在核心的研究与决策环节中,AI模型参与的比例。两者的技术难度存在本质差异。自动化启动训练已相对成熟,而难点在于训练结束后的分析与决策:模型为何失败?应补充何种数据?问题出在算法还是推理顺序?下一个实验需调整什么变量?该路线是否值得继续投入算力?

StartLux将这种高阶决策流程定义为Auto Research。郭权玮曾经举过一个金融任务的例子。当系统发现模型在未回查原始数据即直接计算时,失败样本会被送入研究系统。多个AI模型协同分析原因并提出假说,比如数据覆盖不足、推理链条缺陷或缺乏对应行为强化,系统随后评估方案价值,自动构造数据、启动训练、运行Eval并检测能力退化,最终将新结果反馈至下一轮迭代。在此流程中,AI已开始承担传统意义上的「科研决策」职能。

StartLux-Decision即为该管线在新模型品类上的一次落地实践。决策模型确立后,团队需定义其接口规范,围绕动作选择、约束理解、结构化输出等能力构建数据集与评测体系。训练后的异常样本重新进入迭代循环,最终由实测数据决定保留哪些修改。

在基础模型快速更迭的背景下,单版权重的领先周期缩短,研发系统的迁移能力变得更为关键。郭权玮表示,在StartLux的实践中,同系列基础模型切换时,积累的数据与训练经验大部分可直接复用,而Pipeline、Eval及失败分析体系的迁移率更高。因此,团队将长期积累的核心资产定义为:数据的有效性识别、失败样本的处理机制、实验评估体系,以及下一轮实验的自动生成能力。

在此基础上,StartLux进一步提出了Recursive Self-Improvement(RSI)的五级划分:

  • Level 0是Self-correction,模型发现错误后可以重新尝试;
  • Level 1开始积累Memory和Experience;
  • Level 2是Automated Training,AI可以生成数据、写代码、启动训练和运行Eval;
  • Level 3是Auto Research,AI根据上一轮实验分析失败、提出新假设,并参与决定下一步研究方向;
  • Level 4才进入他定义中的完整RSI:被改进后的AI连「改进AI的能力」本身也继续增强,形成递归反馈。

目前,StartLux将自身定位在Level 3阶段。StartLux-Decision既是Auto Research管线加速产出的成果,同时也是该管线未来可调用的基础组件。因为自动化研究本身包含大量离散决策:哪些失败值得深入分析?下一步调用什么工具?多个实验方案的优先级如何排序?何种情况下终止当前路线?

从36局赢35局,到3天跑通一轮研发,这家成立不到5个月的公司正在把「判断」这件事拆出来,交给一个专门的模型去做。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘欢中秋病逝,两套房产全写妻子名,父母感叹儿子替别人生的!

刘欢中秋病逝,两套房产全写妻子名,父母感叹儿子替别人生的!

智慧生活笔记
2026-10-03 18:53:01
浙江国庆“堵王”揭晓:杭甬双双落榜,第一常年霸榜无人撼动!

浙江国庆“堵王”揭晓:杭甬双双落榜,第一常年霸榜无人撼动!

辉哥说动漫
2026-10-03 13:59:25
辛纳宣布退出上海劳力士大师赛:很遗憾无法参赛,期待明年再见

辛纳宣布退出上海劳力士大师赛:很遗憾无法参赛,期待明年再见

懂球帝
2026-10-03 16:51:08
空姐下跪事件反转!知情人曝“猛料”,不是故意刁难,真相不简单

空姐下跪事件反转!知情人曝“猛料”,不是故意刁难,真相不简单

探源历史
2026-10-03 06:22:35
中网大喜讯!郑钦文晋级32强,能拿多少奖金?用实力回击了质疑!

中网大喜讯!郑钦文晋级32强,能拿多少奖金?用实力回击了质疑!

米师傅安装
2026-10-03 20:55:00
就在今天!国台办不再客气,岛内意识到大事不妙,和统后路已留好

就在今天!国台办不再客气,岛内意识到大事不妙,和统后路已留好

许侶很机智
2026-10-03 07:31:22
为何说梅毒病是最脏的病?医生详细讲解,隔着屏幕都感到头皮发麻

为何说梅毒病是最脏的病?医生详细讲解,隔着屏幕都感到头皮发麻

医学科普汇
2026-09-21 18:20:11
C罗应该尽快结束闹剧,热苏斯同意调解,想归队C罗也该向队友道歉

C罗应该尽快结束闹剧,热苏斯同意调解,想归队C罗也该向队友道歉

足坛刘脂导
2026-10-03 20:01:03
“投降的前兆”:专家谈泽连斯基撤离基辅

“投降的前兆”:专家谈泽连斯基撤离基辅

战域笔墨
2026-10-02 15:08:21
聊聊零跑D19太原起火事件:沉默比事故更消耗口碑

聊聊零跑D19太原起火事件:沉默比事故更消耗口碑

玩车专家1
2026-10-03 10:35:47
问界二手市场“血崩”,打醒赛力斯高层

问界二手市场“血崩”,打醒赛力斯高层

鸣金网
2026-10-03 17:24:38
21岁浙江姑娘亚运会拿5金2银,被韩国媒体追着问是不是混血

21岁浙江姑娘亚运会拿5金2银,被韩国媒体追着问是不是混血

有态度网友19ILam
2026-10-03 10:42:36
华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

旧闻档案馆
2026-10-03 09:30:29
深圳公开赛决赛出炉,诞生5个意想不到,袁思俊太不容易了

深圳公开赛决赛出炉,诞生5个意想不到,袁思俊太不容易了

南海浪花
2026-10-03 20:01:29
终身不得糖尿病:为了不得糖尿病,请坚守这25条

终身不得糖尿病:为了不得糖尿病,请坚守这25条

鼠鼠健康图鉴
2026-10-01 06:00:15
离婚前我挂失了银行卡,前婆婆拿卡买金首饰,收银员一刷卡她傻眼

离婚前我挂失了银行卡,前婆婆拿卡买金首饰,收银员一刷卡她傻眼

茶余饭后故事会
2026-08-11 11:07:22
刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

阿废冷眼观察所
2026-10-02 18:34:54
阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

政知新媒体
2026-10-03 15:08:28
郑钦文晋级中网32强,“冰美人”卡林斯卡娅突然宣布退赛

郑钦文晋级中网32强,“冰美人”卡林斯卡娅突然宣布退赛

极目新闻
2026-10-03 19:00:18
反转!72%日本男网友支持张本智和,张本大量高颜值女粉被曝光

反转!72%日本男网友支持张本智和,张本大量高颜值女粉被曝光

十三哥侃大山
2026-10-03 15:12:38
2026-10-03 22:11:00
闪存猎手
闪存猎手
全网蹲好价的野生捕手,算力与羊毛都不可辜负。
182文章数 75关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

媒体:韩国酵母的风 还是吹到了日本

头条要闻

媒体:韩国酵母的风 还是吹到了日本

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

时尚
游戏
旅游
教育
军事航空

Chemena Kamali写给Chloé的又一封情书

国产《艾希》续作众筹突破2000万!目标仅1万

旅游要闻

今天,20.97万人去了北京这里……听劝!这个时候来,游览更从容——

教育要闻

我发现一个残酷真相:孩子长大后,最怨恨的不是管太严的父母,而是……

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版