![]()
大模型负责想,小模型负责判断,这门新生意中国团队不会缺席。
作者|桦林舞王
编辑|靖宇
9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。
两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。
国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。
9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。
一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。
而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。
01
被 Jev 点燃的「直觉」
要理解这轮热潮,得先说清楚决策模型到底在干什么。
TypeSafe 把 Jev 称为「System One 模型」,名字取自卡尼曼的《思考,快与慢》。系统一是人快速、直觉的那部分思维,系统二负责慢思考。过去两年的大模型,几乎都在往系统二的方向卷,推理链更长,思考更深。
但 Agent 真正跑起来之后,情况不太一样。一个 Agent 任务里,密集发生的往往不是深度推理,而是大量琐碎判断。这张工单该分给哪个团队,这条命令能不能放行,页面上下一步该点哪个按钮,任务到底完成没有。
过去这些判断要么交给大模型「顺便」做,生成一段文字再解析;要么写死成规则,覆盖不了长尾。前者又慢又贵,后者不够聪明。
Jev 的做法是只回答带预设选项的问题,单选、打分或者是非题,直接返回带概率的结构化结果。定价是每百万输入 token 0.042 美元,输出免费。
可以说,Jev 把「判断」从「生成」里剥离出来,做成了一种廉价、高频的基础设施。
市场反应很直接。Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户就用上了它,是此前任何模型发布的两倍。TypeSafe 用经济学家杰文斯的名字给模型命名,暗指那条著名的悖论,一样东西越便宜,需求反而越大。
不过 Jev 有一个明显的缺口。它是闭源托管模型,没有公开权重,也不能本地部署,只能调用 TypeSafe 自己的 API。
这个缺口,恰好成了后来者的入口。
02
中国团队迅速跟进
国内团队也在迅速跟进类 Jev 模型。
上海人工智能实验室的 Intern-Decision 开源了 0.8B、2B、4B 三档,主打多模态,能看懂图像和界面再做决策,团队给出的数据是推理速度比 Jev 快 2 到 3 倍。
StartLux 这样的创业公司,一口气拿出 0.8B 到 27B 五档规格,配齐量化文件,直接瞄准本地部署。
![]()
StartLux 模型分数超过 Jev|图片来源:Github
按 StartLux 公布的数据,27B 版本在 Decision Index 0.2.1 的 38 项测试里有 31 项高于 Jev 1.13,综合分 63.88 对 57.91。团队还展示了一组国际象棋对弈,36 局赢下 35 局。
StartLux 模型下国际象棋|来源:Github
这些数字需要放在正确的位置看。它们是团队基于公开工具、对照 9 月 28 日榜单快照完成的自测。更重要的是,「第一」在这个赛道的保质期极短,StartLux 发布第二天,Cloudflare 就宣称自家 Clef 在同一套榜单上领先。至于下棋,本来就不是决策模型的主战场,更像一个吸引眼球的演示。
比起谁暂时排第一,更值得注意的是,中国团队几乎不约而同地选择了开源和本地化。
这并非巧合。Jev 闭源、只能走云端,对数据敏感、对跨境调用有顾虑的国内开发者来说,本身就是一道门槛。开源权重、能在自己机器上跑,正好补上了 Jev 留下的空位。
还有一个细节。Cloudflare 的 Clef 基于 Qwen 后训练,亚马逊的 Strands Decider 也用 Qwen 做底座,APUS 的方案同样跑在 Qwen 上。这一轮决策模型热潮里,中国开源基座已经成了全球玩家共用的「躯干」。
03
为什么押注「本地」
回到 StartLux 本身。
这家公司今年才成立,CEO 是陈大年,CTO 是郭权玮博士。陈大年的履历中国互联网从业者都不陌生,1998 年写出上网计费软件 ENCounter,次年和陈天桥创办盛大,后来又做了 WiFi 万能钥匙。
StartLux 给自己的定位是「主打本地模型」,让模型能力和数据留在用户自己的设备上。上一次引起关注,是以 Qwen3.6-27B 为基座后训练的 StartLux-27B,在中国信通院的 MCP 专项测试中得分 39.25,超过了 284B 参数的 DeepSeek-V4-Flash。需要说明的是,这是一项聚焦工具调用的专项测试,不代表通用能力全面领先。
在 StartLux 的规划里,「本地 AI」不是一个能下载到电脑上的小模型,而是一整套个人 AI 系统。27B 模型承担通用能力,决策模型负责高频判断,上层是 Agent 和记忆,底层是量化与推理系统。
放进这张图里看,决策模型对本地场景的意义比对云端更大。云端算力可以堆,个人电脑的显存、内存和功耗却有硬上限。如果每个小判断都要动用 27B 模型,本地 Agent 根本跑不动。按 StartLux 公布的数据,4B 版本压到 Q4 量化后约 2.71GB,与原始权重的决策一致率仍有 98.3%。
对一家押注本地的公司来说,决策模型不是追热点的新品类,而是本地系统能否跑得动的关键零件。
这也是 Jev 对 StartLux 真正的意义。准确地说,Jev 并没有替 StartLux 选方向,从时间线看,StartLux 的决策模型立项明显晚于 Jev。Jev 证明的是另一件事,「把智能拆成不同层级、各司其职」这条路,被市场用真金白银投了票,而这恰好是 StartLux 一直在讲的本地架构逻辑。
那个「3 天」的数字也值得一提。StartLux 把它归功于自己的 Auto Research 体系,让 AI 参与数据构造、训练、评测和失败分析。这套方法能否在不同模型品类之间反复复用,比任何一次榜单都更能说明这家公司的成色。
04
判断层会不会变成「白菜价」
不过,决策模型的护城河有多深,现在下结论还太早。
Jev 号称在隐身状态下研究了两年,OpenAI 用两周基于自家小模型做出了 Decisions API,StartLux 用了 3 天,Cloudflare 和亚马逊也都在半个月内跟上。Jev 发布时就有分析人士预判,大厂会很快推出自己的决策模型,Jev 最终要和「前沿版本的自己」打价格战。
一个两周就能被复制的品类,本身很难成为壁垒。
对 StartLux 来说,真正的考验也不在决策模型这一层。郭权玮自己也承认,长任务稳定性、异常恢复、上下文管理和整体体验,比单纯把模型跑起来难得多。
按计划,StartLux 首个面向公众的本地智能体验版本有望在年内推出。
从按时计费的上网工具到 WiFi 万能钥匙,陈大年过去做过的不少产品,都是高频、底层、靠规模取胜的生意。决策模型同样是一件高频、底层的事。
问题在于,当「判断」便宜到人人都能做,价值最终会落在模型身上,还是落在把这些模型组装成产品的人手里?
*头图来源:TowardsAI
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO
极客一问
你觉得 Agent 里的「小判断」,
值得单独用一个模型来做吗?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.