为什么 AI 搜索的响应总是慢半拍?问题可能不在模型不够强,而在每一道分流闸门都在调用生成式模型。作者 idoubi 在分析 Jev 决策模型时提出了一个思路:把快速判断和慢速推理拆开。
Jev 的定位很明确——不做长文生成,只专注三类任务:布尔判断、枚举选择和候选打分。作者把它比作心理学里的「系统 1」,也就是直觉式的快思考,与生成式模型代表的「系统 2」慢推理形成互补。
![]()
三类任务,对应三种分流场景
作者在文中列出了 Jev 的三个落地场景,逻辑都是同一件事:在不必自训小模型的前提下,把分流这道闸门做得更快、更便宜。
- AI 搜索的意图识别:用快速分类替代慢速的 flash 模型分类器,减少响应延迟
- 本地模型网关的模型路由:快速把 query 路由到最合适的模型,提升体验并降低 token 成本
- 多 Agent 协作的任务分派:Leader Agent 通过候选打分,从多个 Bot 中挑出能力最匹配的成员
这三个场景的共同点是,它们都不需要模型「写」出什么,只需要模型「判断」出什么。而生成式模型做判断,本质上是用慢工具干快活。
候选打分解决的是分派精度
多 Agent 协作这一场景值得单独看。作者提到,通过候选打分机制,Leader Agent 能更客观、更快速地完成成员挑选。这背后是一个常见的协作痛点:任务派给谁,往往靠规则硬编码或者一次模糊的语义匹配,精度和速度难以兼得。
打分机制把「选谁」变成了一道可量化的排序题,而不是一次生成式的自由发挥。
作者在文中给出的判断是,Jev 能有效解决 AI 产品的分流延迟与成本问题。这个结论指向的是一类工程现实:很多 AI 产品的体验瓶颈,不在最终那一步生成,而在生成之前的层层判断。
目前 Jev 已在 OpenRouter 上线,但作者也提到,使用它需要调用特定的 Decisions API。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.