网易首页 > 网易号 > 正文 申请入驻

Jev爆火,具身智能迎来大救星?

0
分享至



AI圈需要新故事。

AIX财经(AIXcaijing)原创

作者 | 雷晶

编辑 | 魏佳

最近,一个不聊天、不写代码的AI模型刷屏了。开发者把它塞进各种应用,有人拿它玩游戏,有人用它分邮件,还有人让它操控浏览器。

它叫Jev,由前OpenAI研究员Diogo Almeida等人联合创立的TypeSafe AI于9月15日发布,同时被冠以一个新品类的名字:System One Models(系统一模型)。9月21日,Jev全面开放,更多开发者涌入,上手测试它能接手哪些工作。

这个模型的特别之处在于,它只做判断。比如收到一条用户评论,它会判断是否违规、该删还是要留。TypeSafe AI把软件里大量分类、评分、选择下一步动作的工作,都交给一个专门的模型去做。

真正吸引行业的是速度和价格。按照官方测试,Jev的速度是大模型的193.6倍,成本约为其1/444.6,且输出免费。不过官方也注明,并不是所有任务都能获得同样的提升。

开发平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,已有近13%的付费团队使用,是GPT-5.6系列上线首日的2倍、ClaudeFable 5.1的6倍以上。开发者社区更是探索出了很多玩法和场景。

在大模型卷参数的时候,Jev把决策又快又便宜做成卖点,给AI行业提供了一个新的故事。

这是又一个靠效率和价格引爆关注的“DeepSeek时刻”,还是一种模型分工新范式的开端?它的出现会给大模型行业带来哪些影响?

01.Jev不负责说,只负责选

我们先通过一个客服投诉的场景,来理解Jev能做什么。

假设用户发来一句“我被扣了两次钱,想要退款”,接下来,客服系统要判断交给哪个部门、事情有多紧急,还要判断客户要做什么。程序可以把消息和预先设置好的问题一起交给Jev,由它直接返回判断结果。

接到问题后,Jev的输出会分为三种类型。

第一种是Choice,在给定选项里做选择。比如“该交给哪个部门”,候选选项包括售前组、售后组、技术组等,Jev会选出一个,同时给出各选项的概率。

第二种是Score,按预设标准打分。比如“问题有多严重”,程序可以设置从“轻微”到“造成重大损失”的不同等级,Jev给出各等级的概率,再计算加权分数。

第三种是Noul,判断一句话成不成立。比如“用户在要求退款”,如果返回0.97,就表示模型认为这句话有97%的概率成立。

三种输出可以在同一次调用里一起完成,程序拿到结果就能继续走下一步。

具体效果如何,开发者已经做了一些尝试。

有网友在X上展示用Jev进行邮件分类。据他介绍,Jev在数秒内完成了500封邮件的分类,花费3.5美分。对于需要反复读取文本、分配类别的任务,这显示出低成本批量处理的潜力。



还有网友展示了航班查询的案例。他把网页上的按钮、输入框等元素整理成候选项,让Jev决定下一步执行什么操作、选择哪个目标。到了需要填入城市名的环节,再调用生成模型提供文字。据他介绍,这套系统在约7秒内就完成了一次航班查询。



不同用法背后,是同一个设计思路。TypeSafe AI把Jev归入一个新品类——“System One”,取自卡尼曼《思考,快与慢》中那种不用过脑子、凭直觉瞬间给出的判断。Jev本质上是一个决策模型,不生成任何字符,直接返回可供程序调用的结构化决策。

这些事情,通用大模型也能做,Jev的区别在哪里?

最明显的区别在于输出方式。通用大模型通过生成文本给出答案,即使只需要一个选项,通常也要逐个生成Token。Jev直接返回选项、分数或概率,程序拿到结果就能继续执行。

输出方式背后,其实是产品定位的不同。通用大模型可以聊天、写代码,也能分析问题,Jev则专门处理判断任务,开发者提供信息、描述判断要求,必要时给出候选选项,由它返回结果。仍以退款为例,识别诉求、分配工单可以交给Jev,解释退款政策、给客户写邮件,则需要通用大模型。

这也容易让人联想到传统的分类器。分类器是专门给信息归类的模型,开发者先设定类别,再用已经标好类别的数据训练它,让它学会不同类别的特征,从而判断新的输入应该归到哪里。但分类器通常围绕固定任务训练,换了业务场景或标签,往往需要补充标注数据、重新训练或调整。

相比之下,Jev的使用方式更灵活,它仍具备大模型式的语义理解与泛化能力,开发者可以通过提示词描述不同的判断任务,不必为每个新任务重训模型。

02.快、便宜、准确,是怎么做到的?

Jev能干什么讲清楚了,那么,它为什么能在一周内让开发者集体上头?

先来看需求端。

文本打标签、请求分流、风险判断,这些需求一直存在。到了Agent时代,这类“判断类调用”的需求变得更大了。

一个Agent完成任务,往往需要反复作出选择。哪怕用户提出的是一个简单任务,背后可能都会发生几十次模型调用。

大模型研究员曾小健告诉「AIX财经」,Jev踩中的正是这个痛点。过去,开发者把太多判断题交给生成式大模型,让模型先生成文字,再从中提取结论。单次调用的开销不大,但在Agent持续运行的过程中,重复判断会明显推高整个任务的成本和耗时。

Jev把这类需求单独做成产品,无论是选工具、检查内容,还是判断任务是否完成,开发者都能找到可以尝试接入的环节。

再看产品端,Jev同时做到了“速度快、便宜、判断准”三件事。

首先是快。

一位业内人士告诉「AIX财经」,CoT(思维链)让模型一步一步思考,通过增加推理过程中的计算量,提高复杂任务的准确性。Jev则省去逐Token生成文本的过程,直接返回判断结果和概率,以此提高速度。

此外,同一份输入还可以并行完成多个独立判断。大模型研究员姚宇航举例,检查一份文档时,写作质量怎么样、有没有敏感词汇,可以并行判断,不必逐项等待。放在大规模调用中,这能节省可观的时间。

其次是便宜。

通用大模型的API通常分别按输入、输出Token收费,生成的内容越长,输出费用越高。Jev不生成文本回复,只收取输入费用,每百万输入Token为0.042美元,输出不收费。对于反复分类、打分的任务,这种设计减少了为获取一个简单结论而支付的生成费用。

这种设计,在Agent中尤其有价值。一次任务可能包含多次工具选择、结果检查和重试判断,每一步的开销都会计入完成任务的总成本。曾小健举例,可以先用Jev判断问题难度,把简单问题交给便宜模型,复杂问题再升级到更强的模型。这样,既降低了判断环节的费用,也减少了不必要的强模型调用。

再者是训练方法让模型返回的概率本身可信。

前述业内人士解释,Jev的判断仍依靠模型内化的世界知识、高质量的决策数据与训练轨迹,以及对输出概率的有效校准。

这种训练方法叫作校准决策强化学习(RLCD)。所谓校准,就是在大量被模型赋予80%概率的判断中,相应事件实际发生的比例也应接近80%。这样,开发者才更容易根据模型的把握程度,决定哪些结果可以自动执行,哪些需要复核。它改善的是判断与不确定性的表达,并不保证每次都答对。

有网友的测试就呈现了这种差别。他让Jev判断60个Agent工具调用属于只读、破坏性、及权限,还是数据外传,再对照自己预先标注的答案。结果55个判断一致,一致率91.7%。但难度不同的案例表现差距明显,34个界限清楚的案例全部答对;12个刻意伪装成正常操作的陷阱案例,答对了11个;剩下14个本身就存在争议的含糊案例,只答对10个。



姚宇航解释,Jev并不是真的零幻觉,它的输出被卡死在给定选项里。如果给定A、B、C、D四个选项,它不会凭空选出E,但仍可能在四个选项中选错,需要通过模型微调和上层工程降低误判概率。

以上是Jev公认的优点,但能具体快多少、便宜多少,还得看任务和对照对象。曾小健提醒,如果换成便宜的小模型,并要求它只输出简短结果,差距会明显缩小。同一段材料需要完成多个独立判断时,共享上下文、并行处理的优势才更容易体现,真正的收益在高频、批量判断中。

03.Jev会带来什么改变?

Jev的出现是一阵风,还是一种新范式,类似当年的“DeepSeek时刻”?得从两面看。

从技术层面看,Jev并不算新。曾小健指出,分类器、排序模型和意图识别早已存在,Jev并没有跳出这类任务的边界。

但从产品层面看,它是新的。Jev把“判断”做成了一个便宜、快速、可以独立调用的模型接口,面向 Agent、单独计费、单独优化。开发者可以围绕判断任务,单独比较准确率、延迟和费用,选择适合的模型;决策能力也因此有了自己的迭代路径,不必再跟着通用模型的整体能力一起升级。

对每天要处理大量文本的企业来说,只要判断质量够用,Jev就能明确带来更快、更便宜的处理效率。曾小健把它总结为“系统工程和产品架构上的创新”。

前述业内人士则更看重它在模型体系中的位置。他认为,Jev所代表的技术方向,未来很可能成为一种重要的推理与输出范式,与普通文本生成、CoT深度推理长期并存。



图源 / AI生成

多位从业者告诉AIX财经,接下来能接住这波红利的,包括三类玩家:个人开发者、企业、具身智能公司。

对个人开发者来说,最简单的尝试是把Jev接进已有Agent,承担工具选择、任务终止以及失败重试等判断。曾小健认为,API调用本身门槛不高,会Python或JavaScript的开发者很快就能上手。这类任务选项有限、调用频繁,偶尔判断错了通常还能恢复,适合用来测试决策模型的效果。

他提到,真正的门槛是,怎样把业务需求定义成一个好的判断问题。比如判断“客户风险高不高”,高和低的标准是什么、多大把握才能自动执行、什么情况必须交给人工,都需要开发者提前想清楚。

到了企业端,价值主要来自规模。姚宇航看好代码审查、客服和大规模文本处理等每天都要反复分类、筛选、检查的任务,一条数据还可能对应多个判断。只要质量达到要求,单次调用节省的时间和费用,就能随着业务量累积,降低整套系统的运行成本。

具身智能的想象空间更大。姚宇航认为,机器人对响应速度要求高,行业本身也还在早期,新的决策模型有机会切入。

机器人执行任务时,需要不断根据环境变化决定下一步。如果环境信息已经整理好、可选动作也已明确,快速决策模型有机会承担其中一部分选择,减少用户的等待时间。但这仍是潜在用途,Jev能否适应实际环境、满足可靠性要求,还需要专门验证。

这些场景也给模型厂商提供了另一种做产品的方式。

姚宇航向「AIX财经」表示,过去行业比的是谁的模型更大、数据更多、算力更强,目的是解决更复杂的问题;Jev换了个方向,把那些又快又便宜就能解决的小任务专门做好,反而获得了关注。模型厂商除了继续提高能力上限,也可以围绕具体判断任务,优化速度、费用和稳定性。

曾小健打了个比方,未来的Agent系统更像一个模型团队,有的承担推理或生成,有的负责路由、排序或安全检查。开发者需要重新判断,哪些步骤值得调用强大的生成模型,哪些只需要一个快速、可靠的决策模块。

对国内厂商来说,机会是现成的。客服识别用户意图、银行和保险把工单分到对应部门、销售线索评出优先级,都是合适的场景。加上国内企业更重视数据安全和本地部署,能够在企业内部运行、适应中文业务标准的决策模型,有机会做出差异化。

这些机会并不只属于Jev。姚宇航提到,已经有国内开发者尝试用开源模型微调类似产品,他认为,复现这类功能的门槛并不高,后续可能有更多公司加入API服务竞争。

即便Jev的话题热度可能只会维持几个月,但用“便宜快速的模型做判断”这个思路会持续。只要专门的决策模型能稳定降低工作的成本,就有继续使用的理由。

*题图由AI生成。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《纸牌屋》:没有人真正在乎你有多专业、多正派、多有原则,真正能决定你不被轻视的,是掌握这两张交换筹码

《纸牌屋》:没有人真正在乎你有多专业、多正派、多有原则,真正能决定你不被轻视的,是掌握这两张交换筹码

心理观察局
2026-08-22 06:28:11
解放台湾最大的阻力不是美国,也不是台独分子,而是另一邻国

解放台湾最大的阻力不是美国,也不是台独分子,而是另一邻国

安珈使者啊
2026-09-04 09:29:18
申花门将位置终于要补强了?网传俱乐部跟心仪人选谈得差不多了

申花门将位置终于要补强了?网传俱乐部跟心仪人选谈得差不多了

张丽说足球
2026-10-04 09:37:14
美籍华裔搞这么乱的吗?

美籍华裔搞这么乱的吗?

求实处
2026-10-02 23:30:47
离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

小椰的奶奶
2026-10-02 12:16:25
佛州拆摄像头拆出11台无主设备,县专员:非执法机构装的我不能接受

佛州拆摄像头拆出11台无主设备,县专员:非执法机构装的我不能接受

Ping值焦虑
2026-10-02 23:23:24
754元车票仅退24元!12306候补购票事件引热议,爆料人哭诉:被气到心口疼,帮爸妈候补的车票,看到已是车开走的第二天了

754元车票仅退24元!12306候补购票事件引热议,爆料人哭诉:被气到心口疼,帮爸妈候补的车票,看到已是车开走的第二天了

火山詩话
2026-10-04 08:31:29
中国有一个奇怪现象:亲家和亲家之间,好像都不怎么联系

中国有一个奇怪现象:亲家和亲家之间,好像都不怎么联系

风起见你
2026-08-21 01:09:09
食指上两个穴,一个管“热”,一个管“通”,很多人搞反了

食指上两个穴,一个管“热”,一个管“通”,很多人搞反了

王二哥老搞笑
2026-10-03 10:09:52
莱巴金娜:美网后几乎没睡觉!中网出局利好郑钦文,孙心然战高芙

莱巴金娜:美网后几乎没睡觉!中网出局利好郑钦文,孙心然战高芙

排球黄金眼
2026-10-04 00:53:45
人活多久,看吸烟就知?研究发现:寿命短的人,吸烟或有6个特征

人活多久,看吸烟就知?研究发现:寿命短的人,吸烟或有6个特征

王医生健康讲坛
2026-09-30 17:45:09
含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

健康之光
2026-09-25 07:25:20
连韩国国脚也绝望了!前中超外援怒丢球鞋,黄仁范含泪痛诉:没人能帮我们

连韩国国脚也绝望了!前中超外援怒丢球鞋,黄仁范含泪痛诉:没人能帮我们

足球大腕
2026-10-03 18:41:56
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
一个人如果舍不得扔旧衣服,说明他的命运,大概率会是这两种结果

一个人如果舍不得扔旧衣服,说明他的命运,大概率会是这两种结果

风起见你
2026-09-28 01:22:36
又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

汉史趣闻
2026-09-10 18:28:47
德拉富恩特:如果亚马尔是唯一入围金球奖的西班牙人,我会说他是世界最佳

德拉富恩特:如果亚马尔是唯一入围金球奖的西班牙人,我会说他是世界最佳

懂球帝
2026-10-04 06:40:47
揭幕战不打,对阵老东家也不打!刚签下大合同就开摆?超巨太真实

揭幕战不打,对阵老东家也不打!刚签下大合同就开摆?超巨太真实

你的篮球频道
2026-10-04 07:51:41
SpaceX大涨原因深度分析

SpaceX大涨原因深度分析

干货收并购
2026-10-03 09:41:42
危险信号!俄罗斯,开始亮核了!

危险信号!俄罗斯,开始亮核了!

大嘴说天下
2026-10-01 21:30:04
2026-10-04 11:52:49
AIX财经 incentive-icons
AIX财经
AI新时代,财经新观察。
136文章数 23226关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

牛弹琴:中国的两个邻国又开枪两人被打死 形势很严峻

头条要闻

牛弹琴:中国的两个邻国又开枪两人被打死 形势很严峻

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
艺术
本地
房产
数码

教育要闻

用5个3组成最大的数字是多少?真难啊

艺术要闻

常玉的油画草原五马,2042万港元!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

数码要闻

英伟达RTX 5070 Ti显存狂超+5500MHz:带宽突破1248 GB/s,游戏实测仅提升5帧

无障碍浏览 进入关怀版