网易首页 > 网易号 > 正文 申请入驻

独家|撬开Jev黑箱,对话全球首批复现者:9B小模型跑通79毫秒“快决策”

0
分享至


作者 | 四月

经济学里的杰文斯悖论认为:一种资源的使用效率越高、单位成本越低,它的总消耗量往往不降反升。当前,大模型行业正被这个定律演绎得淋漓尽致——模型越便宜、速度越快,调用量就越呈现爆发式增长。

而最近席卷硅谷的新物种Jev,与杰文斯悖论同名的“大模型”,正把这套攻势推向极致。

它拒绝为你写诗、拒绝跟你探讨人生,甚至连一句完整的废话都不屑于生成。但就是这样一个冷酷的“哑巴”模型,发布不到 48 小时,就在 X 上引发了超 3000 万的狂热围观,吸引了 2.5 万名开发者涌入内测;上线大模型托管平台 Vercel 的 24 小时后,近 13% 的付费团队火速接入——这个渗透速度,是当年 GPT-4 的两倍。


天下武功,唯快不破。Jev 的杀手锏亦是如此:极速,且极度便宜。作为前 OpenAI 核心研究员、RLHF 技术的共同发明者,Jev 创始人 Diogo Almeida 甚至放出豪言:“下一个时代并不属于 Claude Code 这种辅助工具,Jev 才是未来!它比通用模型快 200 倍,便宜 400 倍,而且零幻觉。这将是继 RLHF 之后的 next big thing。”

从毫秒级响应的浏览器插件,到高频执行的链上交易决策,再到每秒 10 次决策、吊打人类玩家的《毁灭战士》的通关外挂,开发者围绕 Jev 打造的应用案例呈井喷之势。

然而,面对这样一个估值一夜之间飙至 2 亿美元、却至今将训练方案与底层权重捂得严严实实的“黑箱”,业界的好奇心与质疑声也达到了高潮:它到底是模型架构革命,还是被营销包装的“分类器”(Classifier)?

开发者把 Jev 接进 Monad 链上交易系统,模型每 0.3 秒即可读取一次盘口并完成一次买卖决策

就在昨日上午,国内人工智能企业 APUS(麒麟合盛)旗下 AI 实验室,公开了全球最早一批针对 Jev 的独立开源复现成果,并将其封装为开箱即用的 Agent Skillfast-browser-use。该项目支持纯本地模型离线执行,横跨 macOS、Linux、Windows 三大桌面与服务器操作系统,甚至无需独立 GPU,在普通 Mac 和 PC 上也能本地跑通。

目前,该项目完整代码已通过 MIT 协议向社区开放 (https://github.com/APUS-AI-Lab/fast-browser-use)。


张旭博士,清华大学本硕博连读,工学博士,APUS AI 首席科学家

笔者第一时间联系到了该项目的负责人——APUS AI 首席科学家张旭博士。我们围绕Jev 的底层技术逻辑和路线、APUS 的复现与改造逻辑,这类快速决策模型的应用潜力,以及 Agent 未来的“快慢分工”趋势等话题进行了详尽探讨。

准确来说,张旭团队并没有拿到 Jev 的模型权重、完整架构和训练方法;而是通过公开资料和实际输入输出反推其工作机制,基于Qwen3.5 系列、Google Gemma 系列等开源模型还原了 Jev 最核心的工作流,并在推理速度上实现了对标。

开源当天(9 月 20 日)上午 APUS 公布首轮结果:真实浏览器任务里,维基百科检索约 18 秒完成,表单填写、站内跳转等更短链任务则在数秒内完成,全程无需调用云端模型;下午采访,张旭团队把测试迁移到了RTX PRO 6000,单次决策时间压缩到了 79 毫秒,与Jev 响应时间 70~500 毫秒成功看齐。

他还透露,其内部自研模型可实现更小 9B、4B 参数规模复现 Jev 的性能,并将于近期开源。(截至发稿前,已开源https://huggingface.co/apus-ailab/APUS-OpenJev-v1)

以下为笔者与张旭博士的访谈精要。为便于阅读,本文对原始对话进行了提炼与整合。

拆解 Jev 的底层逻辑

AI 前线:如果抛开官方的概念话术,您能不能用更直观的方式解释一下,Jev 和今天常见的大模型到底有什么差别?它本质是什么?

张旭:理解这个问题的关键,在于看透大模型工作的两个基本步骤。第一步是 Prefill,也就是输入处理;第二步是 Decode,也就是自回归生成。


当大模型走完第一步 Prefill 时,它神经网络内部的“隐状态(Hidden States)”其实已经理解了你输入的文字和图片细节。

第二步的 Decode,是一个字一个字往外吐 Token,这一步纯粹是为了“翻译给人看”。

但人类语言的带宽很窄,存在极高的信息损耗。比如这张包含猫、树枝纹理和复杂光影的图片,无论你怎么用文字描述,都不可能毫无遗漏地还原给另一个人。

Jev 的核心本质,就是它砍掉了第二步(Decode),只保留了第一步。它不再为了迎合人类而去逐字生成文本,而是直接在模型理解完信息的“隐空间”(Latent Space)里计算出结果。

AI 前线:那它最后到底输出什么?就是 Choice、Score/概率这类东西吗?

张旭:对。普通大模型每生成一个 Token,本质上都是在十几、二十万词汇的词表里计算全量概率,再选择一个吐出来。

Jev 则是把这个过程极度收敛,变成了对有限选项的概率测算。比如你问“这份提纲完整了吗”,只给“完整”和“不完整”两个选项,它只返回这两个选项的概率得分(Score)。

这也是为什么它说自己不会出现幻觉。并不是说它不会判断错,而是说你只给它 A、B、C,它不会凭空给你编出一个 D。

但不出现幻觉和不出错是两回事。

AI 前线:既然只是给出固定选项的概率,业界有人质疑它只是被包装过的“动作分类器”,您怎么看?它到底新在哪里?

张旭:这么说也没错。但我觉得还要看到它背后更大的研究趋势。

比如一张图片里面包含非常丰富的信息,你不管用多长的文字去描述,都很难把全部细节还原出来。语言本身就会造成信息损失。

所以现在一个前沿方向是:既然模型内部已经有这些信息,我们是不是一定要先把它变成人类语言,再拿语言继续处理?

Jev 可以看成这个方向里的一个具体特例。它把后面的语言生成省掉,直接从模型内部状态里去完成判断。

AI 前线:所以您说的这个更大的方向,具体是什么?就是把“理解”和“生成”进一步解耦吗?

张旭:这是其中一个方面。行业里会把更大的一类思路叫作隐空间计算。

比如两个 Agent 之间通信,它们都不是人,为什么一定要把第一个 Agent 脑子里的信息翻译成人类语言,再让第二个 Agent 读一遍?理论上可以直接在模型内部状态之间做处理。

模型路由、Agent 之间通信、模型内部思考,都可以沿着这个方向做。Jev 只是拿这个思路去做了一件具体的事情:有限选项的概率判断和决策。

AI 前线:作为行业共识,那目前头部大厂在这方面的探索进展如何?Jev 的做法和他们有什么不同?

张旭:是的,比如 DeepSeek-v4.1 Flash 版本,就已经在尝试把 Prefill 和 Decode 的能力解耦。更典型的代表是目前最新的 GPT-6(Astra),业界探讨的Loop Transformer机制,其本质就是让模型的思维链和思考过程,在“隐空间”内部进行循环计算,而不再转化为低效的人类文字吐出来。

对比而言,Jev 则是把隐空间计算的成果,讨巧地“产品化”了,它说明,把隐空间的中间结果直接拿出来用,已经足以颠覆当下的应用形态。

AI 前线:Jev 最明显的特点就是快。除了省掉长文本生成,它为什么还能快这么多?

张旭:不生成文本是最大原因,因为相当于“只吐第一个 Token”,只做判断。但除此之外,还有计算维度的降级。

第二个,原来是开放式生成,现在你给它的可能只有几个、几十个候选,计算范围更小。

第三个,这些候选之间相互独立,可以更多地并行判断;而传统的自回归生成前后有依赖,每一个 Token 都要等前一个。

我们自己的实现里也做了类似 KV Cache 广播这样的处理。所以总结下来就是:少生成、候选范围更小、还能并行。

AI 前线:那除了速度,它还有什么本质上的性能优势吗?

张旭:其他方面在我们看来,它跟大模型没有本质区别。它其实也就是一个大模型,只是只用了一半。

效果好不好,最终还是取决于模型本身训练得好不好。

如何复现 Jev

AI 前线:Jev 没有开源权重、完整架构和训练方案。在这种情况下,你们所谓的“复现”,严谨来说复现的是什么?

张旭:严谨来说,我们复现的是它的功能。

我把他们所有公开资料都看了一遍,也研究了创始人的背景,再自己实际调用 Jev,看它的输入和输出。

可以理解成我把它当成一个黑盒。如果我可以实现相同类型的输入、相同类型的输出,那我们认为基本复现出了它公开出来的功能。

AI 前线:那你们在千问上具体做了什么改动?

张旭:原版的 Qwen3.5 就可以。

模型本身不用改,主要是在外面的工作方式上处理。这次开源的东西,也是从我们公司已有的 Agent Harness 里抽了一部分出来,再精简以后放出来。

AI 前线:那是不是随便拿一个小模型也能跑?对底座模型能力、参数规模有没有要求?

张旭:这个实际测试以后还是有要求。

我看到开源社区有人拿五六亿参数模型复现,确实能跑起来,“能用两下”,但你会发现它很傻,没办法真正实用。

所以我自己把千问从小模型一路往上试。最后看下来,9B 基本上是最低的可用门槛,再小就很难实用;35B 效果会更好。选 9B 也是因为希望普通网友自己的电脑就能运行,不需要特别好的设备。此外,我们也在训练自己的模型,很快也会开源,初步看已经超过了 Jev 的效果。

AI 前线:这次复现有没有什么超出你预期的结果?比如原来以为很难,做完以后发现其实没那么复杂?

张旭:没有特别意外。

反而我们为什么能这么快做出来,就是因为过去在这个方向已经积累了很多,直接把已有的东西拿过来用了。

AI 前线:所以反过来说,你们这么快就复现出来,是不是说明 Jev 目前公开出来的东西,本身并没有特别高的技术门槛?

张旭:更客观地说,它背后还有没有别的东西我不知道。

但至少目前拿出来的部分,在我们看来,就是这个研究领域里的一个特例,没有什么特别神秘的地方。

“79 毫秒”能用在哪

AI 前线:你们为什么第一时间把复现做成一个 Browser Agent?

张旭:我们第一天先看了行业里大家拿 Jev 做什么,发现最多的就是操作浏览器。

而且我们希望开源出去的东西是有实际用途的,而不是一个技术 Demo 或者玩具,所以先把浏览器这个场景做出来。

以前很多 Agent 操作浏览器,需要让大模型先生成操作代码,再去执行。我们现在是把网页上可以交互的元素先列出来,比如输入框、链接、上下翻页,再让模型直接做选择:现在应该输入、点哪个链接,还是翻页。


后来模型本身已经做到毫秒级以后,我们统计发现,完整任务里大部分时间反而花在等网页加载、等网页刷新。

AI 前线:那你们为什么长期会往本地模型、CPU、小算力、模型路由这些方向走?这些看上去是很多单点技术,背后的逻辑是什么?

张旭:核心还是 AI 普惠。

我们一直在想,模型能不能不用很昂贵的 GPU,靠 CPU 也能有一个可以接受的速度和效果。因为绝大多数普通用户不会在电脑里装 5090,更不可能买 H100、B200。

如果 AI 最后真的要进入大规模 C 端产品,全部推理都依赖中心化大算力,本身会是一个限制。所以我们希望把一部分计算分散出去,分到 CPU 服务器,甚至分到用户手机上。

这也是我们做模型解耦、路由、本地推理这些事情背后的共同逻辑:用更高的性价比,让 AI 真正能够大规模普及。

AI 前线:如果不只看浏览器,这种模型还能用在哪里?

张旭:其实能落的场景很多。

比如我们经常会访问到一些网站上显示大量的广告、欺诈信息、杂乱的内容,那么浏览器有了这个能力加持,就可以快速筛选和过滤。

开发者 Movez 基于 Jev 分析了 10 万条 X 帖子,耗时仅为 20.4 秒,花费 0.67 美元

推荐系统也是很典型的场景。A 文章用户感兴趣的概率是多少,B 是多少,再把概率高的内容推荐出来。

我还看到有人拿它批量审文档,因为很多判断可以并行,所以一次处理上千份文档,速度和成本会有优势。

AI 前线:现在也有人拿 Jev 做炒股、交易。它因为决策快,会不会特别适合这一类场景?

张旭:快不代表它炒股水平高。

炒股最后还是看模型本身的智力水平,以及有没有针对金融这个方向做优化。Jev 现在应该没有专门针对这个方向优化。

所以不能因为它能很快做决策,就认为它一定能赚钱。

AI 前线:那再往长远一点看,还有什么你觉得值得关注的应用?

张旭:更长期可能会到工业自动化、智能家居这些领域,因为它们都需要很快做出行动。

现在不是已经有人拿 Jev 玩游戏了吗?

它能玩游戏,其实就能够操控机器人。

Agent 走向快慢分工

AI 前线:决策变得这么快以后,下一个挑战会在哪里?

张旭:一个很明显的问题,就是智力。

过去为什么大模型会吐很长的思维链?因为它要靠这些过程提升数学、编程、推理等复杂能力。

现在你把这部分砍掉,它就更依赖模型的“直觉”、第一反应。如果问题本身比较复杂,需要多步思考,那 Jev 当前的智力水平可能就不够。

AI 前线:也就是说,它更适合规则比较清晰、候选明确的任务;如果需要真正复杂推理,就会出现准确率问题?

张旭:对。复杂问题本身就可能超出它现在的能力。

AI 前线:为什么 Jev 一出来,开发者会这么兴奋?快思考、慢思考这套思想其实并不新鲜,去年 OpenAI、DeepSeek、Qwen 都尝试在基座模型里融入这套逻辑。

张旭:对,快思考和慢思考本身不是新东西。

以前很多模型也说自己有快模式、慢模式,但所谓“快”,本质上仍然是大模型一个 Token 一个 Token 生成,只是思维链短一些。从普通用户体验上看,它其实并没有真正快到像“本能”。

Jev 为什么火,我觉得一个原因就是,它真的快到足够实用了。以前那个“快思考”,其实也不快。

AI 前线:但这是不是意味着它没有办法单枪匹马完成一个长链条 Agent 任务,还是需要和完整的大模型配合?

张旭:我认为是两个类型互相需要。

比如机器人,如果所有操作都让大模型慢慢想,很难实用化。它一定需要一些非常快的模型去执行动作。

复杂任务规划、逻辑推演可以交给慢模型,而高频、原子化、环境交互类动作,就适合交给这种受限决策模型。

AI 前线:那快思考和慢思考,最终有没有可能重新融进同一个模型?

张旭:完全有可能。

系统一、系统二首先是一种架构设计思想。可以是两个模型,也可以一个模型承担两个角色。

通用模型厂商以后完全可能把长生成那部分屏蔽掉,提供一个快速决策模式。

但分成不同模型以后,每个模型可以更专注,也可能效率更高。最终要看是不是一家公司能够把整个生态都吃下来。

AI 前线:长远来看,Agent 和模型到底是什么关系?模型越来越强,会不会最终把外面的 Harness 都吃掉?

张旭:我认为不会。

可以打个比方:模型是发动机,Harness 是汽车的控制系统,Agent 是整辆汽车。

发动机可以越来越强,但你不会因为发动机越来越强,就不要轮子、方向盘和控制系统。所以大模型会越来越强,但它本质上还是Agent 里的驱动系统。

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)将于10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
奚梦瑶晒中式婚纱照!脖子叠满龙凤镯,四太对儿媳和亲女儿一样的

奚梦瑶晒中式婚纱照!脖子叠满龙凤镯,四太对儿媳和亲女儿一样的

陈意小可爱
2026-10-01 12:57:30
东方甄选宣布2倍退款不退货,罗永浩还跟不跟?

东方甄选宣布2倍退款不退货,罗永浩还跟不跟?

听心堂
2026-09-30 14:25:27
菲律宾政坛风云突变!莎拉的两位助手吵架了:辩护律师斥责发言人

菲律宾政坛风云突变!莎拉的两位助手吵架了:辩护律师斥责发言人

奥利奥变薄了的
2026-09-30 19:46:05
泪目!赵家驹妈妈亲口承认,物资中有裹尸布,她连现场都没敢去

泪目!赵家驹妈妈亲口承认,物资中有裹尸布,她连现场都没敢去

懵面女汉
2026-09-18 18:07:23
【2026.10.1】爆姐的饭后爆料:生命不止,爆料不息!

【2026.10.1】爆姐的饭后爆料:生命不止,爆料不息!

娱乐真爆姐
2026-10-01 23:34:58
银杏果:自然界中最没用的果实!结果结得再多也一样沦为保护植物

银杏果:自然界中最没用的果实!结果结得再多也一样沦为保护植物

青史卷中人
2026-10-01 22:25:26
利物浦领跑争夺乌拉圭边路天才,或将斥巨资完成引援

利物浦领跑争夺乌拉圭边路天才,或将斥巨资完成引援

林子说事
2026-10-01 18:48:08
别克新车正式官宣:10月10日,正式上市  !

别克新车正式官宣:10月10日,正式上市 !

科技堡垒
2026-09-30 00:33:54
他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

燕小姐说历史
2024-12-08 09:19:59
热苏斯:在我手下球员地位再高也没有特权,我在哪执教都如此

热苏斯:在我手下球员地位再高也没有特权,我在哪执教都如此

懂球帝
2026-10-01 00:44:14
深中通道有人一小时只走了500米,有人称坐车坐到自闭,深圳交警:已采取分流管控措施,请行经车友注意现场指引

深中通道有人一小时只走了500米,有人称坐车坐到自闭,深圳交警:已采取分流管控措施,请行经车友注意现场指引

台州交通广播
2026-10-01 18:31:09
福特CEO法利:美国应吸取欧洲教训,审慎对待中国车企入美

福特CEO法利:美国应吸取欧洲教训,审慎对待中国车企入美

IT之家
2026-10-01 17:34:23
樊振东躲在德国不回来,王楚钦说累,国乒气氛真怪

樊振东躲在德国不回来,王楚钦说累,国乒气氛真怪

罗纳尔说个球
2026-09-29 21:43:58
古语道"晨食壮火,午泄残精,命短阳衰",短短一句话藏着男人护阳长寿的关键

古语道"晨食壮火,午泄残精,命短阳衰",短短一句话藏着男人护阳长寿的关键

磊子讲史
2026-07-14 18:29:59
今日!外围,涨疯了

今日!外围,涨疯了

中国基金报
2026-10-01 15:52:36
生育政策大调整?早年超生罚款旧账,2026官方明确答复

生育政策大调整?早年超生罚款旧账,2026官方明确答复

哄动一时啊
2026-06-12 16:39:51
全球最小发达国家:美女遍地,快被中国“买”下,中国移民占87%

全球最小发达国家:美女遍地,快被中国“买”下,中国移民占87%

涵豆说娱
2026-10-02 00:10:16
张予曦母女迪士尼同框,妈妈这颜值不输女儿,年轻时绝对是大美人!

张予曦母女迪士尼同框,妈妈这颜值不输女儿,年轻时绝对是大美人!

秋风悲画芯
2026-10-01 07:21:57
上海日光、武汉时光,一夜之间,楼市风向彻底变了

上海日光、武汉时光,一夜之间,楼市风向彻底变了

专业聊房君
2026-10-01 20:00:37
82年,丈母娘嫌我穷酸,把小姨子塞进洞房,我笑了:这也太旺夫了

82年,丈母娘嫌我穷酸,把小姨子塞进洞房,我笑了:这也太旺夫了

温情邮局
2026-01-31 09:31:19
2026-10-02 01:15:00
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1762文章数 174关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

美国一女囚犯被执行死刑 注射两剂药物后其"鼾声大作"

头条要闻

美国一女囚犯被执行死刑 注射两剂药物后其"鼾声大作"

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

旅游
家居
健康
教育
公开课

旅游要闻

新民视频   光影节联动追光夜航,黄浦江上尽览流光溢彩

家居要闻

2026建博会(广州) 公装联探展交流活动

刷酸祛痘,为什么有人翻车?

教育要闻

免中考”试点到底改了什么?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版