为什么同样做网页自动化,有人点一下要等5秒,有人话音没落页面就已经跳转完了?海外技术博主 @moritzkremb 刚发布了一段完整实操教程,把 Jev 从 API 配置到三个真实 Demo 全部跑通录了下来。这段演示里最扎眼的两个数字:150毫秒的响应,和输出 Token 彻底免费。
教程按时间戳拆成了四段:0:00 开场,0:34 讲 Jev 是什么,4:06 官方 API 配置,之后是三个 Demo 的完整演示。三个案例分别对应浏览器自动化、Agent 记忆管理和批量结构化预判——都是开发者日常绕不开的场景。
![]()
Demo 1:语音控浏览器,卡顿从5秒压到150毫秒
第一个 Demo 在 5:59 开始。用普通大模型做网页自动化,流程是鼠标点一下、等云端模型思考、再返回动作,这个等待被形容为"卡顿得像个树懒",量级在5秒左右。
接入 Jev 之后,操作方式变成对着麦克风口述指令。Jev 在 150毫秒内对网页的 DOM 元素做毫秒级单选(Choice),话音还没落地,页面已经完成点击、跳转、填表。演示里的交互流畅度和真人操作接近。
这里的关键变化是响应位置:决策不再绕到云端大模型那里排队,而是在本地以毫秒级完成元素选择。对做浏览器自动化的开发者来说,这意味着交互类场景第一次有了可用的延迟水平。
Demo 2:让 Jev 当记忆守门人,Token 消耗砍掉90%
第二个 Demo 在 11:33,针对的是 Agent 长任务的老问题:上下文越滚越长,Token 越烧越多。
传统做法是让大模型自己写摘要,成本高,而且容易把关键技术细节一起摘要掉。Moritz 演示的方案是让 Jev 充当记忆守门人:每产生一条新对话,Jev 毫秒级打分(Score),判断它是不是关键事实。
无用的废话和临时测试日志当场物理丢弃;核心偏好和规则则保留字面原文,沉淀进向量库。按演示里的说法,单次会话的 Token 消耗直接砍掉 90%。
这个思路值得注意的地方在于"保留字面原文"——摘要式压缩会丢细节,而打分式过滤只做取舍、不做改写,关键信息不会在压缩过程中被磨掉。
Demo 3:几万条视频批量预判,成本压到几毛钱
第三个 Demo 在 17:27,场景是 YouTube 爆款预测,本质是高并发批量处理。
想在几万条视频或工单里快速初筛,以前调大模型分析一次要烧几分钱,还要等好几秒。用 Jev 批量跑结构化预判时,它不写任何长篇分析,直接并发返回每一条视频在完播率、点击率上的概率分布。
演示给出的结果是:速度提升上百倍,输出 Token 物理免单,整个大盘扫一遍只要几毛钱成本。对需要做初筛的场景来说,这种"只出结构化判断、不出长文"的形态,恰好避开了最贵的那部分输出。
三个 Demo 指向同一种分工
把三段演示连起来看,Moritz 想展示的分工是:大模型负责在深水区啃最难的逻辑,Jev 负责充当闪电般的前置小脑,把原本卡在系统门外的延迟、死循环和 Token 账单处理掉。
视频里公开了时间戳、API 配置代码和三个项目的架构。正在做 Agent 开发、浏览器自动化,或者被 API 费用困扰的开发者,可以按时间戳直接跳到对应段落跟做。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.