单步决策 122 到 128 毫秒。这是开源视觉决策模型 Valen 给出的官方数据。四局并行跑下来,总耗时 1.24 秒。
这个数字放在大模型推理的语境里,意味着另一种思路:不追求一次想清楚,而是追求快速反应。
![]()
它到底在做什么
Valen 的定位是视觉决策模型。看图或者看状态,在给定的候选动作或选项上直接打分,输出概率。底层用 Qwen3.5-0.8B 或 2B 做视觉与文本表征,再接一个共享决策头完成打分。
它把 System One 的直觉式决策机制,从文本领域搬到了视觉世界。不是让模型把画面描述一遍再推理,而是直接对动作选项给出倾向。
为什么需要这种快
传统大模型推理慢,不适合实时交互。而有一类场景恰恰等不起:
- GUI Agent 处理弹窗、判断按钮状态
- 游戏 Agent 规划走位
- 机器人避障
这些环节的特点是高频、碎片化,需要的是毫秒级反射,而不是一次完整的深度思考。Valen 瞄准的就是这层反射。
小参数的另一条路
0.8B 和 2B 的参数量,配上共享决策头的架构,Valen 展示的是低延迟视觉决策的可行性。把直觉反应模式引入视觉任务,用 Qwen3.5 小模型提特征,再接决策头对候选动作快速打分。
这条路子和堆参数、拉长推理链的方向不同。它要解决的不是"想得更深",而是"反应得更快"——在需要即时判断的环节里,把决策压缩进百毫秒级的时间窗。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.