一场多人重叠的会议录音,上一代模型的识别错误率是88%,基本等于没法用。新一代把这个数字压到了3%。Qwen 刚发布的 Qwen3.8-Omni-Flash,最直观的冲击就藏在这组对比里。
除了模型本身,这次还一起放出了两个配套框架:Qwen-Live-Harness 和 Qwen-MM-Plugins。三个东西各管一段,拼起来是一套从模型能力到落地工具的完整链路。
![]()
分数涨了,Agent 能力翻倍
先看模型本体。Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-omni-flash,平均分提升了25%。提升最猛的是 Agent 能力,部分评测分数直接翻倍。
这个涨幅放在全模态模型上不算小。Agent 能力翻倍意味着模型在需要多步操作、调用工具、持续跟进任务的场景里,表现和上一代已经不在一个量级。
多人重叠会议语音识别的错误率从 88% 降到 3%,是这次最硬的一个指标。88% 的错误率意味着输出基本不可读,3% 才真正进入可用区间。会议场景里多人同时说话、抢话、插话,一直是语音识别的老大难,这个数字的变化直接决定了产品能不能落地。
输入能力上,模型原生支持最长 1 小时的完整连续音视频输入。不是分段拼接,是完整连续的一小时。
API 费用降了 98%,音频输入从 18 块变 0.8 元
价格是另一个让人坐直的数字。API 费用降低了 98%。
具体到音频输入:之前每百万 token 是 18 块,现在是 0.8 元。同样的量,成本差了一个数量级还多。对于需要长时间、大批量处理音视频的团队,这个价格变化会直接改写成本模型。
同时发布的还有 Qwen3.8-Omni-Flash-Realtime,一个超低延迟版本。它的表现是听完问题、稍加思考后开口,20 秒音频约 981ms。这个延迟水平已经接近真人对话的节奏,不是那种问完等半天才出字的体验。
![]()
悬浮球和插件库,两个框架各管一段
Qwen-Live-Harness 解决的是怎么跟模型交互。它做了一个悬浮球,点击就能和模型对话。
更有意思的是环境监控能力。你可以跟它说"我离开一会,任务跑完了叫我",它会把任务塞进任务看板,持续跟进任务状态,最后播报结果。这已经不是简单的问答,而是把模型变成了一个能盯着任务的后台角色。
Qwen-MM-Plugins 则是一个插件库,定位是给本地 Agent"赋能"。它可以给 Claude Code、Gemini CLI、Codex、OpenClaw 安装,装完之后这些工具就能多模态调用 Qwen3.8-Omni-Flash。
补齐的能力包括本地 Agent 的视觉、长视频记忆。甚至包括操作 Blender 或者 CAD 软件进行视觉建模。
录一段视频,就能生成一个 skill
插件库里有个叫 omni-skill-creator 的东西,思路很像机械臂的示教学习——拉着机械臂的手走一遍,它就学会接下来怎么操作。
omni-skill-creator 的逻辑是:录一段操作软件的视频,丢给它,它就能帮你形成操作这个软件的 skill。
因为模型是全模态的,录视频的时候可以把自己的语音一起录进去,告诉模型为什么这么做。语音解释会加深模型的理解,创建出来的 skill 更准确。这个设计把"演示"和"讲解"合并在一次录制里,比单纯录屏多了一层意图信息。
从错误率 88% 到 3%,从 18 块到 0.8 元,从悬浮球到示教式 skill 生成,这次发布把模型能力、交互入口和工具生态串成了一条线。对做音视频应用和本地 Agent 的团队来说,值得逐个试一遍。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.