阿里发布了全模态模型 Qwen3.8-Omni-Flash,支持音频和视频理解。这款模型配备 1M-token 上下文窗口,在 WildClawBench-MM 与 UniClawBench 两项测试上,性能接近 Gemini 3.8 Flash。
全模态加长上下文
![]()
全模态意味着模型能同时处理音频和视频两类输入,不再局限于纯文本。1M-token 的上下文窗口,则决定了它在单次任务里能"记住"多少内容。两个能力叠加,指向的是更复杂的多模态任务场景。
从公开的测试结果看,Qwen3.8-Omni-Flash 在 WildClawBench-MM 与 UniClawBench 上的表现,已经接近 Gemini 3.8 Flash 的水平。这两个基准的名字里都带着 MM,对应的是多模态能力评估。
对标意味着什么
阿里这次把参照系直接放在了 Gemini 3.8 Flash 上。性能"接近"是一个需要留意的措辞——它说明双方处在同一量级,但并未宣称超越。
对开发者来说,多了一个支持音频和视频理解、且上下文窗口达到 1M-token 的模型选项。具体能跑出什么效果,还要看实际接入后的表现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.