阿里发布了全模态模型 Qwen3.8-Omni-Flash,同时支持音频和视频理解。这款模型配备 1M-token 上下文窗口,在 WildClawBench-MM 与 UniClawBench 两项测试上,性能接近 Gemini 3.8 Flash。
全模态意味着什么
![]()
音频和视频理解被放进同一个模型,而不是拆成两条独立的产品线。对使用者来说,输入形态的边界被抹平了——一段录音、一段视频,都可以直接交给模型处理。
1M上下文与两项测试
1M-token 的上下文窗口,决定了单次能塞进多少内容。WildClawBench-MM 和 UniClawBench 是这次给出的两个参照点,Qwen3.8-Omni-Flash 在这两项上的表现,被描述为接近 Gemini 3.8 Flash。
接近,不等于超越。这个措辞本身留出了空间,也说明阿里这次把对标对象明确指向了 Gemini 3.8 Flash。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.