阿里发布了音视频多模态模型 Qwen3.8-Omni-Flash。它支持 1M 上下文,具备工具调用能力,并且大幅减少了 Token 消耗。
一个值得注意的细节是:这款模型仅提供 API,没有开放权重下载。
![]()
三个关键点
- 1M 上下文:能一次处理更长的音视频内容
- 工具调用:模型可以调用外部工具完成任务
- Token 消耗大幅减少:直接关系到调用成本
音视频多模态加上长上下文,指向的是需要同时理解画面和声音、且素材体量不小的场景。Token 消耗降下来,意味着同样的任务花更少的钱。
只给 API 不给权重,说明阿里把这款模型放在云端服务的位置上,而不是让开发者自己部署。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.