输入价格差5倍,输出价格差近8倍。阿里Qwen发布了一款多模态模型,直接对标谷歌的Gemini Flash,价格却压到了对手的零头。
这款模型叫Qwen3.8-Omni-Flash,是Qwen首个为AI智能体打造的多模态模型。它能同时处理音频和视频,自己得出结论,还能自主调用工具去剪辑vlog、翻译短视频、总结电影。上下文窗口达到100万token。
![]()
价格差在哪
API定价上,Qwen3.8-Omni-Flash每百万输入token收0.15美元,每百万输出token收0.47美元。音频输入每小时不到0.01美元;720p带音频视频按每秒一帧计算,约0.20美元,不含响应费用。
对比之下,Gemini 3.8 Flash的输入价为每百万token 0.75美元,输出价3.75美元,这还是它的 introductory rate。到2027年1月1日,这个价格会翻倍。
能力对标与生态
在音频-视频任务上,Qwen称这款模型的表现接近Gemini 3.8 Flash。模型可通过Qwen Studio、Qwen Cloud和API获取。
配套的开源Qwen-MM-Plugins为Claude Code、Gemini CLI、Qwen Code等智能体增加了视频编辑、说话人识别、PDF视频笔记和可复用工作流。另有Qwen-Live Harness,支持用摄像头和麦克风进行实时交互。
一个为智能体设计的多模态模型,把价格压到对手的五分之一,同时宣称能力接近——这给做视频处理、音频分析的开发者提供了一个新的成本选项。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.