Qwen3.8-Omni-Flash发布:多模态追平Gemini Flash,API价格低约五倍
阿里Qwen推出首个面向AI Agent的多模态模型Qwen3.8-Omni-Flash,可同时处理音视频并自主调用工具,官方称在音视频任务上接近Gemini 3.8 Flash,但API输入输出价格约为后者的五分之一。
AI解读:Qwen3.8-Omni-Flash是Qwen首个面向AI Agent打造的多模态模型,能同时处理音频和视频,并自主使用工具完成剪辑vlog、翻译短视频、总结电影等任务,上下文窗口为 100 万token。
价格是这次发布最直接的差异点:Qwen输入每百万token 0.15美元、输出 0.47 美元;Gemini 3.8 Flash推广价为输入 0.75 美元、输出 3.75 美元,且官方标注 2027 年 1 月 1 日起价格翻倍。对调用量大的开发者来说,同等输入输出下成本差距约五倍,音视频按小时或按帧计价也很低。
不过“追平”目前只来自Qwen自身对音视频任务的表述,来源没有给出具体基准分数、测试条件或第三方复现结果,因此更准确的理解是:性价比是已知事实,能力相当仍是厂商声明。
直接受影响的是做音视频Agent的开发者:如果模型真能在同一套工具调用流程里处理音视频并维持 100 万token上下文,视频摘要、翻译和剪辑类产品可以少拼几个专用模型;但实时交互需要摄像头和麦克风,实际体验仍取决于延迟与稳定性,公开信息尚不覆盖这些数据。
Qwen3.8-Omni-Flash是Qwen首个为AI Agent构建的多模态模型。据The Decoder报道,它可以同时处理音频和视频,得出结论,并自主使用工具来剪辑vlog、翻译短视频或总结电影。
该模型的上下文窗口为 100 万token。Qwen称,在音视频任务上它接近Gemini 3.8 Flash的水平。
价格方面,Qwen API为每百万输入token 0.15美元、每百万输出token 0.47美元。Qwen估算音频输入每小时低于 0.01 美元;720p带音频视频、每秒一帧约 0.20 美元,不含响应费用。
对比之下,Gemini 3.8 Flash的推广价为每百万token输入 0.75 美元、输出 3.75 美元,价格将于 2027 年 1 月 1 日翻倍。
该模型可通过Qwen Studio、Qwen Cloud和API使用。开源Qwen-MM-Plugins为Claude Code、Gemini CLI和Qwen Code等Agent增加视频编辑、说话人识别、PDF视频笔记和可复用工作流;Qwen-Live Harness支持使用摄像头和麦克风进行实时交互。