模型千问Qwen官方动态·原文 2026年9月18日

阿里千问上线Qwen3.8-Omni-Flash:全模态模型转向任务执行,API音频输入价格降超98%

千问官方称,这款原生全模态模型在29项评测中平均得分较上代提升超25%,支持1M上下文,并同步开源Qwen-MM-Plugins与Qwen-Live Harness;模型可自主进行视频剪辑、会议转待办乃至优化小模型。

AI解读:千问把Qwen3.8-Omni-Flash的卖点押在“办事”而不是“看懂”:模型可以自己规划任务、调用工具、交付成片或纪要,官方称其在WildClawBench-MM多模态工具使用上得分71.0,上一代Qwen3.5-Omni-Plus为34.5。

对做音视频工作流的人,最直接的变化是价格。官方给出的API定价显示,每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%,按2分钟素材成本×30估算。

长视频处理换了一种省钱方式:模型不再从头到尾逐帧看完,而是自己决定看哪几分钟。官方称在OmniVideoBench上准确率从63.4升到67.8,Token消耗从145,736降到79,117,降幅约45.7%。

多说话人识别是目前数字最扎眼的一项:官方列出AliMeeting测试中DER/cpWER从上一代的88.11/89.61降至3.35/17.18,并原生支持最长一小时音视频输入,用于会议纪要、待办与风险分析。

同步开源的Qwen-MM-Plugins与Qwen-Live Harness说明一件事:光有模型不够,还得配工具和运行环境。官方还展示用该模型在12小时内把Qwen2.5-Omni-3B四川话识别的字符错误率从25.79%降到15.30%。

与Gemini 3.8 Flash的对比需要看条件:官方称音视频能力接近Gemini 3.8 Flash、音频能力整体超过,但部分基准上仍有差距,例如Video-MME-v2为65.0对71.0,且这些比较均来自厂商自测,部分基线为空白或不适用。

千问团队在官方博客发布新一代原生全模态模型Qwen3.8-Omni-Flash,称其核心目标是提升真实生产力场景中的Agent能力,推动全模态模型从“理解全模态内容”走向“规划任务、调用工具并完成创作”。模型已上线千问AI平台,支持文本、图像、音频和视频输入,以及1M长上下文。

官方称,在累计29项评测中,相比上一代Qwen3.5-Omni-Plus,Qwen3.8-Omni-Flash平均得分提升超过25%;API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。关于价格计算,官方说明音频或音视频每小时价格按2分钟素材的输入成本×30估算,音视频采用720p、1 fps;Gemini 3.8 Flash使用media_resolution=high,Seed 2.0 Lite使用max_frame_tokens=384,其他API参数使用默认值;人民币价格按1 USD = 6.7191 CNY换算。

官方给出的音视频Agent评测数字是:WildClawBench-MM提升36.5分至71.0,AgenticVBench提升22.3分至36.8,UniClawBench取得69.6。基础能力方面,LongAudioSpan提升8.3分至82.7,OmniVideoBench提升9.6分至63.4,OmniCap-IF的CSR/ISR分别提升8.5/14.1分,AliMeeting的DER/cpWER从88.11/89.61降至3.35/17.18。

官方称,通过扩展数据、上下文与Agentic Environment,Qwen3.8-Omni-Flash的音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。对照表中,Qwen3.8-Omni-Flash在Video-MME-v2为65.0对Gemini的71.0,LVOmniBench为63.3对70.7,OmniGAIA为74.0对78.6;多说话人ASR的AliMeeting为3.4/17.2,Gemini 3.8 Flash为72.6/53.1。表格中部分基线标注为“--”,官方说明为分数尚不可用或不适用。

长视频不再逐帧看完:Agentic理解把Token消耗砍掉约45.7%

官方描述,面对数小时长视频,传统方法通常需要从头到尾处理全部内容,即使答案只存在于其中几分钟的片段内。Qwen3.8-Omni-Flash原生Agent从问题出发,自主决定该看什么、听什么,并通过由粗到细的多轮取证定位关键信息。

官方称OmniVideoBench实验表明,Agentic Understanding将准确率从63.4提升至67.8,同时将Token消耗从145,736降至79,117,降幅约为45.7%。官方注明Agentic模式在多轮交互中保留上下文。

会议场景支持最长一小时输入,可生成纪要、待办并发邮件

官方称,多人会议是音视频理解中最复杂的场景之一:多人交替发言、声音相互重叠,人物身份、指代关系与讨论主题持续变化。Qwen3.8-Omni-Flash具备多说话人音画协同识别能力,原生支持最长一小时的音视频输入,能够联合理解人物画面与语音内容,端到端完成说话人切分、内容转录与身份对应。

按官方描述,输入完整会议视频并描述需求,模型可梳理参会者关系、生成会议纪要与待办事项,并分析项目风险,同时借助视觉信息解决音频中的指代与实体歧义;结合Agent与工具调用,还能发送邮件、整理任务,甚至依据会议需求直接开始编码。

音视频生产链路:从MV创作、短剧翻译到长电影解说

官方列举了以音视频为核心的Agentic应用:视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要和音视频对话。Music2MV方面,官方称模型能理解歌曲的结构、节奏、情绪、人声与乐器变化,输出带时间戳的句级歌词,结合Qwen-MM-Plugins贯穿音乐理解、创意规划与成片质检。

短剧翻译方面,官方称用户只需一句话描述需求,即可按需完成区分角色的台词识别、口语化翻译、角色克隆配音、音轨重混与成片质检。长电影解说方面,官方称用户提供影片并用一句话描述创作需求,即可完成长视频全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

大模型反过来优化小模型:12小时把3B模型四川话错误率降约40.7%

官方称,面向具体场景定制小模型是规模化业务应用的重要路径,但传统流程涉及数据构建、问题诊断、多轮训练与效果评测,周期长且依赖人工经验。这次官方尝试把Qwen3.8-Omni-Flash推进到模型研发本身,探索“大模型负责研发、小模型面向业务”的范式。

官方描述,任务是在12小时内提升Qwen2.5-Omni-3B的四川话识别能力并交付可用模型。模型自主选定WenetSpeech-Chuan评测集、固定评测标准并完成基线测试,随后直接听取语音样本、结合识别结果诊断问题、构建针对性训练数据。在连续4轮实验中,Agent累计构建3,413条训练数据,并根据评测反馈调整方案、保留有效改进、回退无效尝试。最终Qwen2.5-Omni-3B在同一评测集上的字符错误率从25.79%降至15.30%,相对下降约40.7%。

Realtime版本:支持“听声辨位”,面向低延迟交互

官方推出Qwen3.8-Omni-Flash-Realtime,称其能够在音视频流输入的同时完成感知与响应,并结合实时上下文调用工具、执行任务。实时口语陪练方面,官方称该模型联合建模发音与语义,能理解受口音影响的非标准表达,将其对齐到正确词汇,并实时生成标准发音示范。

官方称,Qwen3.8-Omni-Flash-Realtime融合空间声音与视觉信息,持续判断声源方向和距离,并同步感知障碍、通行区域与场景变化,是首个支持“听声辨位”的全模态大模型;面对“过来这里”或“去看看是什么在响”等指令,能够从环境噪声中锁定人声与目标声音,并调用工具完成定位、搜索、路径规划与导航。

官方还称,Realtime版本支持通过Skill注入身份设定、表达风格、业务知识与交互规则,并通过工具调用延伸到任务执行,例如智能客服场景中实时加载品牌话术与服务流程。官方给出的吞吐与延迟数据为:音频6秒输入时文本输出84.87 Tokens/s、首Token延迟591.26毫秒、首音频包978.36毫秒;音视频20秒输入时分别为83.00 Tokens/s、981.01毫秒和1350.49毫秒,音频生成RTF约0.1528。

开源两个配套件,API支持三档推理深度

官方称,音视频Agent面临长音视频存储、传输与多轮推理成本高昂、现有Agent Harness框架缺乏音视频原生支持、从全模态理解到端到端任务执行的工作范式仍处早期等问题。为此官方扩展了Qwen-MM-Plugins,为长音视频的按需感知、工具调用与工作流执行提供支持,并开源Qwen-Live Harness,为实时、持续的全模态交互提供原生运行环境。

官方还开源了Qwen-MM-Plugins中的Video2Note,称其可自动梳理知识结构、拆解关键步骤、筛选代表性画面,生成图文对应的PDF笔记;以及Omni Skill Creator,称其可从操作演示中提炼标准作业流程(SOP)并转化为可复用自动化流程,或从专家教学中学习工具使用与决策依据。

API方面,Qwen3.8-Omni-Flash正式支持reasoning_effort,可选xhigh(默认,适用于需要深入分析的复杂任务)、medium(在准确性与速度之间取得平衡)、low(优化速度与成本的高效推理);preserve_thinking在所有场景中默认开启。官方称模型支持与OpenAI规范兼容的Chat Completions和Responses API。

语种方面,官方列出语音识别支持74种语言和39种中文方言,语音生成支持29种语言和7种中文方言,包括四川话、北京话、天津话、南京话、陕西话、粤语和闽南语。

信息来源