阿里上线Qwen3.8-Omni-Flash全模态模型,音视频能力大幅升级
阿里千问发布新一代全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入及1M上下文,30项评测平均得分较上代提升超26%,API音视频输入价格降幅超93%。
阿里千问于9月18日正式推出新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台上线。该模型可同时接收文本、图像、音频与视频四类输入,上下文窗口扩展至1M token,定位为面向多模态场景的原生模型。
在能力评测层面,官方披露Qwen3.8-Omni-Flash在累计30项评测中,相较上一代Qwen3.5-Omni-Plus平均得分提升超过26%。其中音视频Agent、Coding与长程任务表现突出:WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR与ISR分别提升8.5分和14.1分。AliMeeting的DER与cpWER指标从88.11/89.61降至3.35/17.18。
官方表示,该模型的音视频能力已接近Gemini 3.8 Flash,音频能力整体超过后者。价格方面,API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。为支撑长音视频处理,官方同步扩展了Qwen-M系列的相关能力。
从行业视角看,全模态模型正从概念验证转向工程落地,上下文长度与推理成本的同步优化成为竞争焦点。Qwen3.8-Omni-Flash在评测分数与定价策略上的双重调整,或将影响多模态API市场的价格基准与选型逻辑。