阿里千问上线Qwen3.8-Omni-Flash全模态模型

今日,阿里千问上线新一代原生全模态模型Qwen3.8-Omni-Flash,并在千问AI平台提供。据悉,该模型可处理文本、图像、音频和视频输入,并支持1M上下文,重点提升了在真实生产力场景中的任务处理能力。

阿里千问上线Qwen3.8-Omni-Flash全模态模型

官方公布的数据显示,在累计30项评测中,Qwen3.8-Omni-Flash相比上代Qwen3.5-Omni-Plus平均得分提升超过26%。其中,在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,在UniClawBench中取得69.6分,此外LongAudioSpan、OmniVideoBench等音视频基础能力也有所提升。

阿里千问上线Qwen3.8-Omni-Flash全模态模型

据官方透露,该模型的音视频能力接近Gemini-3.8-Flash,音频能力整体超过了Gemini-3.8-Flash。同时,其API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。


应用方面,Qwen3.8-Omni-Flash可支持长音视频理解,按需描述、Agentic主动取证、会议任务推进和视频深度研究报告等工作。在OmniVideoBench的测试中,其Agentic Understanding准确率从63.4%提升至67.8,同时Token消耗从145736降至79117,降幅约为45.7%。此外,该模型还可用于音乐视频创作、短剧翻译、长电影解说等音视频生产场景。

阿里千问上线Qwen3.8-Omni-Flash全模态模型

此外,千问方面进一步扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。其中,Qwen-MM-Plugins面向长音视频的按需感知、工具调用与工作流执行,并提供Video2Note、Omni Skill Creator等能力;Qwen-Live Harness则面向实时、持续的全模态交互。同时千问还推出Qwen3.8-Omni-Flash-Realtime,可在音视频流输入的同时完成感知与响应,并结合实时上下文调用工具。

阿里千问上线Qwen3.8-Omni-Flash全模态模型

近期,千问方面持续推进模型产品的升级。此前在8月,Qwen3.8-2.4T-A95B开源,其总参数规模达到2.4万亿,激活参数950亿。随后其发布旗舰模型Qwen3.8-MAX,总参数量达2.4万亿,同时也是目前Qwen系列中参数规模最大的模型。8月26日,千问办公上线Qwen3.8-Flash,并同步推出标准模式,所有用户可通过标准模式体验这一模型,标准模式下单任务生成速度提升约100%,Token消耗平均减少75%。


【本文图片来自网络】

踩(0)

最新文章

相关文章

大家都在看