千问发布Qwen3.8-Omni-Flash模型:释放全模态Agent生产力

PChome | 编辑: 邸天宇 2026-09-18 12:03:15

千问上线新一代原生全模态模型Qwen3.8-Omni-Flash,把竞争点从“听得清、看得懂”推向“能规划、会调工具、交成品”。模型统一接收文本、图像、音频、视频,上下文扩至1M,并在千问AI平台、阿里云百炼开放。

PChome 9月18日消息,千问上线新一代原生全模态模型Qwen3.8-Omni-Flash,把竞争点从“听得清、看得懂”推向“能规划、会调工具、交成品”。模型统一接收文本、图像、音频、视频,上下文扩至1M,并在千问AI平台、阿里云百炼开放。

官方汇总30项评测,平均得分较Qwen3.5-Omni-Plus提升超26%:音视频智能体方向,WildClawBench-MM提高36.5分,AgenticVBench提高22.3分,UniClawBench达69.6;长视频与音频理解上,OmniVideoBench、LongAudioSpan分别提升9.6、8.3分。多人会议是重点场景,AliMeeting的说话人分离与转写错误指标由88.11/89.61降至3.35/17.18,原生支持最长1小时音视频,可输出纪要、待办并调用邮件、代码等工具。

成本端改动更直接:API每小时音频输入价格降超98%,音视频输入降超93%。配合Agentic取证,长视频先粗扫再定位关键片段,OmniVideoBench准确率从63.4升至67.8,单次Token由14.57万降至7.91万,降幅约45.7%。

落地层面,Music2MV按曲式生成带时间轴歌词,短剧翻译做角色识别、克隆配音与音轨重混,电影解说自动提炼情节并剪辑;Video2Note把教程压成图文PDF。千问同时扩展Qwen-MM-Plugins、开源Qwen-Live Harness,分别覆盖长程音视频工作流与实时全模态交互。其音视频能力已接近Gemini 3.8 Flash,音频整体反超,企业处理会议、培训、影视素材的门槛明显降低。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑