29项测试平均涨25%,价格却砍到零头 阿里Qwen系列又添了一个新成员。这次是原生全模态模型「Qwen3.8-Omni-Flash」,主打音频和视频处理,覆盖视频剪辑、MV制作、电影制作、视听摘要、实时对话等一整套工作流。 它支持 100万token 的上下文窗口,在保持与同尺寸纯文本模型相当的文本性能的同时,把全模态能力大幅往上提了一档。 最扎眼的是价格和分数的组合。在 29种 基准测试中,它的平均分比Qwen3.5-Omni-Plus高出 25%以上 ;而音频输入每小时的API价格便宜了 98%以上 ,音频加视频输入每小时的价格便宜了 93%以上 。 分数涨了,账单反而缩水到零头。这个反差,是这次发布里最值得琢磨的地方。 多个基准上压过Gemini 3.8 Flash 在音频与视频的智能体、编码、长任务相关基准上,Qwen3.8-Omni-Flash在WildClawBench-MM拿到 71.0 ,比Qwen3.5-Omni-Plus提升了 36.5 ;UniClawBench也拿到 69.6 。 核心能力同样在往上走:长音频与音视频理解、音视频推理、音视频字幕、多说话人识别。具体分数是这样的—— LongAudioSpan(长音频理解): 82.7 OmniVideoBench(音视频协同推理): 63.4 OmniCap-IF(视频字幕指令跟随): 28.2 AliMeeting(中文多人多通道会议转写): 89.7 多个基准测试中,它超过了Gemini 3.8 Flash。 阿里的说法是:通过扩展数据、上下文和智能体环境,Qwen3.8-Omni-Flash实现了接近Gemini 3.8 Flash的音视频性能,以及整体上超过Gemini 3.8 Flash的音频性能。 阿里进一步解释,这些进展意味着音频和视频正在从单纯的感知输入,演化为智能体理解环境、进行推理并执行任务的核心媒介。 74种语言识别,29种语言生成 语言覆盖是这次发布的另一个硬指标。 语音识别支持 74种 语言,从南非荷兰语、阿拉伯语、阿斯图里亚斯语一路排到乌尔都语、维吾尔语、越南语,中文、英语、日语、韩语、法语、德语、西班牙语这些主流语种自然都在列。 语音生成支持 29种 语言,包括中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印尼语、阿拉伯语、越南语、土耳其语等。 目前Qwen3.8-Omni-Flash已在千问AI平台上线可用。 真正的难题不在模型本身 阿里在发布中把问题指向了系统层面。音频和视频是把智能体带进真实世界生产力场景的关键媒介,但同时也会带来新的系统级挑战。 具体来说,长音频和长视频在多轮推理处理中,存储、传输、处理的成本都很高。而现有的智能体框架并不原生支持这些模态,把全模态理解和端到端任务执行打通的流程,还处在早期阶段。 要解决这些问题,模型、工具链、运行时环境得一起进化。 为此,阿里进一步扩展了Qwen-MM-Plugins,加入针对长音频、长视频的按需感知、工具调用和工作流执行能力;同时开源了一套完整的智能体框架Qwen-Live Harness,基于Qwen3.8-Omni-Flash-Realtime API设计。 不过截至文章撰写时,Qwen-Live Harness的GitHub页面显示为404错误,暂时无法访问。 从价格曲线到基准分数,这次发布传递的信号很直接:全模态能力的成本门槛,正在被快速拉低。而阿里把下一步押在了模型之外的框架和运行时上——那里才是长音频、长视频真正跑起来的地方。 特别