一、导语
9 月 18 日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。这款模型单一模型同时支持文本、图像、音频、视频四种模态输入与文本输出,将音视频理解、推理与工具调用集成在模型内部,并具备 100 万 Token 的上下文窗口。更具冲击力的是价格:官方称其音频输入成本较上一代 Qwen3.5-Omni-Plus 下降超过 98%。
如果用一句话概括这次发布的核心意图,那就是:全模态模型的角色,正在从"理解全模态内容"进一步走向"规划任务、调用工具并完成创作"——官方将其概括为"耳聪目明,办事得力"。
二、从"看懂"到"动手":一次定位升级
过去两年,多模态大模型的竞争焦点集中在"理解"上——能不能看懂一张图、听清一段话、描述一段视频。Qwen3.8-Omni-Flash 的发布逻辑则明显不同:阿里把重心放在了真实生产力场景中的 Agent(智能体)能力上。
据钛媒体 9 月 18 日报道,该模型在具备编程、文本知识工作和 GUI(图形界面)操作等通用 Agentic 能力的基础上,进一步拓展了以音视频为核心的 Agentic 应用——在视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要、音视频对话等需要综合处理文本、图像、音频与视频的工作流中取得了显著效果。
换句话说,模型不只是"看完一部视频后写出摘要",而是可以在理解之后接管后续动作:定位关键片段、调用剪辑工具、生成字幕、输出成片。理解、规划、执行被压缩进同一次模型调用之中。
三、百万上下文:把"整段素材"一次性喂进去
100 万 Token 的上下文窗口,是这次发布在工程上最有分量的数字之一。对开发者而言,它的实际意义是:超长的会议录音、完整播客、一整部电影级别的视频素材,可以直接作为整体输入模型,而不必再进行切片、抽帧或多模型拼接——这些曾长期是音视频 AI 应用中最繁琐的工程环节。
据多家外媒报道,该模型的上下文窗口为 100 万 Token(官方文档:最大输入约 99.2 万,思考模式下约 98.4 万,最大输出约 13.1 万 Token),音频输入支持 113 种语言和方言,并支持立体声与四声道空间音频分析,同时提供函数调用、联网搜索与上下文缓存能力。
在"如何消费超长视频"这件事上,官方介绍了一种被称为"智能体式感知"(agentic perception)的处理思路:模型不再机械地逐帧扫描视频,而是先自主决定"看什么、听什么",再通过由粗到细的多轮检索集中注意力。据外媒援引官方数据,在内部长视频基准上,这一方式将准确率从 63.4 提升至 67.8,同时把单次查询的 Token 消耗从约 14.6 万降至约 7.9 万,降幅约 46%。这也部分解释了成本大幅下降的来源——省钱的不仅是单价,更是"少看无用帧"带来的 Token 节省。
四、音频成本降超 98%:价格成为竞争新维度
价格是本次发布最受关注的变量。官方称,按处理每小时媒体计算,Qwen3.8-Omni-Flash 的音频输入价格较上一代下降超过 98%,音视频综合输入价格下降超过 93%(外媒 GenAI Daily 援引的音视频综合口径为约 89%,不同媒体披露的数字略有出入)。需说明的是,"超 98%/超 93%"为官方口径中相对上一代的价格降幅;对比基线模型名称,中文通稿表述为"上一代",外媒则多写为 Qwen3.5-Omni-Plus。
据外媒披露的定价信息,在阿里云国际站区域,该模型输入价格为每百万 Token 0.15 美元,缓存输入 Token 为 0.016 美元,输出价格为每百万 Token 0.47 美元;中国大陆及其他区域定价有所不同。
计费项 | 价格(美元 / 百万 Token ) |
输入 Token | 0.15 |
缓存输入 Token | 0.016 |
输出 Token | 0.47 |
这个量级的降幅意味着什么?可以做一个直观的换算:过去,对数小时会议录音、播客存档或直播回放做自动转写、摘要与分析,成本是许多中小团队难以承受的;当每小时音频处理成本下降两个数量级后,"对全部历史音视频资产做自动化整理"从奢侈品变成了日常选项。长会议自动生成纪要、播客内容二次分发、直播实时摘要、海量视频素材库检索——这些场景的商业化门槛被显著拉低。
对行业而言,这也是全模态模型竞争进入"单位成本"竞争阶段的信号。当能力差距逐渐收窄时,价格弹性将成为争夺开发者的关键杠杆。
五、基准成绩:音频全面领先,视频仍有硬仗
官方公布的评测数据显示,在累计 30 项评测中,Qwen3.8-Omni-Flash 较上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%,其中以音视频为核心的 Agentic 任务提升最大(外媒 AIBase 亦援引"29 项基准平均提升超 25%"的口径)。
与 Google Gemini 3.8 Flash 的对比中,该模型在音频方向表现突出:在多模态工具调用测试 WildClawBench-MM 上得分为 71.0(Gemini 为 58.9),DailyOmni 为 85.1 比 84.0,SpotSoundBench 为 67.2 比 39.7,MMAU 为 81.8 比 76.9,四项音频基准全部领先。
基准测试 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash |
WildClawBench-MM (多模态工具调用) | 71.0 | 58.9 |
DailyOmni | 85.1 | 84.0 |
SpotSoundBench | 67.2 | 39.7 |
MMAU | 81.8 | 76.9 |
进步最戏剧性的是多说话人会议识别:在 AliMeeting 测试中,说话人错误率(DER)从上一代的 88.11 骤降至 3.35,带说话人归属的词错误率(cpWER)从 89.61 降至 17.18——从"几乎不可用"到"接近实用"的量级跨越。
不过,领先并非全面。在 AgenticVBench 上,Gemini 3.8 Flash 得分 45.0,千问为 36.8;在 OmniGAIA 上,Gemini 以 78.6 比 74.0 领先,部分纯视频理解基准仍是 Google 的优势区。官方"接近 Gemini"的表述,主要适用于音频与音视频整体能力,而非所有维度。
六、生态与可用性:闭源模型,开源工具
Qwen3.8-Omni-Flash 本身没有开放权重,采取云端托管模式提供服务。目前模型已通过阿里云百炼及千问平台上线,覆盖北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚等多个区域。
配套生态则是另一番景象:随模型一同开源的多模态插件工具包 Qwen-MM-Plugins 采用 Apache 2.0 许可证,可为 Claude Code、Codex、Gemini CLI、Qwen Code 等主流编码智能体提供本地读取图像、视频帧与音频的能力。官方同步预告了面向实时连续音视频交互的 Qwen-Live-Harness(外媒对其状态披露不一:有报道称已同步开源,亦有报道称尚未发布)。
"闭源模型 + 开源工具链"的组合,显示出阿里的策略:模型能力通过 API 变现,开发者生态通过开源工具吸附,两者互为杠杆。
七、冷静看待:数字均来自官方,独立评测尚属空白
需要指出的是,截至发稿,上述全部基准成绩与成本数字均来自阿里官方口径,针对该模型的独立第三方评测尚未出现。有分析人士提示了几个待验证的问题:一是模型在官方测试集之外的语言与视频题材上表现如何;二是长会话中多步 Agent 任务的完成稳定性;三是计入帧密度、工具调用频次等变量后,真实生产环境的成本是否仍能保持宣传量级的下降。答案或许要等开发者们在真实业务中跑出数据。
八、结语
从 Qwen3.5-Omni-Plus 到 Qwen3.8-Omni-Flash,全模态模型的进化路径清晰可见:更大的上下文、更低的单位成本、更强的工具调用——三者的叠加,正在把"音视频内容处理"从一项需要专门工程团队支撑的能力,变成一次 API 调用即可完成的服务。当理解音视频的成本趋近于零,真正拉开差距的将是模型规划任务与交付成果的能力。千问与 Gemini 在多模态领域的缠斗,也将在这一新维度上继续升级。