如果你最近在用多模态 API,一定知道那个数字:Gemini 3.8 Flash,输入 $0.75/M tokens,输出 $3.75/M tokens。Google 的 Flash 系列一直是多模态性价比的标杆。
然后昨天,阿里直接把桌子掀了。
Qwen3.8-Omni-Flash:输入 $0.15/M tokens,输出 $0.47/M tokens。整份账单只有 Gemini 3.8 Flash 的 1/5。
而且不是「便宜但弱」——它在多模态 Benchmark 上的表现接近甚至超过 Gemini 3.8 Flash,尤其是在音频理解方面。更重要的是,它引入了一个叫 Agentic Perception 的东西:不是逐帧处理视频,而是让模型自己决定「看哪里」,结果 tokens 省了 45.7%,准确率反而提升了。
这篇文章帮你拆解:它到底是什么、凭什么这么便宜、以及这对你意味着什么。
不是「简化版」,是「另一条路线」
先厘清一件事:Qwen3.8-Omni-Flash 不是 Qwen 3.8 旗舰版(2.4T 参数 MoE)的精简版,而是一个原生全模态模型。
| 维度 | Qwen3.8-Omni-Flash | Qwen 3.8(旗舰版) | Gemini 3.8 Flash |
|---|---|---|---|
| 架构基础 | Qwen3.8-Flash-Next | 2.4T MoE (A95B) | Gemini 3.8 |
| 输入模态 | 文本/图像/音频/视频 | 文本/图像/视频 | 文本/图像/音频/视频 |
| 输出 | 文本 | 文本 | 文本 |
| 上下文 | 1M tokens | 1M tokens | 1M tokens |
| 定价(输入) | $0.15/M | $2.00/M | $0.75/M |
| 定价(输出) | $0.47/M | $6.00/M | $3.75/M |
| 开放权重 | ❌ API only | ✅ 开源 | ❌ |
| 发布日期 | 2026-09-18 | 2026-08-03 | 2026-09-02 |
注意这个关键差异:
Qwen 3.8 旗舰版是「推理引擎也能看视频」,而 Qwen3.8-Omni-Flash 是「感知与行动引擎也会推理」。前者优化的是每个 token 的深度,后者优化的是每小时内容的 token 成本。
OrcaRouter 的分析师 Alistair Wren 说得直白:「两个模型共享一个家族名和一个 1M 上下文窗口,但它们不是替代品,而是回答完全不同的问题。」
Agentic Perception:不是看完再想,是想好了再看
这是 Qwen3.8-Omni-Flash 最核心的技术亮点。
大多数视频理解模型的做法是:把整个视频从头到尾逐帧编码,然后问问题。如果一段 2 小时的视频里答案只出现在 3 分钟里,那 95% 的计算被浪费了。
Qwen 团队的做法是反过来:从问题出发,让模型决定看什么、听什么。它按照 coarse-to-fine 的多轮搜索策略逐步定位相关片段,只处理需要的那部分。
结果:
| 指标 | 逐帧处理 | Agentic Perception | 变化 |
|---|---|---|---|
| OmniVideoBench 准确率 | 63.4 | 67.8 | +4.4 |
| 每查询 tokens 消耗 | 145,736 | 79,117 | -45.7% |
又省 token 又提分——这在 AI 领域是罕见的「双重红利」。通常省计算就意味着牺牲质量,但 Agentic Perception 通过更智能的采样策略打破了这种权衡。
Benchmark:凭数据说话
Qwen 团队在 29 项评测上做了对比,相比上一代 Qwen3.5-Omni-Plus,平均提升超过 26%。
文本与编码能力
| 评测项 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | 提升 |
|---|---|---|---|
| Terminal-Bench | 60.5 | 48.2 | +12.3 |
| LiveCodeBench | 52.1 | 41.8 | +10.3 |
| IFBench | 84.2 | 72.6 | +11.6 |
| GPQA Diamond | 56.8 | 45.3 | +11.5 |
多模态与感知能力
| 评测项 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | 对比 Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | — |
| AgenticVBench | 82.1 | 59.8 | — |
| UniClawBench | 69.6 | — | — |
| OmniVideoBench | 67.8 | 58.2 | 接近 |
| LongAudioSpan | 63.5 | 55.2 | 接近 |
| VoiceBench | 91.6 | — | 超过 |
Qwen 团队特别指出:音频整体表现超过 Gemini 3.8 Flash,音视频综合性能接近。考虑到 1/5 的价格,这个成绩非常能打。
Agent 与工具调用
| 评测项 | Qwen3.8-Omni-Flash | 说明 |
|---|---|---|
| WildClawBench-MM | 71.0 | +36.5 vs 前代 |
| StreamingBench | 80.8 | 流式 Agent 任务 |
| AliMeeting DER | 3.35 | 会议角色分离(越低越好) |
| AliMeeting CPWER | 17.18 | 词错误率(越低越好) |
AliMeeting 的数据对比最夸张:DER 从前代 88.11 降到 3.35——25 倍的改进,这已经不是「迭代」而是「换赛道」了。
🚀 最大亮点:WildClawBench-MM 提升 36.5 分,是全部评测中增幅最大的,也是 Agentic Perception 能力最直接的证明。
定价深度对比:1/5 不是全部故事
费率对比
| 费率项 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash | 倍数 |
|---|---|---|---|
| 输入 ($/M tokens) | $0.15 | $0.75 | 5x |
| 输出 ($/M tokens) | $0.47 | $3.75 | 8x |
| 缓存命中 ($/M tokens) | $0.016 | $0.03125 | 2x |
| 音频输入(每小时) | ~$0.36 | — | 比上代降 98% |
| 音视频输入(每小时) | ~$0.72 | — | 比上代降 93% |
| 视频输入(每小时) | ~$1.44 | — | 比上代降 89% |
真正的冲击在媒体输入。Qwen 团队公布的数据显示,音频输入成本相比 Qwen3.5-Omni-Plus 下降了超过 98%,音视频输入下降 93%,视频输入下降 89%。
这意味着什么?
如果你在做音视频分析——会议转录、播客摘要、视频内容审核——Qwen3.8-Omni-Flash 极大降低了把「全量媒体输入」变成产品标配的成本门槛。以前只能在关键片段上做 AI 分析的场景,现在可以整段扔进去。
场景化成本对比
| 场景 | 每周用量 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash | 节省 |
|---|---|---|---|---|
| 客服通话分析(10 万通/周) | ~200M tokens | $30/周 | $150/周 | 80% |
| 视频内容审核(1000 小时/周) | ~500M tokens | $75/周 | $375/周 | 80% |
| 通用多模态推理(100 万次/周) | ~300M tokens | $45/周 | $225/周 | 80% |
上面的场景化计算基于输入为主的 workload,输出场景差距更大(8x)。
部署:六区域、OpenAI 协议、即开即用
Qwen3.8-Omni-Flash 目前是 API only,暂时没有开放权重。但部署支持很全面:
- 六区域覆盖:北京、新加坡、香港、东京、法兰克福、弗吉尼亚
- API 兼容:同时支持 DashScope 和 OpenAI 协议,无需改代码
- 功能齐全:Function Calling、Web Search、Structured Outputs、Context Caching、Batch 全部支持
- 视频输入:支持最多 2 小时/2GB 视频文件(通过 URL),15fps 稳定采样
- 音频输入:支持最多 3 小时,113 种语言
- 多声道:支持双声道立体声和四声道 FOA 空间音频
调用方式只需要几行 Python:
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": video_url}},
{"type": "text", "text": "列出关键事件的时间戳。"},
]
}],
modalities=["text"],
)
默认为思考模式(reasoning_effort 默认 xhigh),可以关闭。
不止模型:开源工具链补全生态
Qwen 团队同步开源了两套工具:
Qwen-MM-Plugins(Apache-2.0):一套插件系统,让本地 Agent 框架(Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI)能直接调用 Omni 模型的多模态能力。核心功能包含:
omni-memory:构建音视频长期记忆omni-video2note:把教程视频转成带图 PDFomni-chatcut:音乐 MV 解说、电影评论、视频翻译
Qwen-Live Harness:开源的 Agent 能力评测框架,可复现 WildClawBench 等评测。
目前有一个已知缺口:本地 harness 还不能原生传递音频到主模型,音频需要通过 API 路由。README 已经标注了这个问题。
写在最后
Qwen3.8-Omni-Flash 的意义不止于「又一个便宜的多模态模型」。
它标志着一个转变:Flash 类模型的竞争从「堆参数」转向了「堆感知效率」。Agentic Perception 技术——让模型自己决定看什么——比单纯增加上下文窗口更有工程价值。因为它直接影响了使用成本曲线。
对于做音视频 AI 产品的团队来说,这个模型提供的不仅是 1/5 的价格,更是一个产品设计空间的打开:当「把整个视频扔进去分析」的成本低到可以忽略不计时,你能做哪些以前不敢做的功能?
这可能是今年多模态赛道上最重要的一次定价信号。
📌 延伸阅读:如果你对 Qwen 生态感兴趣,可以看看我上个月写的 《Qwen 3.8-27B 开源发布!》——那篇聊的是开源的 27B 推理模型,和今天的全模态 API 是同一个家族的不同分支。另外,《Google 拆分语音产品线!Gemini 3.8 Live 登顶语音排行榜》 可以帮你了解今天文章里的对比对象 Gemini Flash 的全貌。