如果你关注开源模型的进展,昨天 DeepSeek 扔出了一颗重磅炸弹——V4.1 Flash。这不仅仅是一个新版本号,而是一次架构、定价和定位的三重跳升:一个 MIT 协议可下载、552B 参数但仅激活 8B、1M 上下文窗口的开源模型,在五项最难的 Agent 评测上全部干翻 GPT-5.6 Sol 和 Claude Opus 5。
更炸裂的是,DeepSeek 宣布将在 9 月 14 日退役 V4 Pro(之前卖 $1/$4 的旗舰)。所有 Pro 流量直接路由到 V4.1 Flash,按 Flash 的价格计费。一个开源模型,成了 DeepSeek 事实上的新旗舰。
架构拆解:Causal Encoder-Decoder + 890 字节 KV 缓存
V4.1 Flash 的架构可能是今年最被低估的创新。它采用了Causal Encoder-Decoder(CED)设计:40 层 Transformer 被拆成 20 层因果编码器 + 20 层解码器,解码器的全局 KV 缓存从编码器最终隐藏态投影而来,不再逐层重建。
配合 Compressed Sparse Attention 2(CSA2) 和 FP4 KV 缓存(E2M1 格式),全局 KV 缓存压缩到 890 字节/token——只有 V4 Flash 的四分之一,V1 版本的四百分之一。一个 SWA Bounded Replay 技术进一步把持久 KV 缓存足迹降到 V4 Flash 的八分之一。
模型还内置了一个 196B 参数的 conditional memory 模块(Engram),通过 token-based lookup 稀疏访问。每个 MoE 层有 1 个共享 expert + 384 个路由 expert,每 token 激活 6 个路由 expert。
训练数据:从零开始训了 45T tokens,在 34T 标记时将上下文扩展到 1M。后训练使用标准的 SFT + RL + on-policy distillation。
工程意义上的核心数字:
| 参数 | 值 |
|---|---|
| backbone 参数 | 552B |
| 预填充激活 | 8B/token |
| 解码激活 | 16B/token |
| 上下文窗口 | 1,048,576 tokens |
| 最大输出 | 384,000 tokens |
| KV 缓存 | 890 bytes/token |
| 权重许可 | MIT |
| 多模态 | 原生图片 + 文本输入 |
评测成绩:五项全胜,开源模型首次登顶
按照 DeepSeek 官方模型卡在最大推理 effort 下的数据,V4.1 Flash 在五个关键 Agent 评测上同时击败 GPT-5.6 Sol 和 Claude Opus 5:
| 评测 | GPT-5.6 Sol | Claude Opus 5.0 | DeepSeek V4.1 Flash |
|---|---|---|---|
| DeepSWE v1.1(真实 GitHub issue 修复) | 73.0 | 74.0 | 74.2 🚀 |
| Terminal-Bench 2.1(终端任务) | 88.8 | 89.1 | 90.6 🚀 |
| AutomationBench(工作流自动化) | 45.8 | 50.3 | 54.8 🚀 |
| Agent’s Last Exam(Agent 推理) | 26.7 | 28.6 | 31.8 🚀 |
| CyberGym(网络安全任务) | 84.5 | N/R | 88.1 🚀 |
| HLE with tools(综合) | N/R | 63.6 | 63.9 |
| Terminal-Bench 4.0(长 horizon) | 39.9 | 51.8 | 31.2 |
| ProgramBench Almost@1(编程) | 23.0 | 37.0 | 20.3 |
| NL2Repo-Bench(仓库级编码) | 56.8 | 75.3 | 64.0 |
五项全胜,包括含金量极高的 DeepSWE(真实 GitHub issue)和 Terminal-Bench 2.1(终端操作)。
不过三个短板也值得关注:Terminal-Bench 4.0(长 horizon 任务)只有 31.2,远低于 Opus 5 的 51.8——说明长时间序列的复杂编排仍不是它的强项。ProgramBench 和 NL2Repo-Bench 也被 Opus 5 拉开较大差距。V4.1 Flash 的强项集中在 短 Horizon、高吞吐的 Agent 工作流,而非深度推理或超长序列规划。
Codeforces 评分从 V4 Pro 的 3348 上升到 3471,MathArena Apex 上 65.6 追平 Kimi K3。
定价掀桌:比 Sol 便宜几倍,还直接废掉自家 V4 Pro
V4.1 Flash 的定价策略值得单独说。它不是简单的「新模型降价」,而是直接把旗舰产品退役了:
| 价格类型 | 峰值(中国白天) | 非峰值 |
|---|---|---|
| 输入(cache miss) | $0.30/M | $0.15/M |
| 输入(cache hit) | $0.006/M | $0.003/M |
| 输出 | $1.20/M | $0.60/M |
对比 GPT-5.6 Sol($10/$50)和 Claude Opus 5($10/$50),V4.1 Flash 的推理成本只有它们的 1/30 到 1/80。即使和自家已降价的 V4 Pro 比($1/$4),也是 3-6 倍的价差。
非峰值 $0.15/$0.60 的价格对于北美和欧洲开发者来说尤其香——换算下来一天 24 小时里大多数开发时段都在非峰值窗口内。Cache hit 价格 $0.003 意味着运行 Agent 循环(反复读取 500K 上下文)的单次成本几乎可以忽略。
最狠的一招:9 月 14 日起,请求 deepseek-v4-pro 会自动路由到 V4.1 Flash,按 Flash 价格计费。DeepSeek 官方说:「V4.1 Flash 已经在性能、成本、速度和任务完成时间上全面超越 V4 Pro。」——自己淘汰自己上代旗舰,这在模型公司里相当罕见。
开源的意义:Agent 专属推理引擎
V4.1 Flash 的 MIT 协议意味着你可以:
- 下载权重自行部署(单卡可以通过量化跑起来吗?——8B 激活参数,理论可行)
- 在 vLLM、SGLang 等框架上 serve
- 微调出自己的 Agent 专用版本
- 不用被任何 API 供应商标记数据用于训练
CED 架构的另一个隐含价值是推理经济性。Agent 工作流是输入密集型:一个编码 Agent 每步都可能重读整个上下文。890 bytes/token 的 KV 缓存 + 8B 激活参数,让长上下文重读的成本几乎不增长。对跑 Agent 循环的团队来说,这是架构层面的降维打击。
写在最后
DeepSeek V4.1 Flash 是这个月第三款「让开源模型重获信心」的发布(前有 Meta Muse Spark、Qwen 3.8 系列)。但它的 CED 架构设计和 V4 Pro 自裁式退役,释放了比评测分数更强烈的信号:开源模型的成本曲线正加速逼近甚至低于闭源模型的推理成本线。
如果这个趋势持续——8B 激活就能跑赢 100B+ 级闭源模型在 Agent 场景下的表现——那明年部署 AI Agent 时,「是否自建推理」可能不再是选择题,而是默认选项。
📌 延伸阅读:《GPT-6 Astra 横空出世!》 — GPT-6 Astra 的 Agent 能力与 Sol 的对比分析