如果你关注 AI 模型战场,昨天 Anthropic 扔出了一颗核弹。
Claude Opus 5 在 7 月 24 日正式发布——定价不变($5/$25 每百万 token),但性能直接逼近自家最贵的 Fable 5($10/$50)。不止如此,在 ARC-AGI 3 这个专门用来防「刷榜」的推理基准上,Opus 5 以 30.2% 的分数暴打 GPT-5.6 Sol 的 7.8%,四倍碾压。
这不是小修小补。这是一个模型定价体系正在被重构的信号。
先看清全局:Anthropic 的模型梯队
如果你只用过 ChatGPT,先看一下 Claude 家族的完整图谱:
| 模型 | 输入价格 ($/M tokens) | 输出价格 ($/M tokens) | 定位 |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | 轻量级日常任务 |
| Sonnet 5 | $2* | $10 | 主力工作模型 |
| Opus 5 (NEW) | $5 | $25 | 性价比旗舰 ⭐ |
| Fable 5 | $10 | $50 | 前沿旗舰 |
| Mythos 5 | 不公开出售 | 不公开出售 | 网络安全专用(限合作方) |
*Sonnet 5 的 $2 优惠价到 8 月 31 日截至。
Opus 5 的定价和它的前任 Opus 4.8 一模一样,但性能翻了一倍不止。你付同样的钱,拿到接近 Fable 5 的能力。 这在 2026 年的模型市场中是一个罕见的「加量不加价」案例。
Frontier-Bench v0.1:Opus 5 直接超越 Fable 5
Frontier-Bench v0.1 是一个端到端工程编码基准——多文件修改、调试、从需求规格写代码。这不是选择题,而是真实的软件开发任务。
| 模型 | Frontier-Bench v0.1 得分 |
|---|---|
| Opus 4.8 | 18.7% |
| Fable 5 | 33.7% |
| Opus 5 | 43.3% 🏆 |
看点在于:Opus 5 不仅比 Opus 4.8 翻了一倍多(18.7% → 43.3%),还直接超越了 Fable 5 的 33.7%。 发布前一天,业内普遍预期 Opus 5 会「接近 Fable 5 但不会超越」。结果 Anthropic 直接打脸了这个预期。
在 CursorBench 3.2 上,Opus 5 在最大推理强度下距离 Fable 5 峰值仅差 0.5%,但成本只有一半。Cognition(Devin 背后的公司)CEO Scott Wu 确认:「Opus 5 以半价达到 Fable 级性能,尤其在调试和根因分析上表现突出。」
ARC-AGI 3:这个数字改了游戏规则
ARC-AGI 3 是 François Chollet 设计的一个特殊基准——它不是为了测「模型记住了多少」,而是测模型能否在全新规则下自主推理。
想象一下:你把一个 AI Agent 扔进一个完全陌生的交互环境,没有说明书、没有规则、没有目标——它必须通过试错自己搞懂一切。这才是真正接近「智能」的测试。
| 模型 | ARC-AGI 3 得分 (RHAE%) |
|---|---|
| Opus 4.8 | 1.5% |
| GPT-5.6 Sol | 7.8% |
| Opus 5 | 30.2% 🏆 |
| 人类参考 | 100% |
数字说明一切:
- Opus 5 是 Opus 4.8 的 20 倍
- 是 GPT-5.6 Sol 的 4 倍
- 是发布前最强分数(7.8%)的 近 4 倍
2026 年 3 月 ARC-AGI 3 刚发布时,最佳 AI 模型只能拿到 0.37%。到 GPT-5.6 Sol 刷到 7.8% 时,大家都觉得这已经很强了。Opus 5 直接跳到 30.2%,让整个行业的预期被重新设定。
这个分数的意义不在于数字本身,而在于它证明了:Opus 5 不是在回忆训练数据里见过的模式——它真的在「理解」陌生的规则系统并做出反应。 这是「模式匹配」和「推理」之间的本质区别。
它会检查自己的作业:从被动回答到主动验证
Anthropic 分享了几个客户测试故事,比任何 Benchmark 都更有说服力:
在 Frontier-Bench 的一个任务中,Opus 5 被要求根据一张机械零件图纸写出 FreeCAD 的 3D 重建代码。但故意不给它看图纸本身的方法。 Opus 5 的反应是:自己写了一个计算机视觉流水线,从原始像素中提取几何结构,然后成功完成了重建。其他模型在 5 次尝试中全部失败。
另一个案例:面对一个真实的开源包管理器 bug,Opus 5 找到了根因并修复了社区补丁遗漏的边缘情况。竞品模型只修了表面症状就报告「bug 已解决」。
一个交易公司的工程师用 Opus 5 搭建新交易所的行情数据源——之前所有模型都做不了。因为找不到真实行情流来验证,Opus 5 自己写了一个测试工具来检查自己的代码是否正确解析了交易所的数据格式。
这就是 Opus 5 的核心变化:它不是简单地回答问题,而是验证自己的答案、发现自己的错误、主动迭代直到成功。 Zapier 的 Wade Foster 说得很直白:「之前的模型无法通过我们的基准测试。Opus 5 直接 100% 通过。」
安全与对齐:Fable 5 的教训,Opus 5 的答卷
Fable 5 的发布之路并不平坦。2026 年 6 月,亚马逊研究人员找到了绕过其安全护栏的方法,触发了美国政府出口管制指令,Fable 5 被迫下线两周。用户同时抱怨护栏太严,影响了编码和生物研究的可用性。
Opus 5 的答案很巧妙:更安全,同时更少干预。
在 Anthropic 的内部行为审计中,Opus 5 的「不当行为」得分仅为 2.30——这是所有 Claude 模型中的最低值(越少越好)。同时安全分类器的触发频率比 Fable 5 低了 85%。
在网络安全能力上,Opus 5 被刻意限制了:它能发现源代码中的漏洞(防御性工作),但不能进行二进制扫描、渗透测试或利用开发(攻击性工作)。当分类器触发时,请求自动回退到 Opus 4.8 处理,而不是直接拒绝——用户体验更流畅。
竞争格局:Opus 5 为什么在这个时间点发布
发布前一天,X 上的分析师 Yamikishi 说了一句关键话:「Opus 5 今天只有一个任务——不是赢取另一个 Benchmark,而是证明 Anthropic 还能收前沿溢价。」
背景是:Kimi K3 在 Text Arena 上以 $3/$15 的价格(对比 Opus 4.8 的 $5/$25)接近了 Opus 4.8 的水平,并且计划在 7 月 27 日(后天!)开源完整权重。GPT-5.6 Sol 则一直在打「每任务成本」的营销牌。整个模型市场正在变得极其价格敏感。
Opus 5 没有在绝对价格上压低——它仍然高于 Sol 和 K3。但 Anthropic 的论点是:真正应该看的不是每 token 价格,而是每任务性能。 一个模型需要两次尝试才能完成的工作,另一个模型一次就搞定——后者的实际成本可能更低。Frontier-Bench 和 OSWorld 的结果支持了这个论点,而 ARC-AGI 3 的数据让这个论点变得难以反驳。
Effort Dial:一个被低估的商业武器
Opus 5 带来了一个叫 Effort Dial 的功能(低/中/高/xhigh/最大 五档),让开发者可以精确控制模型在每个任务上的推理投入。低推理意味着更少的 token 消耗和更快响应,高推理意味着更好的结果但更高成本。
这不是一个锦上添花的 UI 功能——它是 Opus 5 整个商业逻辑的基础。Anthropic 发布的 Benchmark 图表全部是成本 vs 性能曲线,而不是单点分数。Opus 5 的优势不仅仅是在最大强度下得分高,而是在每一个推理强度下,每花一美元获得的性能都领先于所有竞争对手。
简单说:你用低强度处理简单任务,省钱省时间;用高强度处理复杂任务,花钱买质量。Opus 5 在两端都比你用其他模型划算。
写在最后
Opus 5 的发布让我想起一句话:最好的产品策略不是降价,而是让你的价格变成 bargain。
Opus 5 没有降价——它的定价和 Opus 4.8 完全一样。但它的性能提升如此显著,以至于 $5/$25 这个价位突然变得极具吸引力。如果 Fable 5 是奢侈品牌,Opus 5 就是那个品质接近奢侈品的轻奢线——而价格只有一半。
对于正在选型的企业团队来说,Opus 5 的出现是一个分水岭:之前你可能需要在「便宜但不够聪明」(Sonnet 5)和「聪明但太贵」(Fable 5)之间做取舍。现在多了一个「足够聪明、价格合理」的中间选项,而且它恰好是编码和推理表现最好的那个。
接下来的悬念只剩下两个:后天的 Kimi K3 开源会对市场产生什么冲击?以及,当模型价格在持续下探、性能在持续提升时,以「每 token 收费」这种商业模式本身还能撑多久?