Featured image of post Claude Fable 5.1 横空出世!标价不变,便宜 45%,Opus 5 让位了!

Claude Fable 5.1 横空出世!标价不变,便宜 45%,Opus 5 让位了!

如果你关注 AI 模型市场,昨天(9 月 1 日)是值得标记的一天——Anthropic 发布了 Claude Fable 5.1 和它的孪生兄弟 Claude Mythos 5.1。这是同一个人工智能引擎,分了两套安全护栏。

但这次发布最反常的地方在于:标价不涨反降——实际上是没涨,但账单确实少了。

Fable 5.1 的 $10/$50 输入输出定价和 Fable 5 完全一样,API ID 也没变太多(claude-fable-5-1,Fable 5 是 claude-fable-5),但 Anthropic 在缓存读取上砍了一刀狠的:从 $1 降到 $0.25,降幅 75%。对于重度 Agent 工作负载,这意味着整体花费减少 25% 到 45%。

华尔街的对冲基金已经开始行动了。Millennium 一位高级投资经理说,他们内部一个极其罕见的崩溃(百万分之一级别),工程师花了 四五年都没找到原因,其他所有模型也都失败,Fable 5.1 第一次跑就定位了。这件事某种意义上比任何 Benchmark 排名更有说服力。

Benchmark:全面碾压,不留死角

先上这张表。Anthropic 官方发布时给出的七项基准测试,Fable 5.1 全部领先:

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1(Agent 科研) 52.6 🚀 24.7 29.0 22.4
Terminal-Bench 4.0(Agent 终端编码) 55.8 42.0 52.3 37.3
GDPval-AA v2(知识工作,Elo) 1,853 1,723 1,824 1,711
OSWorld 2.0(计算机使用,部分/严格) 77.9 / 41.7 72.9 / 36.1 75.4 / 39.6 未公布
Humanity’s Last Exam(无工具/有工具) 60.9 / 65.0 57.8 / 63.8 56.6 / 63.6 未公布
AutomationBench(业务流程) 31.4 🚀 17.1 26.9 19.6
CursorBench 3.2.0(Agent 编码) 73.4 70.5 70.0 67.2

两个值得单独看的数据:

Terminal-Bench-Science 是差距最大的——52.6 vs 24.7,三倍不到的时间内直接把前代翻了一番。这不是渐进式改进,而是代际跳跃。对于一个用来做 Agent 科研任务的模型来说,这个数字意味着它真的可以在实验室里当半个研究员用。

AutomationBench 差不多也是翻倍:31.4 vs 17.1,比 Opus 5 也高出 4.5 分。Zapier 搭建的这个端到端业务工作流评测,对 AI Agent 的实用价值是直接信号。

Cognition(Devin 背后的团队)的 CTO Walden Yan 说得很直接:「我们发布当天就把 Devin 里的 Opus 5 流量切到 Fable 5.1 了。 测试下来它和 Fable 5 得分持平或更好,但每个任务的成本反而更低。有了新的缓存读取定价,Fable 级模型终于在我们这里真正经济能用了。」

真正的赢家是 Effort 曲线,不只是峰值

上面的表格比较的是各家模型的最好成绩。但更精彩的故事藏在「付出 vs 回报」曲线里。

Anthropic 的 Fable 5.1 在低(low)努力模式下,得分约 26%,每任务成本约 $11。对比 Fable 5 开到最大(max)努力模式才得 24.7%,每任务成本 $44。

Fable 5.1 的最低档,打翻了 Fable 5 的最高档,花费还只要四分之一。

而且两根曲线从没碰在一起过:Fable 5.1 的 high 档(约 40%,$20)就超过了 Fable 5 全部档次,甚至比 Opus 5 的最高分还高;曲线继续爬升到 xhigh(约 49%)和 max(52.6%),而 Fable 5 早就平了。

这意味着什么呢?如果你还在用路由策略把简单任务分配给小模型、难任务留给大模型,现在 Fable 5.1 的低档跑进这个比较范围了。Anthropic 的提示工程指南也直接说:在低努力下,「Fable 5.1 在单位成本上往往能和其他 Claude Opus 和 Sonnet 模型竞争,而且得分更高。」

Every 的 CEO Dan Shipper 总结得更形象:「这是个友好的 Fable——Fable 级的智力、Opus 级的价格、Sonnet 的速度。 我们测试下来大约是 Opus 5 的两倍速度,一半的 token 消耗。所以任何人如果把 Opus 当日常模型用,这绝对是个明显的升级。」

三处破坏性变更——你的代码可能需要修

这块是容易被忽略的部分。Fable 5.1 有三个破坏性 API 变更,生产环境中如果没用过,第一个下午就会看到 400 报错:

1. 强制工具调用(forced tool use)被禁了

以前 Fable 5 接受所有 tool_choice 值,包括 type: "any"type: "tool", name: "..."。Fable 5.1 和 Mythos 5.1 会直接返回 400,原因是思考(thinking)始终启用,强制调用会跳过思考过程。修复方案:改成 tool_choice: "auto" + strict: true + 在指令中指定工具名称,或者用结构化输出(structured outputs)。

2. 旧模型无法读取 Fable 5.1 的思考块

每个 thinking block 记录了由哪个模型生成,规则是单向的——Fable 5.1 能读旧模型(Opus 5、Fable 5、Mythos 5 及更早),但旧模型不能读 Fable 5.1 的。如果路由切换、客户端重试或兜底降级时遇到不匹配的 block,API 会静默丢弃,不收费,但目标模型会重算,成本上升、延迟增加。

3. 编辑对话历史会让 thinking block 作废

每条 thinking block 只对当时的 system prompt、tools 数组和 message 历史有效。如果你代码中改了之前的任何内容,再发回带那块的请求会直接失败——message 校验不通过。不过这条只在 2026 年 8 月 31 日之后创建的新 API 账户上强制生效。Anthropic 明确说这是针对蒸馏(distillation)的防护:保留 Claude 的思考过程同时编辑上下文,是一种「公开的蒸馏技术」。

Mythos 5.1:同引擎,低护栏

跟着 Fable 5.1 一起发布的还有 Claude Mythos 5.1,和 Fable 5.1 完全相同的权重,只是安全护栏更宽松。它只对经过审查的网络安全和生命科学组织开放,走 Anthropic 的「Project Glasswing」信任访问计划(Cyber Verification Program + Life Sciences Verification Program),目前只面向美国组织。

最有意思的对比数据是:Mythos 5.1 在 Terminal-Bench 4.0 上拿了 60.9,比 Fable 5.1 的 55.8 高了 5 分。Anthropic 坦诚地解释说:那 5 分「反映的是我们更粗糙的旧安全护栏介入的那些任务。」换句话说,安全护栏是有代价的——这是 AI 安全领域经常被低估的「护栏税」(safety tax)。

定价对比:Cache 阅读就是新战场

Fable 5.1 的定价结构最值得关注的变化不是标价,而是缓存读取价格

项目 Fable 5 Fable 5.1 变化
输入 / M tokens $10 $10 不变
输出 / M tokens $50 $50 不变
缓存读取 / M tokens $1.00 $0.25 🚀 75%
缓存写入(5分钟) $12.50 $12.50 不变
缓存写入(1小时) $20 $20 不变
Batch 输入 $5.00 $5.00 不变
Batch 输出 $25.00 $25.00 不变

这一刀砍下去,Fable 5.1 的有效成本率变了天。Fable 5 的缓存读取是输入的 10%($1/$10),Fable 5.1 的缓存读取只有输入的 2.5%($0.25/$10)。这意味着长上下文 Agent 任务中,预填充(prefix)的重复读取几乎免费了。

Anthropic 这次没有拿 Opus 5 的数据做比较,但我们从合作伙伴那里看到了选择逻辑:Opus 5 的缓存读取 $0.50 是 Fable 5.1 的 2 倍,且 Fable 5.1 在所有 Benchmark 上领先——Opus 5 唯一的优势是零数据留存(zero data retention)现在可用,而 Fable 5.1 要到今年秋季的 Enterprise Frontier Safeguards 落地后才能免除 30 天强制留存。

Opus 5 还活着吗?

Opus 5 的处境有点尴尬。它输掉了所有七项 Benchmark,合作伙伴引用中几乎没有人选它。但 Anthropic 的官方提示仍然说:大多数工作负载从 Opus 5 开始

理由有三:

  1. 价格便宜一半:Opus 5 是 $5/$25,Fable 5.1 是 $10/$50。如果你的质量门槛 Opus 5 已经能过,Fable 5.1 就是花了双倍钱。
  2. 零数据留存可用:今天就有,Fable 5.1 强制 30 天,除非你拿到 Anthropic 的特批。
  3. API 表面更友好:支持强制工具调用、可禁用思考、有 Batch 300K 扩展输出——每一条都是 Fable 5.1 的限制。

所以短期内 Opus 5 不会消失。但方向很清楚了——质量在向 Fable 类模型汇聚,而 Opus 类的存在意义正在变窄。

写在最后

Fable 5.1 的发布节奏很特别:标价不变,账单变少,性能更高。 这不是一个典型的涨价式模型发布,而是一个成本效率发布。

Anthropic 巧妙地绕开了一场价格战:别的公司在降标价,它们降缓存价格。这个战术的聪明之处在于——缓存价格不影响竞争对手直接用数字做比较,但对重度用户(Agent 开发者、企业、编码助手)来说,有效成本是实打实的 25-45% 降低。

关于 Mythos 5.1 那 5 分的「安全护栏税」,我认为值得行业思考:如果你在构建需要最高 AI 能力的 Agent 系统,安全护栏的成本不只是 token 和延迟,还有真实的性能差距。这不是说安全不重要——而是说明它有多贵。

最后,如果你跑的是 Fable 5 或 Opus 5 的生产管线,建议立刻做 migration 测试:三个破坏性变更中,forced tool use 的禁令和 history editing 的 check 会直接影响你的代码。跑一轮 eval 确认兼容性,再把关键负载切过来——Cache $0.25 的利率窗口不会永远开着。

📌 延伸阅读:如果你对模型路由选择感兴趣,不妨看看我们之前写的 《Agent 互联!五大协议详解》,里面讨论了不同协议下的路由策略,和 Fable 5.1 的 Effort 曲线选择一脉相承。

By AI博士 万戈