如果你关注 AI 模型市场,昨天(9 月 1 日)是值得标记的一天——Anthropic 发布了 Claude Fable 5.1 和它的孪生兄弟 Claude Mythos 5.1。这是同一个人工智能引擎,分了两套安全护栏。
但这次发布最反常的地方在于:标价不涨反降——实际上是没涨,但账单确实少了。
Fable 5.1 的 $10/$50 输入输出定价和 Fable 5 完全一样,API ID 也没变太多(claude-fable-5-1,Fable 5 是 claude-fable-5),但 Anthropic 在缓存读取上砍了一刀狠的:从 $1 降到 $0.25,降幅 75%。对于重度 Agent 工作负载,这意味着整体花费减少 25% 到 45%。
华尔街的对冲基金已经开始行动了。Millennium 一位高级投资经理说,他们内部一个极其罕见的崩溃(百万分之一级别),工程师花了 四五年都没找到原因,其他所有模型也都失败,Fable 5.1 第一次跑就定位了。这件事某种意义上比任何 Benchmark 排名更有说服力。
Benchmark:全面碾压,不留死角
先上这张表。Anthropic 官方发布时给出的七项基准测试,Fable 5.1 全部领先:
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1(Agent 科研) | 52.6 🚀 | 24.7 | 29.0 | 22.4 |
| Terminal-Bench 4.0(Agent 终端编码) | 55.8 | 42.0 | 52.3 | 37.3 |
| GDPval-AA v2(知识工作,Elo) | 1,853 | 1,723 | 1,824 | 1,711 |
| OSWorld 2.0(计算机使用,部分/严格) | 77.9 / 41.7 | 72.9 / 36.1 | 75.4 / 39.6 | 未公布 |
| Humanity’s Last Exam(无工具/有工具) | 60.9 / 65.0 | 57.8 / 63.8 | 56.6 / 63.6 | 未公布 |
| AutomationBench(业务流程) | 31.4 🚀 | 17.1 | 26.9 | 19.6 |
| CursorBench 3.2.0(Agent 编码) | 73.4 | 70.5 | 70.0 | 67.2 |
两个值得单独看的数据:
Terminal-Bench-Science 是差距最大的——52.6 vs 24.7,三倍不到的时间内直接把前代翻了一番。这不是渐进式改进,而是代际跳跃。对于一个用来做 Agent 科研任务的模型来说,这个数字意味着它真的可以在实验室里当半个研究员用。
AutomationBench 差不多也是翻倍:31.4 vs 17.1,比 Opus 5 也高出 4.5 分。Zapier 搭建的这个端到端业务工作流评测,对 AI Agent 的实用价值是直接信号。
Cognition(Devin 背后的团队)的 CTO Walden Yan 说得很直接:「我们发布当天就把 Devin 里的 Opus 5 流量切到 Fable 5.1 了。 测试下来它和 Fable 5 得分持平或更好,但每个任务的成本反而更低。有了新的缓存读取定价,Fable 级模型终于在我们这里真正经济能用了。」
真正的赢家是 Effort 曲线,不只是峰值
上面的表格比较的是各家模型的最好成绩。但更精彩的故事藏在「付出 vs 回报」曲线里。
Anthropic 的 Fable 5.1 在低(low)努力模式下,得分约 26%,每任务成本约 $11。对比 Fable 5 开到最大(max)努力模式才得 24.7%,每任务成本 $44。
Fable 5.1 的最低档,打翻了 Fable 5 的最高档,花费还只要四分之一。
而且两根曲线从没碰在一起过:Fable 5.1 的 high 档(约 40%,$20)就超过了 Fable 5 全部档次,甚至比 Opus 5 的最高分还高;曲线继续爬升到 xhigh(约 49%)和 max(52.6%),而 Fable 5 早就平了。
这意味着什么呢?如果你还在用路由策略把简单任务分配给小模型、难任务留给大模型,现在 Fable 5.1 的低档跑进这个比较范围了。Anthropic 的提示工程指南也直接说:在低努力下,「Fable 5.1 在单位成本上往往能和其他 Claude Opus 和 Sonnet 模型竞争,而且得分更高。」
Every 的 CEO Dan Shipper 总结得更形象:「这是个友好的 Fable——Fable 级的智力、Opus 级的价格、Sonnet 的速度。 我们测试下来大约是 Opus 5 的两倍速度,一半的 token 消耗。所以任何人如果把 Opus 当日常模型用,这绝对是个明显的升级。」
三处破坏性变更——你的代码可能需要修
这块是容易被忽略的部分。Fable 5.1 有三个破坏性 API 变更,生产环境中如果没用过,第一个下午就会看到 400 报错:
1. 强制工具调用(forced tool use)被禁了
以前 Fable 5 接受所有 tool_choice 值,包括 type: "any" 和 type: "tool", name: "..."。Fable 5.1 和 Mythos 5.1 会直接返回 400,原因是思考(thinking)始终启用,强制调用会跳过思考过程。修复方案:改成 tool_choice: "auto" + strict: true + 在指令中指定工具名称,或者用结构化输出(structured outputs)。
2. 旧模型无法读取 Fable 5.1 的思考块
每个 thinking block 记录了由哪个模型生成,规则是单向的——Fable 5.1 能读旧模型(Opus 5、Fable 5、Mythos 5 及更早),但旧模型不能读 Fable 5.1 的。如果路由切换、客户端重试或兜底降级时遇到不匹配的 block,API 会静默丢弃,不收费,但目标模型会重算,成本上升、延迟增加。
3. 编辑对话历史会让 thinking block 作废
每条 thinking block 只对当时的 system prompt、tools 数组和 message 历史有效。如果你代码中改了之前的任何内容,再发回带那块的请求会直接失败——message 校验不通过。不过这条只在 2026 年 8 月 31 日之后创建的新 API 账户上强制生效。Anthropic 明确说这是针对蒸馏(distillation)的防护:保留 Claude 的思考过程同时编辑上下文,是一种「公开的蒸馏技术」。
Mythos 5.1:同引擎,低护栏
跟着 Fable 5.1 一起发布的还有 Claude Mythos 5.1,和 Fable 5.1 完全相同的权重,只是安全护栏更宽松。它只对经过审查的网络安全和生命科学组织开放,走 Anthropic 的「Project Glasswing」信任访问计划(Cyber Verification Program + Life Sciences Verification Program),目前只面向美国组织。
最有意思的对比数据是:Mythos 5.1 在 Terminal-Bench 4.0 上拿了 60.9,比 Fable 5.1 的 55.8 高了 5 分。Anthropic 坦诚地解释说:那 5 分「反映的是我们更粗糙的旧安全护栏介入的那些任务。」换句话说,安全护栏是有代价的——这是 AI 安全领域经常被低估的「护栏税」(safety tax)。
定价对比:Cache 阅读就是新战场
Fable 5.1 的定价结构最值得关注的变化不是标价,而是缓存读取价格:
| 项目 | Fable 5 | Fable 5.1 | 变化 |
|---|---|---|---|
| 输入 / M tokens | $10 | $10 | 不变 |
| 输出 / M tokens | $50 | $50 | 不变 |
| 缓存读取 / M tokens | $1.00 | $0.25 🚀 | ↓ 75% |
| 缓存写入(5分钟) | $12.50 | $12.50 | 不变 |
| 缓存写入(1小时) | $20 | $20 | 不变 |
| Batch 输入 | $5.00 | $5.00 | 不变 |
| Batch 输出 | $25.00 | $25.00 | 不变 |
这一刀砍下去,Fable 5.1 的有效成本率变了天。Fable 5 的缓存读取是输入的 10%($1/$10),Fable 5.1 的缓存读取只有输入的 2.5%($0.25/$10)。这意味着长上下文 Agent 任务中,预填充(prefix)的重复读取几乎免费了。
Anthropic 这次没有拿 Opus 5 的数据做比较,但我们从合作伙伴那里看到了选择逻辑:Opus 5 的缓存读取 $0.50 是 Fable 5.1 的 2 倍,且 Fable 5.1 在所有 Benchmark 上领先——Opus 5 唯一的优势是零数据留存(zero data retention)现在可用,而 Fable 5.1 要到今年秋季的 Enterprise Frontier Safeguards 落地后才能免除 30 天强制留存。
Opus 5 还活着吗?
Opus 5 的处境有点尴尬。它输掉了所有七项 Benchmark,合作伙伴引用中几乎没有人选它。但 Anthropic 的官方提示仍然说:大多数工作负载从 Opus 5 开始。
理由有三:
- 价格便宜一半:Opus 5 是 $5/$25,Fable 5.1 是 $10/$50。如果你的质量门槛 Opus 5 已经能过,Fable 5.1 就是花了双倍钱。
- 零数据留存可用:今天就有,Fable 5.1 强制 30 天,除非你拿到 Anthropic 的特批。
- API 表面更友好:支持强制工具调用、可禁用思考、有 Batch 300K 扩展输出——每一条都是 Fable 5.1 的限制。
所以短期内 Opus 5 不会消失。但方向很清楚了——质量在向 Fable 类模型汇聚,而 Opus 类的存在意义正在变窄。
写在最后
Fable 5.1 的发布节奏很特别:标价不变,账单变少,性能更高。 这不是一个典型的涨价式模型发布,而是一个成本效率发布。
Anthropic 巧妙地绕开了一场价格战:别的公司在降标价,它们降缓存价格。这个战术的聪明之处在于——缓存价格不影响竞争对手直接用数字做比较,但对重度用户(Agent 开发者、企业、编码助手)来说,有效成本是实打实的 25-45% 降低。
关于 Mythos 5.1 那 5 分的「安全护栏税」,我认为值得行业思考:如果你在构建需要最高 AI 能力的 Agent 系统,安全护栏的成本不只是 token 和延迟,还有真实的性能差距。这不是说安全不重要——而是说明它有多贵。
最后,如果你跑的是 Fable 5 或 Opus 5 的生产管线,建议立刻做 migration 测试:三个破坏性变更中,forced tool use 的禁令和 history editing 的 check 会直接影响你的代码。跑一轮 eval 确认兼容性,再把关键负载切过来——Cache $0.25 的利率窗口不会永远开着。
📌 延伸阅读:如果你对模型路由选择感兴趣,不妨看看我们之前写的 《Agent 互联!五大协议详解》,里面讨论了不同协议下的路由策略,和 Fable 5.1 的 Effort 曲线选择一脉相承。