Featured image of post Claude Opus 5.5 发布!同天 OpenAI 发 Luna/Sol——AI 模型竞争进入「能力 x 成本 x 安全」三维时代!

Claude Opus 5.5 发布!同天 OpenAI 发 Luna/Sol——AI 模型竞争进入「能力 x 成本 x 安全」三维时代!

如果你在 9 月 22 日打开 AI 新闻,会看到一场奇景:Anthropic 和 OpenAI 在同一天发布了新模型,但走的是两条完全不同的路。

Anthropic 拿出了 Claude Opus 5.5——性能对标自家旗舰 Fable 5.1,但定价比 Opus 5 便宜 40%,缓存价格更是直降 60%。瞄准的是「跑一整天的长任务 Agent」。

OpenAI 则亮出了 GPT-6 Luna 和 GPT-6 Sol——不是新旗舰,而是 Astra 的能力下放版。Luna 的输入价格只要 $0.10/M token,比一碗面还便宜。

这不是巧合。这是 AI 模型竞争从「谁更强」进入「谁更值」的信号。

Claude Opus 5.5:第一个 5.5 家族成员的底气

Opus 5.5 最大的亮点不是某个单项突破,而是全面均衡。

从 Anthropic 官方基准测试来看,Opus 5.5 在 agentic coding 赛道表现亮眼:

评测 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Terminal-Bench 4.0 66.4% 55.8% 52.3% 57.9%
FrontierCode v1.1 (Main) 54.4% 50.3% 48.0% 53.3%
CursorBench 4.0 57.8% 51.8% 46.6% —
OSWorld 2.0 (Computer Use) 81.8% 80.7% 74.0% —
AutomationBench 40.0% 31.4% 26.9% 41.4%
Humanity’s Last Exam 67.7% 65.6% 63.6% 57.2%

在 Terminal-Bench 4.0 上,Opus 5.5 以 66.4% 大幅领先 GPT-6 Astra 的 57.9% 和自家 Fable 5.1 的 55.8%。FrontierCode 上同样以 54.4% 领先 GPT-6 Astra 的 53.3%。

更有意思的是实际场景:一位早期测试者让 Opus 5.5 审计并修复一个 20 万行代码库——<3 小时完成。Opus 5 需要 20+ 小时,且多耗 2.5 倍的 token。另一位测试者把六个仓库的工程任务扔给 Opus 5.5「无人值守跑过夜」——它在 18 小时内定义了服务间的通信方式,且代码注释「简短有用而非长篇大论」。

定价策略:悄悄打了一场聪明的价格战

Opus 5.5 的定价策略很有意思:

项目 Opus 5.5 Opus 5 降幅
输入 ($/M token) $4.00 $5.00 ↓20%
输出 ($/M token) $20.00 $25.00 ↓20%
缓存 ($/M token) $0.20 $0.50 ↓60%
典型工作负载成本 — — ↓40%

表面看只是降价 20%,但注意缓存价格——$0.20/M token,降了 60%。对于 Agent 编程和知识工作这类长上下文、多轮对话场景,缓存读取占了大部分成本。这是 Opus 5.5 的核心定价技巧:标价降 20%,但实际账单降 40%。

同时输出速度比 Opus 5 快了 30%+,Pro/Max/Team/Enterprise 计划的 5 小时用量限额也同步提升。

安全升级:最好的对齐测试成绩

Opus 5.5 是 Anthropic 首个在「呼吁放缓前沿模型发展」之后发布的模型。它在自动行为审计中取得了史上最好成绩——比之前任何模型都更不容易越界、更不容易采取不可逆行动、对 prompt injection 的抵抗力也超过 Opus 5。

Anthropic 还扩展了对齐测试覆盖范围,纳入了超长任务、不可能任务和真实事件模拟。因为 Opus 5.5 在生物学和网络安全能力上已接近 Claude Mythos 5.1,Anthropic 部署了与 Fable 5.1 同级别的安全防护——包括生命科学验证计划和网络安全验证计划来管控高风险使用。

同一天,OpenAI 出了什么牌?

同一天,OpenAI 也发布了 GPT-6 Luna 和 GPT-6 Sol——这是 Astra 发布后的 GPT-6 家族补齐。

维度 GPT-6 Luna GPT-6 Sol GPT-6 Astra
输入价格 $0.10/M $2.00/M 旗舰定价
输出价格 $0.50/M $10.00/M 旗舰定价
上下文 1.05M 1.05M 1M
定位 高吞吐、成本敏感 复杂编码、Agent 工作负载 全能力旗舰
降价幅度 vs GPT-5.6 Luna ↓50% vs GPT-5.6 Sol ↓50% —

Luna 的 $0.10/M 输入价格几乎把 AI 调用成本压到了地板——这对大批量处理任务、企业级自动化来说是巨大的吸引力。Sol 则在复杂编码和 Agent 工作负载上与 Opus 5.5 正面对抗。

根据第三方分析,在 FrontierCode 上 Opus 5.5 得分 51.4%(单任务成本 $2.25),Sol 得分 48.4%(单任务成本 $1.37)。在 AutomationBench 上 Opus 5.5 得分 34.4%($0.86/任务),Sol 得分 33.2%($0.27/任务)。Opus 5.5 性能略高,但 Sol 成本显著更低。

OpenAI 还改进了 prompt caching,声称缓存命中率默认更高,「帮 Agent 复用更多上下文、响应更快、缓存输入读取享 90% 折扣」。

两种策略的分野

把同一天的两场发布放在一起看,差异非常清晰:

Anthropic 的策略:推最强的 Agent 模型,在顶级性能上不留余力地领先。降价 40% 是为了让更多企业用得起——但定位依然是「Premium Agent Compute」。

OpenAI 的策略:用 Luna 和 Sol 把入口价格打穿地板。Luna 的 $0.10/M 是为了让任何开发者毫无心理负担地调用 AI。Sol 的存在是为了证明「便宜不一定差」——性能接近 Opus 5.5 但成本只有一半。

这不是单纯的「谁赢谁输」。这是两家公司对 AI 市场未来形态的不同判断:

  • Anthropic 认为 Agent 是下一个计算范式——企业愿意为真正能自动化复杂工作的 Agent 付高价。所以押注长任务一致性、安全可控、代码生成质量。
  • OpenAI 认为 scale 会继续吃——成本降低带来的需求弹性远大于性能提升。所以把能力下放、让 Agent 变得像水电一样便宜。

写在最后

这场同天发布让我想起一个历史瞬间:2015 年 AWS 推出 Lambda 的同时,Google 发布了 TensorFlow。 一个在降低基础设施成本,一个在提升模型能力天花板——两条看似平行的线,最终在 AI 时代交汇。

今天的情况类似。Opus 5.5 告诉我们,模型能力还在快速提升——Terminal-Bench 66.4%、OSWorld 81.8%、20 万行代码 <3 小时,这些数字一年前还不可想象。Luna 和 Sol 告诉我们,成本也在快速下降——$0.10/M 的推理价格正在让「让 AI 跑每一个决策」变成现实。

能力提升 × 成本下降,才是真正的拐点。

AI 模型竞争已不再是单一维度的竞赛。能力、成本、安全——三维缺一不可。Opus 5.5 在安全对齐上拿了史上最好成绩,Luna 在成本上打穿地板,Sol 在能力-成本平衡点上找到最佳位置。每个维度都在被用户用「买不买得起、跑不跑得稳、敢不敢用」投票。

未来的赢家,不会是某一个维度最强的模型,而是三个维度均衡最优的那一个。

如果你已经在跑 Agent 工作负载,Opus 5.5 值得立即试。如果你在做大批量高吞吐任务,Luna 可能是你没试过的省钱方案。

延伸阅读:《Grok 4.7 发布:同价但翻倍!Terminal-Bench 暴涨 87%》 — 同周的另一场模型大战 / 《Qwen3.8-Omni-Flash 横空出世!》 — 开源模型的价格冲击

By AI博士 万戈