Featured image of post GPT-6 Astra 横空出世!$10/$50 定价,Agent 能力暴增——但独立评测说「和 Sol 一样」?

GPT-6 Astra 横空出世!$10/$50 定价,Agent 能力暴增——但独立评测说「和 Sol 一样」?

如果你在 9 月 3 日刷到了 OpenAI 那条「Welcome to the new generation of intelligence」的推文,第一反应可能是——GPT-6 来了,又要变天了。

然后你看到定价:$10/$50 per million tokens——2.5 倍 GPT-5.6 Sol 的价格。

接着你看到 Artificial Analysis 的 Intelligence Index 得分:61——和 Sol 一模一样

这就尴尬了。

GPT-6 Astra 到底是飞跃还是挤牙膏?Agent 能力的暴涨能否 justify 2.5 倍的溢价?我花了几天消化了 OpenAI 官方数据、独立评测、以及这帮 Benchmark 机构之间的方法论大战,下面给你一个工程视角的全景解读。

定价与规格:2.5x,但一个字都没白涨

先看最硬的数字——定价对比:

维度 GPT-6 Astra GPT-5.6 Sol 变化
输入价格 $10/M tokens $4/M tokens ↑ 2.5x
输出价格 $50/M tokens $20/M tokens ↑ 2.5x
缓存输入 $1/M tokens $0.4/M tokens ↑ 2.5x
上下文窗口 1.1M tokens 1M tokens ↑ 10%
知识截止 April 2026 Jan 2026 ↑ 3 个月
输入模态 Text + Image Text + Image
层级定价 max / high / xhigh 三级 两级 新增档位

单看单价,涨价 2.5x 绝对吓人。但如果你深入看实际任务成本,故事完全不一样。

别只看单价,看每任务成本

OpenAI 在 Terminal-Bench Science 0.1 上公布了一组对比:Astra 64.6% vs Fable 5.1 52.6%,同时估算 API 成本低 31%

一个 $50/M 输出的模型,跑同一任务反而比低价模型便宜三分之一?这怎么做到的?

答案在 Token 效率。

在 Artificial Analysis 的 Coding Agent Index 评测中,Astra (max) 比 GPT-5.6 Sol (max) 少用三分之二的输出 tokens。同样完成一个编码任务,Astra 只用 Sol 1/3 的 token 量。也就是说:

Astra 每输出一个 token,做的有用功是 Sol 的三倍。

这在 AI 工程史上,是比 Benchmark 分数更重要的趋势——模型正在学会少说话多干活

Agent 能力暴增:Coding Agent Index 霸榜

Artificial Analysis 的 Coding Agent Index 是目前最独立的 agent 编码能力评测。Astra 的表现让人眼前一亮:

模型 Coding Agent Index 每任务成本对比
Claude Fable 5.1 (Claude Code) 70 基准
GPT-6 Astra (max, Codex) 67 < 50% Fable 5
Claude Opus 5 (Claude Code) 67 相近
Claude Fable 5 (Claude Code) 67
Muse Spark 1.3 (Muse Code) 67
GPT-5.6 Sol (max, Codex) 65

Astra (max) 在 Codex 中得分 67,与 Opus 5、Fable 5、Muse Spark 1.3 完全持平——而每任务成本不到 Fable 5 的一半。Fable 5.1 虽然以 70 分领先,但价格也比 Astra 贵得多。

换句话说,Astra 是目前 Coding Agent Index 上性价比最高的模型

对于日常跑 Codex 的工程团队来说,这可能是比任何抽象 Benchmark 更直接的升级理由。

计算机使用能力:时间就是金钱

OSWorld 2.0 的数据更说明问题。Astra 在模拟环境下达到 72.6% 的完成率,每任务用时约 40 分钟。作为对比,GPT-5.6 Sol 65.7% 完成率,每任务约 75 分钟。

模型 OSWorld 2.0 每任务用时
GPT-6 Astra 72.6% ~40 min
GPT-5.6 Sol 65.7% ~75 min

完成率高了近 7 个百分点,用时少了 47%

如果你的团队在跑自动化 QA、浏览器测试、UI 操作等工作流,时间就是真金白银——40 分钟的 Astra 意味着更短的监督窗口、更少的 drift 机会、更高的并发容量。

Intelligence Index 的尴尬:和 Sol 一样,但贵 2.5 倍

然而,如果看「传统智力评测」——这可能是最让人困惑的部分。

Artificial Analysis 的 Intelligence Index v4.1.1(一个复合了知识、推理、长上下文、编码等多维度能力的总评分)显示:

模型 Intelligence Index
Claude Fable 5.1 (max) 66
Claude Opus 5 (max) 63
Claude Fable 5 (max) 62
GPT-6 Astra (max) 61
GPT-5.6 Sol (max) 61
Muse Spark 1.3 (max) 61

Astra 和 Sol 同分——61。

一个价格贵 2.5 倍的新旗舰,综合智力得分和前代一模一样。如果你是个负责 API 预算的 CTO,看到这个数据很难不皱眉。

但深入看细节,情况没那么简单。

幻觉率减半:质量维度的无声胜利

AA-Omniscience(知识准确性与幻觉评测)的数据可能是整篇文章最重要的数字之一:

模型 幻觉率 准确率
GPT-5.6 Sol (max) 92% 基准
GPT-6 Astra (max) 51% ↑ 4 分

幻觉率从 92% 降到 51%——减半

这是个接近质变级别的改善。在 RAG 系统、文档分析、代码审查等场景中,幻觉率直接决定了你需要多少人工验证。51% 仍然很高(意味着大约一半的 output 包含不实信息),但相比 92% 已经是天壤之别。

更难得的是,这不是以牺牲准确率为代价——Astra 的准确率还提升了 4 个点。

长周期知识工作:AA-Briefcase +80 Elo

AA-Briefcase 测试的是跨多周、多文件、多任务链的知识工作能力——这比任何单一对话评测都更接近真实工作场景。

模型 AA-Briefcase Elo
GPT-6 Astra ↑ 80 Elo
GPT-5.6 Sol (max) 基准(领先)

Astra 在分析质量和评分维度上大幅提升,只有在「呈现质量」维度上仍落后 Sol——这个矛盾很有意思:Astra 做事情的能力更强了,但写漂亮报告的能力反而弱了。

也许这正是「少说话多干活」的另一面:输出效率提升,可能牺牲了表达精细度。

ARC-AGI 争议:99.9% 是刷出来的吗?

OpenAI 拿了 Astra 的 ARC-AGI-3 分数做头条:99.9%。这听起来像 AGI 级别的突破。

但 ARC Prize 官方用 Standard Harness 跑出来的是 62.7%

为什么差这么多?OpenAI 用了一个叫 Provider Adapter 的自定义 harness,它:

  1. 保留了推理状态的隐私性
  2. 压缩了长对话历史
  3. 使用了更高 reasoning effort

这相当于让运动员穿自己的鞋跑自己的赛道,然后说成绩是世界纪录。ARC Prize 官方也承认 62.7% 是基于标准设置,两种设置各有合理性——但问题在于,拿自家 harness 的 99.9% 去和其他模型的标准分数做 headline 对比,这是不诚实的。

这其实不只是一个炒作问题——它是一个工程信号。如果你在生产环境中用的是标准 API 设置(非自定义 harness),你得到的实际表现可能接近 62.7% 而不是 99.9%。

Recurrent Depth:架构革命还是营销名词?

这次发布最有想象力的部分是传闻中的 Recurrent Depth——一个通过复用 transformer 层计算来提升效率的新架构设计。OpenAI 首席科学家 Jakub Pachocki 提到计算图深度在 GPT-4 的 2x 以内。

这意味着什么?简单说,模型在不显著增加参数量的情况下,通过反复利用部分神经网络层来执行更深层的推理

这种设计在效率上的优势已经在 Token 效率上得到了印证(Astra 比 Sol 少用 2/3 的输出 tokens)。但安全团队关心的则是另一面:

如果模型执行更多内部计算但只暴露压缩后的推理轨迹,监控团队还有没有能力发现它隐藏的危险意图?

Pachocki 宣称 CoT(链式思维)监控已被保留。但这个「保留」到底保留了多少,没有公开证据。对于部署 Astra 到敏感工作流的团队来说,推理轨迹的完整度是一个需要自行验证的黑盒指标。

ExploitBench 100% 的双刃剑

Astra 在 ExploitBench 上得了 100%——意味着它有能力发现和利用几乎所有测试的漏洞。OpenAI 据此将其归类为 Critical Cyber Threshold,并限制了它的高危能力的访问范围。

这对防御者来说是好事:Astra 可以帮你做渗透测试、漏洞扫描、生成修复方案。但这也意味着,如果访问控制不严,一个被劫持的 Astra 实例可以在你的基础设施上造成比任何前代模型更大的破坏。

OpenAI 的应对是 Daybreak Access——一个受控的安全访问计划。但值得注意的是,OpenAI 自己的测试显示,GPT-5.6 Sol 在没有生产级安全防护的情况下,48% 的案例超出了授权目标;Astra 在同样条件下这一数字是 0%。这说明 Astra 在 scope-control 上的改进是真实的,但在把模型接入你的工具链之前,请务必自己跑一遍权限边界测试。

写在最后:Agent 时代需要新的评价体系

GPT-6 Astra 引发的最大问题不是「它够不够好」,而是 「我们用什么标准来评价一个 Agent」

Intelligence Index 说它和 Sol 一样。Coding Agent Index 说它比 Sol 好很多。AA-Briefcase 说它在长周期任务上飞跃。ARC-AGI 说它可以是 99.9% 或 62.7%——取决于怎么测。

这个混乱不是评测机构的问题,而是整个行业还没有为「Agent 能力」建立统一的评价体系。 传统 LLM 评测测的是「回答问题」,但 Agent 的核心能力是「完成任务」——这二者本质上不同。

如果你问我 Astra 值不值得升级,我的建议是:

  • 编码团队:立刻评估。Codex 上 67 分 + 每任务成本减半,这个 ROI 算得过来。
  • 自动化/计算机使用团队:OSWorld 40 vs 75 分钟的差距是硬性的,时间省了就是钱省了。
  • 通用对话/RAG 系统:等独立评测尘埃落定再决定。Intelligence Index 61 分说明它的「知识智力」没有飞跃。
  • 安全敏感场景:慢一点。100% ExploitBench 意味着权限边界测试不能跳过。

GPT-6 Astra 是 OpenAI 至今最分裂的发布——它在 Agent 能力上的进步是真实且罕见的,但它在传统智力评测上的「零进步」也是事实。这不是模型的问题,是我们在用旧量尺量新事物。

也许下一步不是等 OpenAI 发布更好的模型,而是我们——工程师、评测者、采购方——一起建立一套属于 Agent 时代的能力标准。

延伸阅读:《Claude Fable 5.1 横空出世!标价不变,便宜 45%,Opus 5 让位了!》 — Astra 最直接的竞争对手,两者的定价和 Benchmark 对比贯穿全文。

By AI博士 万戈