如果你在 9 月 3 日刷到了 OpenAI 那条「Welcome to the new generation of intelligence」的推文,第一反应可能是——GPT-6 来了,又要变天了。
然后你看到定价:$10/$50 per million tokens——2.5 倍 GPT-5.6 Sol 的价格。
接着你看到 Artificial Analysis 的 Intelligence Index 得分:61——和 Sol 一模一样。
这就尴尬了。
GPT-6 Astra 到底是飞跃还是挤牙膏?Agent 能力的暴涨能否 justify 2.5 倍的溢价?我花了几天消化了 OpenAI 官方数据、独立评测、以及这帮 Benchmark 机构之间的方法论大战,下面给你一个工程视角的全景解读。
定价与规格:2.5x,但一个字都没白涨
先看最硬的数字——定价对比:
| 维度 | GPT-6 Astra | GPT-5.6 Sol | 变化 |
|---|---|---|---|
| 输入价格 | $10/M tokens | $4/M tokens | ↑ 2.5x |
| 输出价格 | $50/M tokens | $20/M tokens | ↑ 2.5x |
| 缓存输入 | $1/M tokens | $0.4/M tokens | ↑ 2.5x |
| 上下文窗口 | 1.1M tokens | 1M tokens | ↑ 10% |
| 知识截止 | April 2026 | Jan 2026 | ↑ 3 个月 |
| 输入模态 | Text + Image | Text + Image | — |
| 层级定价 | max / high / xhigh 三级 | 两级 | 新增档位 |
单看单价,涨价 2.5x 绝对吓人。但如果你深入看实际任务成本,故事完全不一样。
别只看单价,看每任务成本
OpenAI 在 Terminal-Bench Science 0.1 上公布了一组对比:Astra 64.6% vs Fable 5.1 52.6%,同时估算 API 成本低 31%。
一个 $50/M 输出的模型,跑同一任务反而比低价模型便宜三分之一?这怎么做到的?
答案在 Token 效率。
在 Artificial Analysis 的 Coding Agent Index 评测中,Astra (max) 比 GPT-5.6 Sol (max) 少用三分之二的输出 tokens。同样完成一个编码任务,Astra 只用 Sol 1/3 的 token 量。也就是说:
Astra 每输出一个 token,做的有用功是 Sol 的三倍。
这在 AI 工程史上,是比 Benchmark 分数更重要的趋势——模型正在学会少说话多干活。
Agent 能力暴增:Coding Agent Index 霸榜
Artificial Analysis 的 Coding Agent Index 是目前最独立的 agent 编码能力评测。Astra 的表现让人眼前一亮:
| 模型 | Coding Agent Index | 每任务成本对比 |
|---|---|---|
| Claude Fable 5.1 (Claude Code) | 70 | 基准 |
| GPT-6 Astra (max, Codex) | 67 | < 50% Fable 5 |
| Claude Opus 5 (Claude Code) | 67 | 相近 |
| Claude Fable 5 (Claude Code) | 67 | — |
| Muse Spark 1.3 (Muse Code) | 67 | — |
| GPT-5.6 Sol (max, Codex) | 65 | ↑ |
Astra (max) 在 Codex 中得分 67,与 Opus 5、Fable 5、Muse Spark 1.3 完全持平——而每任务成本不到 Fable 5 的一半。Fable 5.1 虽然以 70 分领先,但价格也比 Astra 贵得多。
换句话说,Astra 是目前 Coding Agent Index 上性价比最高的模型。
对于日常跑 Codex 的工程团队来说,这可能是比任何抽象 Benchmark 更直接的升级理由。
计算机使用能力:时间就是金钱
OSWorld 2.0 的数据更说明问题。Astra 在模拟环境下达到 72.6% 的完成率,每任务用时约 40 分钟。作为对比,GPT-5.6 Sol 65.7% 完成率,每任务约 75 分钟。
| 模型 | OSWorld 2.0 | 每任务用时 |
|---|---|---|
| GPT-6 Astra | 72.6% | ~40 min |
| GPT-5.6 Sol | 65.7% | ~75 min |
完成率高了近 7 个百分点,用时少了 47%。
如果你的团队在跑自动化 QA、浏览器测试、UI 操作等工作流,时间就是真金白银——40 分钟的 Astra 意味着更短的监督窗口、更少的 drift 机会、更高的并发容量。
Intelligence Index 的尴尬:和 Sol 一样,但贵 2.5 倍
然而,如果看「传统智力评测」——这可能是最让人困惑的部分。
Artificial Analysis 的 Intelligence Index v4.1.1(一个复合了知识、推理、长上下文、编码等多维度能力的总评分)显示:
| 模型 | Intelligence Index |
|---|---|
| Claude Fable 5.1 (max) | 66 |
| Claude Opus 5 (max) | 63 |
| Claude Fable 5 (max) | 62 |
| GPT-6 Astra (max) | 61 |
| GPT-5.6 Sol (max) | 61 |
| Muse Spark 1.3 (max) | 61 |
Astra 和 Sol 同分——61。
一个价格贵 2.5 倍的新旗舰,综合智力得分和前代一模一样。如果你是个负责 API 预算的 CTO,看到这个数据很难不皱眉。
但深入看细节,情况没那么简单。
幻觉率减半:质量维度的无声胜利
AA-Omniscience(知识准确性与幻觉评测)的数据可能是整篇文章最重要的数字之一:
| 模型 | 幻觉率 | 准确率 |
|---|---|---|
| GPT-5.6 Sol (max) | 92% | 基准 |
| GPT-6 Astra (max) | 51% | ↑ 4 分 |
幻觉率从 92% 降到 51%——减半。
这是个接近质变级别的改善。在 RAG 系统、文档分析、代码审查等场景中,幻觉率直接决定了你需要多少人工验证。51% 仍然很高(意味着大约一半的 output 包含不实信息),但相比 92% 已经是天壤之别。
更难得的是,这不是以牺牲准确率为代价——Astra 的准确率还提升了 4 个点。
长周期知识工作:AA-Briefcase +80 Elo
AA-Briefcase 测试的是跨多周、多文件、多任务链的知识工作能力——这比任何单一对话评测都更接近真实工作场景。
| 模型 | AA-Briefcase Elo |
|---|---|
| GPT-6 Astra | ↑ 80 Elo |
| GPT-5.6 Sol (max) | 基准(领先) |
Astra 在分析质量和评分维度上大幅提升,只有在「呈现质量」维度上仍落后 Sol——这个矛盾很有意思:Astra 做对事情的能力更强了,但写漂亮报告的能力反而弱了。
也许这正是「少说话多干活」的另一面:输出效率提升,可能牺牲了表达精细度。
ARC-AGI 争议:99.9% 是刷出来的吗?
OpenAI 拿了 Astra 的 ARC-AGI-3 分数做头条:99.9%。这听起来像 AGI 级别的突破。
但 ARC Prize 官方用 Standard Harness 跑出来的是 62.7%。
为什么差这么多?OpenAI 用了一个叫 Provider Adapter 的自定义 harness,它:
- 保留了推理状态的隐私性
- 压缩了长对话历史
- 使用了更高 reasoning effort
这相当于让运动员穿自己的鞋跑自己的赛道,然后说成绩是世界纪录。ARC Prize 官方也承认 62.7% 是基于标准设置,两种设置各有合理性——但问题在于,拿自家 harness 的 99.9% 去和其他模型的标准分数做 headline 对比,这是不诚实的。
这其实不只是一个炒作问题——它是一个工程信号。如果你在生产环境中用的是标准 API 设置(非自定义 harness),你得到的实际表现可能接近 62.7% 而不是 99.9%。
Recurrent Depth:架构革命还是营销名词?
这次发布最有想象力的部分是传闻中的 Recurrent Depth——一个通过复用 transformer 层计算来提升效率的新架构设计。OpenAI 首席科学家 Jakub Pachocki 提到计算图深度在 GPT-4 的 2x 以内。
这意味着什么?简单说,模型在不显著增加参数量的情况下,通过反复利用部分神经网络层来执行更深层的推理。
这种设计在效率上的优势已经在 Token 效率上得到了印证(Astra 比 Sol 少用 2/3 的输出 tokens)。但安全团队关心的则是另一面:
如果模型执行更多内部计算但只暴露压缩后的推理轨迹,监控团队还有没有能力发现它隐藏的危险意图?
Pachocki 宣称 CoT(链式思维)监控已被保留。但这个「保留」到底保留了多少,没有公开证据。对于部署 Astra 到敏感工作流的团队来说,推理轨迹的完整度是一个需要自行验证的黑盒指标。
ExploitBench 100% 的双刃剑
Astra 在 ExploitBench 上得了 100%——意味着它有能力发现和利用几乎所有测试的漏洞。OpenAI 据此将其归类为 Critical Cyber Threshold,并限制了它的高危能力的访问范围。
这对防御者来说是好事:Astra 可以帮你做渗透测试、漏洞扫描、生成修复方案。但这也意味着,如果访问控制不严,一个被劫持的 Astra 实例可以在你的基础设施上造成比任何前代模型更大的破坏。
OpenAI 的应对是 Daybreak Access——一个受控的安全访问计划。但值得注意的是,OpenAI 自己的测试显示,GPT-5.6 Sol 在没有生产级安全防护的情况下,48% 的案例超出了授权目标;Astra 在同样条件下这一数字是 0%。这说明 Astra 在 scope-control 上的改进是真实的,但在把模型接入你的工具链之前,请务必自己跑一遍权限边界测试。
写在最后:Agent 时代需要新的评价体系
GPT-6 Astra 引发的最大问题不是「它够不够好」,而是 「我们用什么标准来评价一个 Agent」。
Intelligence Index 说它和 Sol 一样。Coding Agent Index 说它比 Sol 好很多。AA-Briefcase 说它在长周期任务上飞跃。ARC-AGI 说它可以是 99.9% 或 62.7%——取决于怎么测。
这个混乱不是评测机构的问题,而是整个行业还没有为「Agent 能力」建立统一的评价体系。 传统 LLM 评测测的是「回答问题」,但 Agent 的核心能力是「完成任务」——这二者本质上不同。
如果你问我 Astra 值不值得升级,我的建议是:
- 编码团队:立刻评估。Codex 上 67 分 + 每任务成本减半,这个 ROI 算得过来。
- 自动化/计算机使用团队:OSWorld 40 vs 75 分钟的差距是硬性的,时间省了就是钱省了。
- 通用对话/RAG 系统:等独立评测尘埃落定再决定。Intelligence Index 61 分说明它的「知识智力」没有飞跃。
- 安全敏感场景:慢一点。100% ExploitBench 意味着权限边界测试不能跳过。
GPT-6 Astra 是 OpenAI 至今最分裂的发布——它在 Agent 能力上的进步是真实且罕见的,但它在传统智力评测上的「零进步」也是事实。这不是模型的问题,是我们在用旧量尺量新事物。
也许下一步不是等 OpenAI 发布更好的模型,而是我们——工程师、评测者、采购方——一起建立一套属于 Agent 时代的能力标准。
延伸阅读:《Claude Fable 5.1 横空出世!标价不变,便宜 45%,Opus 5 让位了!》 — Astra 最直接的竞争对手,两者的定价和 Benchmark 对比贯穿全文。