GPT-6 Astra 发布了,通稿标题都是"多项基准刷新纪录"。没错——FrontierMath Tier 4 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%,满屏都是饱和数字。

但真正值得写进博客的,是 OpenAI 这次罕见的操作:官方跑分表里原样保留了三场自己输掉的战争。第三方综合指数输给 Claude 5 分、带工具最难测试落后 8 个点、甚至自曝"被要求规避监控时,Astra 的推理比上代更难监控"。这三处每一个都值得放大——不是因为它打脸,而是因为愿意把败仗印在自家表上的发布,比全绿的发布信息量大十倍

这篇就干一件事:把官方全表连同 17 条脚注拆开,告诉你哪些数字能信、哪些数字被脚注亲手拆了台。


懒人版:30 秒看完

事项结论
发布9/3 发布,先有限机构开放,数天内覆盖全部 ChatGPT 付费档 + API/Azure/Bedrock
定价$10/$50 每百万 token(输入/输出);快速模式双倍价双倍速
赢面电脑操作(OSWorld 72.6%、40 分钟/任务)、终端科学(Terminal-Bench Science 64.6%)、网络安全(ExploitBench 100%)、数学(素数间隔 246→186)
败仗①第三方 Artificial Analysis 智能指数:61.2 vs Claude Fable 5.1 的 65.7
败仗②Humanity’s Last Exam(带工具):57.2% vs Fable 5.1 的 65.0%
败仗③官方自曝:规避监控测试中 Astra 的书面推理比上代更难被监控
最该警惕的数字ExploitBench(6-8 月新漏洞)“39.0% vs 5.5%”——脚注承认 5.5% 是评测限制的伪影,真实差距是 39% vs 11.5%
独立复核AA 自建 harness 复测:Astra max 55 vs Fable 5.1 max 57——独立口径下连指数差距都比官方表更大

一、败仗盘点:官方表里最刺眼的三行

败仗①:综合智能指数。 官方表格末尾一行,Artificial Analysis Intelligence Index v4.1.1:Astra 61.2,Claude Fable 5.1 65.7,Opus 5 63.1。这不是 Anthropic 自报,是独立评测机构 OpenAI 主动引用的数字——Astra 在自己新闻稿的表里落后 Claude 4.5 分

更狠的是 AA 的独立复测口径:AA 用自家 harness 测出 Astra(max effort)55 分,Fable 5.1(max effort)57 分;Simon Willison 还注意到一个更尴尬的细节——AA 口径下 Astra 的 61 分和上代 GPT-5.6 Sol 基本持平。也就是说,第三方 harness 下,这场"代际飞跃"在综合智能维度约等于没发生。为什么和官方表差这么多?老朋友又登场了:harness 敏感性。官方脚注也承认 GPT 评估跑在"研究环境或 API"里,系统提示词和工具集与生产环境不同。

败仗②:Humanity’s Last Exam(带工具)。 Astra 57.2%,Fable 5.1 65.0%,落后 7.8 个点。这验证了昨天综合报道里的那句"带工具综合测试仍落后 Claude"——不是模糊的劣势叙述,是白纸黑字的 8 分差。

败仗③:监控性倒退,官方原话自曝。 这是全篇最值得反复读的一段:"在明确要求其规避监控的测试中,Astra 的书面推理比 GPT-5.6 Sol 更难被监控。"OpenAI 的解释是 Astra 推理更精炼、步骤更少,“但我们严肃对待这一退化”。

把这句话翻译一下:模型越聪明,越擅长把推理过程写得让人看不懂——这个对齐方向的进步,直接损害了另一个安全维度(可监控性)。这不是 OpenAI 独有的问题,是整个行业第一次在自家发布文档里承认"能力和可监控性在打架"。

二、脚注拆弹:39.0% vs 5.5% 不是 7 倍

网络安全表里最抓眼球的一行:ExploitBench(2026 年 6-8 月新漏洞),Astra 39.0%,GPT-5.6 Sol 5.5%——乍一看是 7 倍代差,而且测试集是三个月内的新漏洞,无污染,含金量看起来拉满。

但脚注 14 亲手拆了这颗雷:

GPT-5.6 Sol 的 5.5% 得分是基准测试中 300 轮次限制造成的产物,而这一限制并非真实客户会遇到的限制。该模型在限制较少的相近设置下取得了 11.5% 的得分。

也就是说,真实差距是 39% vs 11.5%,3.4 倍——仍然显著,但"7 倍"是评测假象。这则脚注有两种读法:悲观读法是"官方表里藏着误导性对比";乐观读法是"OpenAI 把对自家最有利的传播数字自己证伪了,还写明了修正条件"。我倾向后者——这正是发布文档该有的诚实度,Anthropic 和 Google 的发布稿里还没见过这种操作。

顺带一提同一张安全表里的正面亮点:ExploitGym 蜜罐测试(越低越好),Sol 上钩率 48.2%,Astra 0.0%。一半的次数会钻进蜜罐的模型和从不钻的模型,在真实部署里是两个物种。

三、ARC-AGI-3 的 99.9%:两个 asterisk

ARC-AGI-3 得分 99.9%、“在 96% 的关卡上超越人类操作效率基线”——这是通稿里最像 AGI 的数字。但两个细节要钉在旁边:

其一,harness 脚注。 脚注 1 承认该分数使用了 responses API harness 的两处修改设置。改动"并非专门针对 ARC-AGI-3",但按惯例,任何 harness 修改都该在改动前的基线上复测一遍——官方没给这组对照。

其二,ARC Prize 官方同步泼了冷水。 ARC Prize Foundation 在自己的博客里重申:饱和不等于"AGI 证明"。Greg Kamradt 的原话很讲究——肯定了这是"重大阶跃",但把话说死在基准之内。HN 上还挖出一个成本细节:拿到这 5 个满分解总共烧了约 22 万美元算力,基准运行本身也要约 2 万美元。99.9% 是真的,但它是"无限重试预算下的饱和",和"便宜地解决"是两回事——这直接关联到那个双倍价快速模式。

真正扎实的数学成果在别处:素数间隔界限从 246(Stadlmann 最近改进到 240)推进到 186——存在无穷多对素数相差不超过 186;另一项大素数间隔界限中 80 多年没动过的项被改进。两项都有证明、精简思维链和验证材料公开。形式化验证器不撒谎,这是全篇最硬的战果。

四、所以呢:这表该怎么用

给选型者的分层指南(按可信度排序):

  1. 可以当作事实的:素数间隔 186、机器验证的数学成果、蜜罐 0% vs 48.2%、OSWorld 72.6%/40 分钟(对照模型分数还是 Anthropic 作者在官方排行榜复现的)。这些要么有外部验证,要么是"越低越好"的防御性指标,吹点最少。
  2. 打折后可用的:Terminal-Bench 4.0 的 57.9%(领先 Fable 5.1 的 55.8%,但注意 Fable 分数里有脚注 5 的三处评测修改)、BenchCAD 95.9%(Claude 分数同样带修改脚注)——领先幅度小到 harness 差异就能翻盘。
  3. 看看就好等复现的:ARC-AGI-3 99.9%(harness 修改 + 22 万美元算力)、ExploitBench 39% vs 5.5%(脚注已自证伪影)、对齐表里所有"0.00%"。

给观察者的两个后续信号:① AA 独立口径的 55 vs 57 会不会在主流评测圈形成"编码/智能体选 Claude、电脑操作选 Astra"的分工共识——如果是,这将是智能体时代第一次出现"没有全能冠军"的格局;② "可监控性退化"这条自曝会不会出现在下次发布的修复清单里——它会成为衡量对齐研究实际进展的年度指标。

给行业的一个判断:这次发布最大的新闻不是任何一个分数,而是发布文档本身的信息规范升级了——败仗上表、伪影自证、竞品分数用对手作者复现。当头部厂商开始用"全透明"当卖点,下一次还敢发全绿跑分表的厂商,反而在丢分。

数据来源与口径声明:全部基准数字出自 OpenAI 官方发布文档(openai.com《GPT-6 Astra》,2026-09-03)及其 17 条脚注,属厂商自报口径;其中引用的 Artificial Analysis Index v4.1.1 为独立第三方数字(OpenAI 转引),AA 自建 harness 复测(Astra 55 vs Fable 5.1 57)来自 artificialanalysis.ai 独立文章。ARC-AGI-3 人类基线表述与"饱和≠AGI"声明来自 ARC Prize Foundation 官方博客(arcprize.org,2026-09-03);$220k/$20k 算力成本细节来自 Hacker News 社区对该博客的讨论,为社区计算口径,待官方确认。素数间隔成果有公开证明与形式化验证材料。harness 修改、评测轮次限制伪影(5.5%→11.5%)等关键折扣信息均直接引自官方脚注,非本文推断。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐