GPT-6 Astra:从操作电脑到科学研究

给 AI 一项开发任务:修改页面、处理接口异常、跑测试,再打开浏览器检查交互。第一版代码通常很快,真正影响交付速度的,是后面能否定位失败、持续修正,并记住最初的需求。

9 月 3 日(美国时间),OpenAI 发布 GPT-6 Astra。这次升级覆盖电脑操作、办公、软件工程、网络安全和科学研究,对开发者最有吸引力的,是模型处理完整任务的能力继续增强。

据 Axios 当日通讯,Greg Brockman 表示,他个人相信 OpenAI 已达到 AGI,并用“欢迎来到 AGI 时代”结束沟通。这是他的判断。对准备使用模型的人,更具体的问题是:Astra 能承担哪些工作,公开结果的条件是什么,成本如何计算?来源:Axios 当日通讯

1. 开放安排与 API 价格:先明确使用入口

开放进度比文章写作时又往前走了一步。9 月 5 日,Tibo(@thsottiaux)在 X 上表示,系统的扩展能力超出预期,Astra 现已向所有 Plus 和 Business 用户开放。

Tibo 的帖子截图:称 Astra 已向所有 Plus 和 Business 用户开放

来源:作者提供的 X 帖子截图,显示日期为 2026 年 9 月 5 日。

我的 Pro 账号也已出现 Astra,可以在模型选择器中直接选择。

模型选择器中已经出现 GPT-6 Astra

这里要分清产品入口:帮助中心目前仍说明,Plus 可以在 Work 与 Codex 使用有限额度的 Astra,但不包含 Chat 中的 GPT-6 Pro。这条帖子的开放消息,不能直接解读为所有计划、所有入口的权限与额度都一样。来源:OpenAI 帮助中心Work 与 Codex 说明

对 Plus 用户来说,现在值得打开 Work 或 Codex 查看 Astra 入口;具体可用选项和剩余额度,以账号内显示为准。

API 调用与订阅额度分开计算

通过 ChatGPT 登录使用 Work、Codex,消耗对应计划的额度;使用自己的 API Key 则按 API 计费。订阅开放消息不等于 API 额度同步赠送。来源:Work 与 Codex 说明

API 模型标识为 gpt-6-astra。主要计费信息如下:

项目当前说明使用时如何理解
Standard 输入10 美元 / 百万 Token基础输入单价
Standard 输出50 美元 / 百万 Token基础输出单价
缓存读 / 写1 / 12.50 美元 / 百万 TokenStandard 费率,需区分读写
超长输入超过 272K 输入 Token,整次请求的输入及缓存费率为 2 倍、输出为 1.5 倍不是仅对超出部分加价
API Fast 模式最高约 2 倍速度,2 倍 Standard 价格速度上限描述,实际收益随请求变化

价格来自模型文档发布公告的 Fast 说明。Token 是模型处理内容的计量单位,中文字符数不能直接当作 Token 数。

举个单纯的预算例子:若一次请求有 10 万个按基础费率计价的输入 Token、1 万个按基础费率计价的输出 Token,不涉及缓存、超长输入及额外工具费用,Standard 模型费用就是 0.1 × 10 + 0.01 × 50 = 1.50 美元。这是按单价计算的示例,并非本文实测。

上表讨论 API 费率,不能直接套用到 Work、Codex 的积分倍率。

实际开发任务通常不止一次请求。估算项目成本时,要累计整个任务的用量,再看它减少了多少人工修改和等待时间。

2. 电脑操作与办公:从文件生成扩展到软件内验证

Astra 的电脑操作能力覆盖填表、更新 CRM、整理日历、编辑摘要、分析数据和绘图。对开发者更直接的场景,是创建网站后继续检查前端功能,以及安装、测试软件和排查屏幕上出现的问题。官方截图还展示了 KiCad 电路板布局、FreeCAD 与 Blender 联合演示变速箱,以及用 Unity 的现成素材搭建城市场景等专业软件任务。来源:官方电脑操作演示

这让“页面代码已生成”之后的工作更值得期待。例如,做一个带筛选和表单的管理页面,还需要检查按钮、输入校验、空状态和布局。能够进入浏览器观察结果,意味着模型有机会根据实际表现继续修改。这里是能力适用场景的说明,不是本文执行过的验收记录。

官网前端 QA 演示:检查导航、搜索和关键交互

官网演示截图,非本文项目实测。

官方 OSWorld 2.0 延迟模拟提供了一个可对照的结果:

模型得分模拟每项任务用时
GPT-6 Astra72.6%约 40 分钟
GPT-5.6 Sol65.7%约 75 分钟

在这组条件下,Astra 得分高 6.9 个百分点,用时约少 47%。这是延迟模拟结果,不能直接推算某个网页或某套办公软件的执行时间。来源:OSWorld 评测与条件

办公能力则强调模板遵循、信息取舍,以及文档、表格和演示文稿的成品质量。开发者也会遇到这些工作:整理数据分析结果、准备产品演示、输出项目说明。沿用已有模板,能减少生成之后的格式返工。来源:专业工作能力介绍

官网文档改版前后对比

左右均为第 1/9 页;展示文案与视觉风格的共同调整。

PPT 参考模板与 Astra 输出示例

左侧参考文件第 3/3 页,右侧输出第 7/12 页,并非同一页的改造前后。

3. 编程与长任务:关注迭代质量和上下文连续性

编程成绩要放回各自任务中看

官方当前公布的两组编程评测如下:

评测GPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.057.9%37.3%55.8%52.3%
DeepSWE v1.174.1%72.7%67.4%73.7%

来源为OpenAI 编程评测表,均为其公布结果,本文未独立复现。

Terminal-Bench 4.0 包含软件工程、系统配置、数据分析等复杂终端任务。Astra 相比 Sol 提高 20.6 个百分点,这是一项明显进步;DeepSWE v1.1 中两者差距则为 1.4 个百分点。不同任务上的增益并不均匀,选择模型时应把评测任务、工具环境、推理设置和预算一起看,不能把单项分数当作项目成功率。

Playco 案例:人工修补减少约 50%

OpenAI 发布的 Playco 案例展示了较具体的开发过程:团队在连接游戏引擎的 Playbot 环境中使用 Astra,让它参与场景调整、试玩和验证,并报告与此前使用的模型相比,原型开发所需的人工修补减少约 50%。来源:Playco 客户案例

值得关注的是这个案例衡量的结果:人工还要补多少工作。对于原型开发,代码生成速度固然重要,能否观察运行效果、沿着反馈继续修改,同样决定最终效率。50% 是这支团队的案例收益,具体项目仍需要自己的验证。

长任务上下文:把失败原因和历史要求找回来

长时间调试或重构常遇到上下文压缩:对话太长后,系统把历史整理成摘要,为后续腾出空间。摘要会取舍信息,遗漏的可能恰好是“为什么上一个修复不成立”或“某个接口不能改”的理由。

随 Astra 推出的 Codex 实验性上下文管理,使用笔记和可搜索的历史保存、检索累积细节。配置文档中的键为 features.context_management.experimental_mode,目前默认关闭,要求通过 ChatGPT 登录,订阅条件列为 Plus、Pro 或 Pro Lite。来源:Codex 配置参考

笔记和可搜索历史帮助当前任务找回先前信息

实验性上下文机制的概念示意,非内部架构图。

它改善的是跨上下文的连续性,并不代表模型拥有无限上下文,也不保证历史细节都能正确找回。对开发工作而言,价值在于让之前的测试结果、约束和排错记录更容易继续发挥作用。

4. 网络安全:能力上限与发布权限一起看

Astra 达到 OpenAI Preparedness Framework 中的网络安全 Critical 阈值。官方在移除生产安全措施后进行 ExploitBench 测试,Astra 得分为 100%,Sol 为 78.5%;该评测考察把已知漏洞转化为可用利用程序的能力。来源:官方网络安全评估

对开发者和安全团队,实际应用可以从安全代码审查、漏洞理解和修复着手。发布版本支持代码审查与打补丁,但限制生成漏洞利用概念验证代码等高级任务;OpenAI 计划通过 Daybreak 逐步开放限制较少的能力,支持更多经过审核的防御性工作。来源:安全能力开放说明

这里有两个必要条件:100% 是特定测试成绩;测试使用了移除生产安全措施的设置。它既不等于能够攻破任意系统,也不意味着普通 API 调用能获得评测中的全部能力。

5. 对齐与可靠协作:理解目标,也尊重操作边界

开发任务不断变化时,模型需要接住新增要求,同时保留原目标。OpenAI 介绍,Astra 改善了这种任务连续性,并能在 Codex 中异步提问,继续完成不依赖用户答复的部分。这有望减少开发者重复解释背景的负担。来源:协作行为说明

官网协作对比:Astra 询问人数、忌口和预算

这是生活场景中的需求澄清示例。对开发工作的启发是先确认会影响结果的条件,不代表所有任务都应增加提问。

另一个具体进步来自 Auto-review 测试。Auto-review 是 Codex 中审查某些操作的机制;测试观察拒绝发生后,模型是否重试实质相同的操作,或利用配置缺口绕过限制。系统卡报告 Astra 在该项测试中没有尝试绕过监控。来源:系统卡 Respecting Auto-Review

这对交付很有意义:完成任务的压力不应成为扩大权限的理由。与此同时,系统卡其他评估仍发现越界行为;OpenAI 也披露,在主动要求模型规避监控的测试中,Astra 的书面推理更难被监控。因此,更好的对齐表现仍需要配合应用自身的权限控制。来源:系统卡对齐与监控说明

API 用户还需要区分监控覆盖范围。当前文档说明:

接入方式Misalignment monitoring 行为
Responses API,使用持久化推理、WebSockets 或 OpenAI compaction受到监控,可识别会话延续并阻止后续执行
Responses API,均未使用上述机制受到监控,可通过已配置的 webhook 接收告警,但不会自动停止会话
Chat Completions API不在该监控系统覆盖范围内,其他安全检查仍适用

配置告警 webhook 本身不会开启自动停止。监控是异步的,停止后续请求也不会撤销此前已完成的操作;告警可能漏报或误报,仍需结合操作记录判断。来源:API 监控文档

6. 数学与科学研究:从解题成绩走向可检查的新结果

Astra 在官方公布的 FrontierMath Tier 4(v2)上达到 97.6%,GPQA Diamond 达到 96.0%。前者关注高难度数学问题,后者测试生物、化学和物理等领域的研究生级科学推理。这些成绩体现特定评测表现,不能直接当成现实科研问题的解决概率。来源:数学与科学评测

更有意思的是质数间隙的新结果。OpenAI 表示,Astra 帮助把“存在无穷多对质数,其间距不超过某个常数”的上界推进到 186。此前长期保持的上界为 246,Julia Stadlmann 最近将其改进到 240。来源:短质数间隙结果与证明入口

质数间隙上界从 240 到 186 的含义

图解依据公告所述结果;不是所有相邻质数的间距都不超过 186,也不是孪生素数猜想的证明。

这里的量词决定了结论的含义:是“存在无穷多对”,而不是“所有相邻质数”。186 也不等于孪生素数猜想中的间距 2,不能把这项进展写成已经解决了孪生素数猜想。

OpenAI 还公布了大质数间隙相关结果,称 Astra 改进了一个超过 80 年未获改进的界中项,并给出了证明、研究过程与验证材料入口。本文介绍的是官方报告的结果,没有独立审查这些数学证明。来源:大质数间隙成果与材料

模型参与科学工作的路径也包括数据处理和软件操作。官方展示了检查测序质量、分析数据等场景:科学推理与电脑操作结合,让研究者有机会把资料检查、结果探索和候选思路放在同一工作过程中。来源:科学工作演示

对技术读者而言,可检查的新结果比一句笼统的“擅长科研”更有意义。它提供了进一步验证的对象,也让模型如何帮助研究变得具体。

7. 获得使用权限后,怎样判断升级是否有价值?

Astra 这次的吸引力,是电脑操作、编码、长任务连续性和科学推理同时增强。把这些能力用到自己的工作中,可以从一个有明确验收标准的小任务开始,例如修复带复现步骤的缺陷,或者按现有模板完成一次数据分析报告。

对开发任务,建议记录四件事:

  • 结果质量:已有测试和实际交互检查是否通过。
  • 人工修改:哪些问题仍需要自己定位、修补。
  • 任务连续性:追加要求后,是否仍然遵循此前约束。
  • 完整成本:整个任务累计花费的时间和模型费用。

这些记录能把公开能力转换成自己的使用判断。对于办公、开发和研究工作,最值得期待的收益,都来自模型能够承担更完整的一段过程,并交出更容易验证和继续使用的结果。


发布资料核对于 2026 年 9 月 4 日;开放进展与配图更新于 9 月 5 日。本文基于公开公告、产品文档和客户案例整理,非模型实测报告。案例截图来自 OpenAI 官网;账号入口截图与 Tibo 帖子截图由作者提供,帖子原始链接尚未独立核实;产品开放范围、配置与价格以官方最新说明为准。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐