GPT-6 Astra 深度拆解:OpenAI 的“群星“到底比 5.6 Sol 强在哪?
2026 年 9 月 4 日,OpenAI 把 GPT-6 Astra 端上来了。名字听着像拉丁语"群星",价格也确实像在摘星——但抛开营销话术,它相比上一代 GPT-5.6 Sol 到底强了多少?是真正的代差,还是又一场精心包装的"挤牙膏"?
一、先说结论:不是均匀加点,是重心转移
GPT-6 Astra 相比 GPT-5.6 Sol,不是"每科都涨 10 分"那种提升,而是把能力重心从"答题"推到"干活"——
- 电脑操作 / Agent 工作流:代差级
- 数学 / 抽象推理:量级跃迁
- 科研 + 终端工程:2~3 倍
- 编码(SWE):只领先一点
- 网络安全:跨过 Critical 线
- 单价:贵 2.5 倍,但长任务总账可能反而省
下面拆开说。
二、名字背后的野心:从"日地月"到"群星"
Astra 是拉丁语 astrum(星、天体)的复数,直译"群星、苍穹"。
OpenAI 近几代模型的命名是一条天体链:
| 模型 | 天体 | 含义 |
|---|---|---|
| GPT-5.6 Sol | 太阳 | 核心、光源 |
| Terra | 地球 | 承载、基础 |
| Luna | 月亮 | 伴星、反射 |
| GPT-6 Astra | 群星 | 整个星空/宇宙 |
从"日—地—月"三个近处天体,一步推到"整个星空"。发布前 ChatGPT 官方那句 “The stars are almost aligned” 和 Brockman 的"AGI 时刻"措辞,外界解读很统一:向群星进发,奔着 AGI 去。
三、核心参数速览
| 参数 | 数值 |
|---|---|
| 上下文窗口 | 1,050,000 token 输入 / 128,000 token 输出 |
| 知识截止 | 2026 年 4 月 30 日 |
| 模态 | 文本 + 图像输入(无原生音频/视频) |
| 推理档位 | low / medium / high / xhigh / max(新增两档高强度) |
| 工具生态 | Computer Use、Hosted Shell、Apply Patch、MCP、Web/File Search、Code Interpreter、Skills、Tool Search |
| 自部署 | ❌ 不支持 |
| 微调 | ❌ 不支持 |
四、大招:Computer Use + Agent 工作流
Astra 不再是"告诉你怎么做",而是自己跨软件把活干完:
- 填网页表单、更新 CRM、整理日历、写邮件摘要
- 跑浏览器研究 → 出图表 → 搭网站 → 前端 QA 自检
- 自主安装/测试软件、看屏幕报错排查问题
- 结合 Codex 新 harness:跨上下文保留笔记、异步调工具、中途改需求不重头跑
OSWorld 2.0:72.6%(Sol 65.7%),单任务约 40 分钟(Sol 约 75 分钟,提速约 47%)。
五、GPT-6 Astra vs GPT-5.6 Sol:跨代差全景表
以下是官方自报口径的硬数据对比:
| 维度 | GPT-5.6 Sol | GPT-6 Astra | 提升幅度 |
|---|---|---|---|
| ARC-AGI-3(抽象推理) | 7.8% | 99.9%* | +92.1pt(约 12.8×) |
| FrontierMath Tier 4(研究级数学) | 83.0% | 97.6% | +14.6pt |
| GPQA Diamond(研究生级科学) | — | 96.0% | — |
| OSWorld 2.0(电脑操作) | 65.7% / ~75min | 72.6% / ~40min | +6.9pt,耗时 -47% |
| Mind2Web 速度(配新 Codex harness) | 1× | 1.9× | 快 90% |
| Terminal-Bench 4.0(命令行工程) | 37.3% | 57.7~57.9% | +20.4pt(约 1.55×) |
| Terminal-Bench Science | 22.4% | 64.6% | +42.2pt(约 2.9×) |
| DeepSWE v1.1(SWE 编码) | 72.7% | 74.1% | +1.4pt(基本持平) |
| ExploitBench(漏洞利用) | 78.5% | 100% | +21.5pt |
| ExploitGym | 30.3% | 42.4% | +12.1pt |
| 2026 年 6-8 月新漏洞集 | 5.5% | 39% | +33.5pt(约 7.1×) |
| AutomationBench(多步办公) | 18.1% | 41.4% | +23.3pt(约 2.3×) |
| BenchCAD(图生 CAD) | 83.3% | 95.9% | +12.6pt |
| SRE-Bench 单次/四次 | 55.9% / 68.7% | 88.0% / 99.2% | 单次 +32.1pt |
| 上下文窗口 | — | 1.05M token | — |
| API 单价(入/出) | $4 / $20 每 M | $10 / $50 每 M | 2.5× |
⚠️ ARC-AGI-3 的 99.9% 含 Responses API harness 脚手架(跨轮记忆+压缩),不是纯 base model 裸分;Sol 的 7.8% 是同 harness 下跑的对照,所以倍数关系可信,绝对值别当 AGI 证物。
⚠️ FrontierMath 由 OpenAI 资助,有独占访问权,第三方未复现。
六、翻译成人话:哪类任务真的变强了
🖥️ 电脑操作 / Agent 工作流:代差级
以前 Sol 能跑完但慢得你想自己动手(75 分钟),Astra 40 分钟跑完且成功率更高;配新 Codex 后网页任务 1.9× 速。填表、CRM、跨软件(Blender→UE5)、前端 QA 自检这条链,是从"助手"变"操作员"的跳跃。
🧮 数学 / 抽象推理:量级跃迁
ARC-AGI-3 从 7.8% 到 99.9% 是这一代最炸的数字,FrontierMath 97.6% 也接近打穿。但注意前者带 harness 增益,后者有独占访问——数字很猛,但别全信。
🔬 科研 + 终端工程:2~3 倍
Terminal-Bench Science 22.4%→64.6%、AutomationBench 18.1%→41.4%,说明长链路"读数据→跑模拟→决定下一步"比 Sol 能打太多。
💻 编码(SWE):只领先一点
DeepSWE 74.1% vs 72.7%,Terminal-Bench 4.0 拉得开但那是"工程执行"不是"写代码"。综合编码榜 Astra 没把 Claude Fable 5.1 踹死,属于同级互啄。
🔒 网络安全:跨过 Critical 线
100% ExploitBench、新漏洞集 5.5%→39%、实测挖出 2 个 V8 零日。这部分能力默认锁给 Trusted Access,普通 API 调不到。
🛡️ 对齐/不乱来:更难监控但更守边界
困难任务下越权率 0%(Sol ~48%),但 OpenAI 自己承认 Astra 的 CoT 更难被外部监控——能力涨了,可观测性降了。
七、安全:首个"Critical"级网络能力模型
Astra 在 Preparedness Framework 下首次达到 Critical 网络安全阈值:能挖未知漏洞、写利用链(测试中发现 2 个 V8 零日,已通报维护方)。
- 默认对外屏蔽高级攻防能力,高级网络安全仅限 Trusted Access / Daybreak 计划
- 对齐测试:困难/不可完成任务下越权率 0%(GPT-5.6 Sol 48%)
- 代价:CoT 可监控性下降,OpenAI 加了外部 misalignment 监控层
八、价格暴击与性价比
API 标准价:输入 $10 / 百万 token,输出 $50 / 百万 token(缓存输入 $1,缓存写 $12.5)
272K 输入触发阶梯:输入 2×、输出 1.5×
Fast 模式速度约 2×,价格 2×
但单任务可能更便宜:
| 场景 | 相比 Sol |
|---|---|
| BenchCAD 单任务 API 成本 | 低约 43%(用更少 token + 少返工) |
| Terminal-Bench 4.0 单任务成本 | 约低 9% |
| 法律科技 Legora 实测(41 份财报查错) | 准确率提近 40%,几分钟跑完 |
所以对企业来说是**"贵模型干便宜活"逻辑**:把长链路、高失败成本的任务给它,简单提取/改写继续用 Sol 或更小模型。
九、一句话定性
Sol 是"很会做题的高级工程师",Astra 是"能自己开电脑把活交付的操作员"——抽象推理和电脑操作是跨代,编码是小幅,价格先涨 2.5 倍,但长任务总账可能反而省。
十、值不值得从 Sol 切到 Astra?三档决策
| 你的场景 | 建议 | 理由 |
|---|---|---|
| 长链路自动化(填表、跨软件、QA 自检) | ✅ 切 | 代差级提升,单任务总成本反而低 |
| 研究/数学/抽象推理 | ✅ 切 | ARC-AGI-3 和 FrontierMath 碾压 |
| 日常编码(SWE) | 🔀 混合路由 | DeepSWE 只领先 1.4pt,Sol 够用且便宜 2.5× |
| 网络安全 | ❌ 别切(普通 API 调不到) | 高级能力默认锁给 Trusted Access |
| 简单提取/改写/客服 | ❌ 别切 | 用 Sol 或更小模型,性价比碾压 |
十一、结语
Astra 的本质是 OpenAI 把"大模型 + 电脑操作 + 强推理 + 重安全护栏"打包成高价企业级 Agent 底座,不是面向普通用户的免费革命。它的电脑操作、长程任务、网络安全是真实跳跃,但编码单项并未甩开 Claude 同级模型,跑分里混了 Agent 脚手架也不能全算模型本身。
"群星"确实比"太阳"亮了——但亮多少,取决于你拿它来照哪条路。
Disclaimer:以上数据均来自 OpenAI 官方发布及第三方评测汇总,部分跑分含 Agent 脚手架增益,编码/推理对比受测试环境差异影响,请以实际业务场景验证为准。
更多推荐



所有评论(0)