GPT-6 Astra 重磅发布 这次 OpenAI 升级的不只是模型分数
GPT-6 Astra 发布 这次 OpenAI 升级的不只是模型分数
OpenAI 发布了 GPT-6 Astra。
如果只看榜单,很容易把它理解成又一次“模型更强了”的常规升级:数学更高、代码更高、Computer Use 更高,部分项目甚至已经逼近满分。
但把这次公开的信息放在一起看,会发现 Astra 真正值得关注的地方并不是某一个 benchmark,而是 OpenAI 正在把模型从一个“回答问题的系统”,继续往一个“可以长时间代替人操作电脑、调用工具并完成工作”的系统推进。
这也是我看完整个发布信息后,认为 Astra 与 GPT-5.6 Sol 最大的区别。
先说结论:Astra 更像一个执行模型
过去我们判断大模型强不强,最常见的方法还是看知识、推理和代码。
到了 Astra,评价重点明显变了。
OpenAI 花了大量篇幅展示它如何操作浏览器、桌面软件、专业工具和开发环境。也就是说,模型不只是告诉你“应该怎么做”,而是要自己把任务做完。
这种变化可以从几个方向看出来:
- 能连续完成包含多个步骤的电脑操作;
- 能在网页、表格、文档、代码环境之间切换;
- 中途收到用户的新要求后,不容易丢掉最初目标;
- 缺少次要信息时可以自行做合理判断;
- 遇到会真正影响结果的重要决策时,再向用户确认;
- 长时间执行任务时,开始使用更主动的上下文保存与检索机制。
所以如果一定要给 Astra 找一个关键词,我更愿意用 “执行”,而不是简单的“推理更强”。
Computer Use 是这代最明显的升级
Astra 最值得看的,是 Computer Use。
在 OSWorld 2.0 上,Astra 得到 72.6%,GPT-5.6 Sol 是 65.7%;ScreenSpot-Pro 从 Sol 的 76.9% 提升到了 92.7%。
单纯看百分比已经不低,但比准确率更重要的是完成任务的时间。
OpenAI 给出的模拟结果显示,在 OSWorld 2.0 中,Astra 完成一项任务平均大约需要 40 分钟,而 GPT-5.6 Sol 约为 75 分钟。也就是说,它不是只多做对了一些任务,而是开始明显缩短整段自动化流程的执行时间。
这会直接影响 Agent 的可用性。
因为真正的 Agent 产品最怕两件事:第一是做错,第二是太慢。一个任务哪怕最终能成功,如果中间要反复截图、判断、点击、等待几十轮,成本和用户体验都会迅速变差。
Astra 如果能同时提高成功率和操作效率,价值会比单纯把某个推理 benchmark 提高几分更大。
编程能力继续涨,但变化不只在“会写代码”
代码方面,Astra 的公开成绩也很强。
例如 Terminal-Bench 4.0 达到 57.9%,而 GPT-5.6 Sol 是 37.3%。DeepSWE v1.1 为 74.1%,也高于 Sol 的 72.7%。
不过我更关注 Codex 配套的长任务机制。
过去做大型重构、长时间 debug 或跨很多文件修改时,一个常见问题是上下文不断被压缩。压缩次数多了以后,模型可能还记得“现在要修什么”,但已经忘了前面为什么否定某个方案、哪个测试曾经失败、某个边界条件从哪里来的。
Astra 开始把“长期笔记”和“旧上下文可检索”结合起来。它不需要把所有历史都塞在当前窗口里,而是可以在需要时重新找到之前的信息。
这其实比上下文窗口单纯变大更实用。
一个 Coding Agent 真正要连续工作几个小时,靠的不会只是一次性塞进去 50 万、100 万 token,而是能不能在几十轮甚至几百轮之后仍然知道自己为什么做过某个决定。
从这个方向看,Astra 的重点已经很接近“长期工作的虚拟开发者”,而不是传统代码补全工具。
办公场景开始强调“交付物”,而不是答案
另外一个变化是,OpenAI 对文档、表格、PPT、设计类任务的描述明显变多。
以前模型生成办公内容,通常是先给你一堆文字,再由人自己整理成最终文件。
Astra 想做的是另一件事:直接按照已有模板、结构和视觉风格产出接近可交付状态的结果。
AutomationBench 上,Astra 得到 41.4%,GPT-5.6 Sol 为 18.1%;BenchCAD 则达到 95.9%。
这些指标不一定像数学满分那么吸睛,但对真实工作非常关键。
公司真正愿意为 AI 付钱的场景,往往不是“帮我解释一下这个概念”,而是:
- 把这份 Excel 改完;
- 按公司模板做一套 PPT;
- 根据一堆资料生成正式报告;
- 打开后台把数据录进去;
- 跑完分析后直接把结果整理好。
当模型能从“给建议”走到“给成品”,AI 在企业里的价值计算方式也会变化。
数学和科研很强,但不是所有榜单都第一
Astra 在科研和数学上的部分结果非常突出。
FrontierMath Tier 4 (v2) 达到 97.6%,Terminal-Bench Science 0.1 达到 64.6%,相比 GPT-5.6 Sol 的 22.4% 是非常大的提升。GPQA Diamond 也达到 96.0%。
OpenAI 还公布了 Astra 参与数学研究的案例,包括对素数间隔问题的新结果。
但这里也需要冷静一点看。
Astra 并不是所有综合指标都碾压其它顶级模型。例如官方页面列出的 Artificial Analysis Intelligence Index 中,Astra 是 61.2,Claude Fable 5.1 是 65.7;Humanity’s Last Exam(带工具)上,Astra 的 57.2% 也低于页面列出的几个 Claude 模型。
所以这次不能简单总结成“GPT-6 全榜第一”。
更准确的说法是:Astra 在 Computer Use、自动化执行、部分软件工程任务、数学和科研工作流上出现了非常明显的提升,但不同模型依旧存在各自优势。
网络安全能力越强,限制反而会越多
Astra 还有一个很特殊的变化:网络安全能力跨过了 OpenAI Preparedness Framework 中的 Critical 阈值。
在 ExploitBench 上,Astra 达到 100%,GPT-5.6 Sol 为 78.5%;ExploitGym 则从 30.3% 提升到 42.4%。
这种能力提升是双刃剑。
它对安全团队意味着更强的代码审计、漏洞发现和修复能力,但也意味着同一个模型理论上可以更高效地完成攻击性任务。
因此 Astra 上线时会配合更严格的监控、授权边界和自动审查机制。一些高风险任务即使技术上能做,生产环境里的模型也不一定会执行。
这点很重要:未来判断一个模型“有没有某项能力”,可能越来越不能只看 ChatGPT 里能不能直接让它做。底层能力、安全策略和产品权限会变成三件不同的事情。
对齐能力提升,可能比跑分更重要
Astra 另一个经常被 benchmark 掩盖的变化,是它对“任务边界”的判断。
OpenAI 做了一些专门测试,观察模型在任务无法正常完成时,会不会擅自扩大操作范围、绕过限制,或者为了达成目标去做用户没有授权的事情。
在这些内部测试里,Astra 的越界行为明显少于 GPT-5.6 Sol。
为什么这个变化重要?
因为 Agent 越强,出错的代价越高。
一个聊天模型理解错问题,最多给你一个错误答案;一个能操作电脑、发送邮件、修改文件、执行代码的 Agent 如果误解目标,可能直接改掉真实数据。
所以当 AI 从“回答”进入“行动”,模型能力和模型克制必须一起提高。Astra 这次把这件事放到了非常核心的位置。
当然也有一个值得继续观察的问题:OpenAI 自己提到,在部分监控实验中,Astra 的书面推理比 GPT-5.6 Sol 更难监控。能力变强之后,怎么继续看懂模型为什么做出某个决定,会成为下一阶段的重要课题。
1M 上下文不是重点,真正重点是怎么用
Astra 的上下文窗口超过 100 万 token。
OpenAI MRCR v2 的长上下文测试中,Astra 在 256K–512K 区间达到 100%,512K–1M 区间仍有 96.3%。
但我认为“100 万上下文”本身已经不是最值得宣传的数字了。
真正影响体验的是三个问题:
- 放进去以后能不能准确找到;
- 几十轮之后还记不记得;
- 长任务中能不能只调出真正需要的信息,而不是每次重新吞完整上下文。
Astra 配合 Codex 的持久笔记和历史检索机制,明显是在解决后两个问题。
这会让超长上下文从一个规格参数,逐渐变成 Agent 的基础设施。
API 价格涨了,但不能只看每百万 Token
Astra 的 Standard API 定价是:
| 类型 | 价格 |
|---|---|
| Input | $10 / 1M tokens |
| Output | $50 / 1M tokens |
| Fast mode | Standard 的 2 倍价格,最高约 2 倍速度 |
和 GPT-5.6 Sol 相比,单 token 价格明显更高。
所以单看价目表,Astra 并不便宜。
但 Agent 场景真正应该算的是 完成一个任务的总成本。
如果一个模型价格低一半,却需要多生成几倍 token、多执行几十轮工具调用、失败后再重试两次,最终可能反而更贵。
Astra 发布信息里反复强调 token 使用、任务耗时和完成效率,说明 OpenAI 也在试图把模型定价逻辑从“每百万 token 多少钱”,转向“一个完整任务到底花多少钱”。
这可能也是以后 Agent 模型最合理的比较方式。
ChatGPT 和 API 怎么提供
OpenAI 表示,Astra 会先向部分组织开放,随后逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise,同时进入 OpenAI API,并通过 Amazon Bedrock 提供。
Pro、Business 和 Enterprise 还会获得 GPT-6 Astra Pro。Enterprise 默认不会自动开启,需要管理员在 workspace 中启用。
API 模型名为:
gpt-6-astra
对于开发者来说,Astra 最值得关注的并不只是换一个模型 ID,而是它背后更完整的 Agent 能力:Computer Use、异步工具调用、中途调整任务、长任务上下文、自动审查和持续监控正在逐渐变成一套完整系统。
我怎么看 GPT-6 Astra
如果 GPT-4 时代的关键词是“聊天”,GPT-5 时代越来越像“推理”,那 Astra 这次最明显的方向就是 工作。
不是模型能不能回答一道题,而是它能不能自己打开软件、找到资料、操作页面、修改文件、跑代码、验证结果,最后把东西交给你。
这也是为什么我认为,这次真正值得关注的不是 97.6%、99.9% 或 100% 这些非常夸张的数字。
更重要的是下面这条路线已经越来越清晰:
大模型正在从一个需要人不断提问的工具,变成一个能够接受目标、持续执行并对结果负责的 Agent。
Astra 当然还没有让这个目标彻底完成。不同 benchmark 仍然有输赢,价格也明显上升,网络安全能力增强后还带来了更多产品限制;真正复杂的长期任务能不能稳定工作,也要等大量真实用户使用后才能判断。
但从发布方向来看,OpenAI 已经不满足于让模型“更会说”。
它更想让模型开始真正“把事情做完”。
参考资料
- OpenAI:GPT-6 Astra 发布页
openai.com/index/gpt-6-astra/ - OpenAI Developers:GPT-6 Astra 模型资料
developers.openai.com/api/docs/mod... - OpenAI:GPT-6 Astra System Card
deploymentsafety.openai.com/gpt-6-...
注:文中 benchmark 和产品信息以 OpenAI 2026 年 9 月初公开页面为准;不同模型、工具环境、reasoning effort 和安全配置会影响实际结果。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu