GPT-6 Astra 重磅发布 这次 OpenAI 升级的不只是模型分数
GPT-6 Astra 重磅发布 这次 OpenAI 升级的不只是模型分数OpenAI 发布了 GPT-6 Astra。如果只看榜单很容易把它理解成又一次“模型更强了”的常规升级数学更高、代码更高、Computer Use 更高部分项目甚至已经逼近满分。但把这次公开的信息放在一起看会发现 Astra 真正值得关注的地方并不是某一个 benchmark而是 OpenAI 正在把模型从一个“回答问题的系统”继续往一个“可以长时间代替人操作电脑、调用工具并完成工作”的系统推进。这也是我看完整个发布信息后认为 Astra 与 GPT-5.6 Sol 最大的区别。先说结论Astra 更像一个执行模型过去我们判断大模型强不强最常见的方法还是看知识、推理和代码。到了 Astra评价重点明显变了。OpenAI 花了大量篇幅展示它如何操作浏览器、桌面软件、专业工具和开发环境。也就是说模型不只是告诉你“应该怎么做”而是要自己把任务做完。这种变化可以从几个方向看出来能连续完成包含多个步骤的电脑操作能在网页、表格、文档、代码环境之间切换中途收到用户的新要求后不容易丢掉最初目标缺少次要信息时可以自行做合理判断遇到会真正影响结果的重要决策时再向用户确认长时间执行任务时开始使用更主动的上下文保存与检索机制。所以如果一定要给 Astra 找一个关键词我更愿意用“执行”而不是简单的“推理更强”。Computer Use 是这代最明显的升级Astra 最值得看的是 Computer Use。在 OSWorld 2.0 上Astra 得到 72.6%GPT-5.6 Sol 是 65.7%ScreenSpot-Pro 从 Sol 的 76.9% 提升到了 92.7%。单纯看百分比已经不低但比准确率更重要的是完成任务的时间。OpenAI 给出的模拟结果显示在 OSWorld 2.0 中Astra 完成一项任务平均大约需要 40 分钟而 GPT-5.6 Sol 约为 75 分钟。也就是说它不是只多做对了一些任务而是开始明显缩短整段自动化流程的执行时间。这会直接影响 Agent 的可用性。因为真正的 Agent 产品最怕两件事第一是做错第二是太慢。一个任务哪怕最终能成功如果中间要反复截图、判断、点击、等待几十轮成本和用户体验都会迅速变差。Astra 如果能同时提高成功率和操作效率价值会比单纯把某个推理 benchmark 提高几分更大。编程能力继续涨但变化不只在“会写代码”代码方面Astra 的公开成绩也很强。例如 Terminal-Bench 4.0 达到 57.9%而 GPT-5.6 Sol 是 37.3%。DeepSWE v1.1 为 74.1%也高于 Sol 的 72.7%。不过我更关注 Codex 配套的长任务机制。过去做大型重构、长时间 debug 或跨很多文件修改时一个常见问题是上下文不断被压缩。压缩次数多了以后模型可能还记得“现在要修什么”但已经忘了前面为什么否定某个方案、哪个测试曾经失败、某个边界条件从哪里来的。Astra 开始把“长期笔记”和“旧上下文可检索”结合起来。它不需要把所有历史都塞在当前窗口里而是可以在需要时重新找到之前的信息。这其实比上下文窗口单纯变大更实用。一个 Coding Agent 真正要连续工作几个小时靠的不会只是一次性塞进去 50 万、100 万 token而是能不能在几十轮甚至几百轮之后仍然知道自己为什么做过某个决定。从这个方向看Astra 的重点已经很接近“长期工作的虚拟开发者”而不是传统代码补全工具。办公场景开始强调“交付物”而不是答案另外一个变化是OpenAI 对文档、表格、PPT、设计类任务的描述明显变多。以前模型生成办公内容通常是先给你一堆文字再由人自己整理成最终文件。Astra 想做的是另一件事直接按照已有模板、结构和视觉风格产出接近可交付状态的结果。AutomationBench 上Astra 得到 41.4%GPT-5.6 Sol 为 18.1%BenchCAD 则达到 95.9%。这些指标不一定像数学满分那么吸睛但对真实工作非常关键。公司真正愿意为 AI 付钱的场景往往不是“帮我解释一下这个概念”而是把这份 Excel 改完按公司模板做一套 PPT根据一堆资料生成正式报告打开后台把数据录进去跑完分析后直接把结果整理好。当模型能从“给建议”走到“给成品”AI 在企业里的价值计算方式也会变化。数学和科研很强但不是所有榜单都第一Astra 在科研和数学上的部分结果非常突出。FrontierMath Tier 4 (v2) 达到 97.6%Terminal-Bench Science 0.1 达到 64.6%相比 GPT-5.6 Sol 的 22.4% 是非常大的提升。GPQA Diamond 也达到 96.0%。OpenAI 还公布了 Astra 参与数学研究的案例包括对素数间隔问题的新结果。但这里也需要冷静一点看。Astra 并不是所有综合指标都碾压其它顶级模型。例如官方页面列出的 Artificial Analysis Intelligence Index 中Astra 是 61.2Claude Fable 5.1 是 65.7Humanity’s Last Exam带工具上Astra 的 57.2% 也低于页面列出的几个 Claude 模型。所以这次不能简单总结成“GPT-6 全榜第一”。更准确的说法是Astra 在 Computer Use、自动化执行、部分软件工程任务、数学和科研工作流上出现了非常明显的提升但不同模型依旧存在各自优势。网络安全能力越强限制反而会越多Astra 还有一个很特殊的变化网络安全能力跨过了 OpenAI Preparedness Framework 中的 Critical 阈值。在 ExploitBench 上Astra 达到 100%GPT-5.6 Sol 为 78.5%ExploitGym 则从 30.3% 提升到 42.4%。这种能力提升是双刃剑。它对安全团队意味着更强的代码审计、漏洞发现和修复能力但也意味着同一个模型理论上可以更高效地完成攻击性任务。因此 Astra 上线时会配合更严格的监控、授权边界和自动审查机制。一些高风险任务即使技术上能做生产环境里的模型也不一定会执行。这点很重要未来判断一个模型“有没有某项能力”可能越来越不能只看 ChatGPT 里能不能直接让它做。底层能力、安全策略和产品权限会变成三件不同的事情。对齐能力提升可能比跑分更重要Astra 另一个经常被 benchmark 掩盖的变化是它对“任务边界”的判断。OpenAI 做了一些专门测试观察模型在任务无法正常完成时会不会擅自扩大操作范围、绕过限制或者为了达成目标去做用户没有授权的事情。在这些内部测试里Astra 的越界行为明显少于 GPT-5.6 Sol。为什么这个变化重要因为 Agent 越强出错的代价越高。一个聊天模型理解错问题最多给你一个错误答案一个能操作电脑、发送邮件、修改文件、执行代码的 Agent 如果误解目标可能直接改掉真实数据。所以当 AI 从“回答”进入“行动”模型能力和模型克制必须一起提高。Astra 这次把这件事放到了非常核心的位置。当然也有一个值得继续观察的问题OpenAI 自己提到在部分监控实验中Astra 的书面推理比 GPT-5.6 Sol 更难监控。能力变强之后怎么继续看懂模型为什么做出某个决定会成为下一阶段的重要课题。1M 上下文不是重点真正重点是怎么用Astra 的上下文窗口超过 100 万 token。OpenAI MRCR v2 的长上下文测试中Astra 在 256K–512K 区间达到 100%512K–1M 区间仍有 96.3%。但我认为“100 万上下文”本身已经不是最值得宣传的数字了。真正影响体验的是三个问题放进去以后能不能准确找到几十轮之后还记不记得长任务中能不能只调出真正需要的信息而不是每次重新吞完整上下文。Astra 配合 Codex 的持久笔记和历史检索机制明显是在解决后两个问题。这会让超长上下文从一个规格参数逐渐变成 Agent 的基础设施。API 价格涨了但不能只看每百万 TokenAstra 的 Standard API 定价是类型价格Input$10 / 1M tokensOutput$50 / 1M tokensFast modeStandard 的 2 倍价格最高约 2 倍速度和 GPT-5.6 Sol 相比单 token 价格明显更高。所以单看价目表Astra 并不便宜。但 Agent 场景真正应该算的是完成一个任务的总成本。如果一个模型价格低一半却需要多生成几倍 token、多执行几十轮工具调用、失败后再重试两次最终可能反而更贵。Astra 发布信息里反复强调 token 使用、任务耗时和完成效率说明 OpenAI 也在试图把模型定价逻辑从“每百万 token 多少钱”转向“一个完整任务到底花多少钱”。这可能也是以后 Agent 模型最合理的比较方式。ChatGPT 和 API 怎么提供OpenAI 表示Astra 会先向部分组织开放随后逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise同时进入 OpenAI API并通过 Amazon Bedrock 提供。Pro、Business 和 Enterprise 还会获得 GPT-6 Astra Pro。Enterprise 默认不会自动开启需要管理员在 workspace 中启用。API 模型名为gpt-6-astra对于开发者来说Astra 最值得关注的并不只是换一个模型 ID而是它背后更完整的 Agent 能力Computer Use、异步工具调用、中途调整任务、长任务上下文、自动审查和持续监控正在逐渐变成一套完整系统。我怎么看 GPT-6 Astra如果 GPT-4 时代的关键词是“聊天”GPT-5 时代越来越像“推理”那 Astra 这次最明显的方向就是工作。不是模型能不能回答一道题而是它能不能自己打开软件、找到资料、操作页面、修改文件、跑代码、验证结果最后把东西交给你。这也是为什么我认为这次真正值得关注的不是 97.6%、99.9% 或 100% 这些非常夸张的数字。更重要的是下面这条路线已经越来越清晰大模型正在从一个需要人不断提问的工具变成一个能够接受目标、持续执行并对结果负责的 Agent。Astra 当然还没有让这个目标彻底完成。不同 benchmark 仍然有输赢价格也明显上升网络安全能力增强后还带来了更多产品限制真正复杂的长期任务能不能稳定工作也要等大量真实用户使用后才能判断。但从发布方向来看OpenAI 已经不满足于让模型“更会说”。它更想让模型开始真正“把事情做完”。参考资料OpenAIGPT-6 Astra 发布页https://openai.com/index/gpt-6-astra/OpenAI DevelopersGPT-6 Astra 模型资料https://developers.openai.com/api/docs/models/gpt-6-astraOpenAIGPT-6 Astra System Cardhttps://deploymentsafety.openai.com/gpt-6-astra注文中 benchmark 和产品信息以 OpenAI 2026 年 9 月初公开页面为准不同模型、工具环境、reasoning effort 和安全配置会影响实际结果。原文链接
上一篇/下一篇内容由系统自动关联
返回资讯列表 →