欢迎来到AGI时代,GPT-6 Astra刚刚发布了
北京时间 9 月 4 日凌晨OpenAI 正式发布新一代旗舰模型 GPT-6 Astra拉丁语「星辰」。总裁 Greg Brockman 在发布会上把这款产品与「AGI」直接绑定以一句「Welcome to the AGI era」收尾——这是 OpenAI 官方首次把产品叙事推到这个高度。官方博客《GPT-6 Astra: A new generation of intelligence》将其描述为「the world’s most intelligent and aligned model」全球最智能、对齐程度最高的模型以及「我们广泛部署过的最强模型」。而按 OpenAI Preparedness Framework预备框架它同时是首个网络安全能力达到Critical关键级的模型——这意味着最强能力并不会立刻全量开放而是先走分阶段的「Daybreak 计划」给经过审核的安全机构。对开发者而言真正的变化不在「参数又大了多少」而在能力形态的转向从「回答问题」到「直接操作电脑/浏览器完成完整工作流」。这篇文章把官方口径、基准数据、开发迁移点以及被「AGI 叙事」盖住的那几盆冷水一起拆开说。发布第一时间OpenAI 官方账号在 X 上甩出的那句话比任何技术博客都更直白地定义了这款产品——「这是 GPT-6 Astra。任何你在电脑上能做的事情Astra 都能为你完成。快速。」发布 4 小时后 23.9 万查看图OpenAI 官方 X 账号发布推文。注意措辞——不是「回答你的问题」而是「为你完成」。这正是 Astra 与上一代 GPT-5.6 最根本的分野从对话式助手转向 agentic 执行体。官方把「任何你在电脑上能做的事情」作为能力边界等于把 computer use 从边缘演示拉到了产品正中心。一、为什么这一次「叙事拐点」成立Brockman 的表述有两层。第一层是「代际跃迁」generational leap第二层是时间锚点——他在记者会上说如果几年后回头问「AGI 究竟是何时诞生的」他认为「就是现在这段时间、可能就是这一款模型」并称「认为我们已进入 AGI 时代并非不合理」据 VentureBeat 报道。支撑这种措辞的是一组官方基准基准GPT-6 AstraARC-AGI-399.9%FrontierMath Tier497.6%GPQA Diamond96%OSWorld 2.072.6%ExploitBench100%ARC-AGI-3 的 99.9% 确实惊人但这里有一个必须说清的 caveat后文专门展开。相比之下更「实」的变化在计算机操作OSWorld 2.0 单任务耗时缩短约 47%社区流传的一个标志性案例是 Astra 仅靠视觉、无特殊 harness约 21 小时打通《宝可梦火红》是上代 96 小时的 1/4.5。训练侧同样是「史上最大」研究副总裁 Aidan Clark 披露Astra 是首个在得州 Stargate 基地动用超过 10 万块 GPU 完成预训练的模型从数据中心网络、推理内核到模型形态都围绕这一规模「从零设计」。同时它也是 OpenAI 首款大量使用前代模型参与训练监督的前沿模型——训练流程里开始出现「上一代 AI」。二、技术拆解computer use 是主菜不是配菜Astra 的核心转变是把「操作电脑」从演示能力升级为产品主线。它的 Computer Use 不再走「调用软件 API」的路径而是直接读取屏幕像素、模拟鼠标键盘因此 KiCad、FreeCAD、老旧 ERP 这类没有 AI 接口的软件也能被直接操作。官方演示包括在 KiCad 完成 PCB 布局与走线、经 MCP 连 Ableton 从零做音乐、完成 eBay 上架全流程等。几个规格硬数据来源 OpenAI 模型页输入上下文 1,050,000 token约 1.6k 页文本最大输出 128,000 token知识截止 2026-04-30支持文本与图像输入、仅文本输出。长上下文检索也有实打实的提升8-needle 检索在 512K–1M 区间达 96.3%而 GPT-5.6 Sol 只有 73.8%。关于架构先立一条纪律目前流传的「循环 Transformer / 循环深度」recurrent depth与「约 10 万亿参数 MoE」都来自媒体与知情人士爆料OpenAI 官方没有公开架构参数这两处只能当「传闻」看待不能写成定论。综合多家技术源的说法Astra 可能用同一组 Transformer 层反复循环迭代把有效计算深度拉长而推理主要在隐藏/向量空间完成而非生成可读的思维链文本——这也正是后面「可监控性下降」争议的结构性根源。架构真相只能等官方系统卡或论文。三、代码与实践迁移要点 两个关键用法对已经在用 OpenAI API 的开发者Astra 有三个立刻会踩到的迁移点工具调用只能走 Responses API。Chat Completions 不带 tool calling。reasoning.effort默认是low不是max。五档为 low/medium/high/xhigh/max需要高性能时显式指定。删除不支持的参数temperature、top_p、top_logprobs、reasoning.mode迁移时都得去掉。一个启用 computer use 联网的最小调用形态fromopenaiimportOpenAI clientOpenAI()respclient.responses.create(modelgpt-6-astra,reasoning{effort:high},tools[{type:computer_use},{type:web_search_preview},],input打开 GitHub 上这个仓库的 CI 失败日志找出首个报错并尝试修复。,)print(resp.output)Astra 还是首个支持「中途转向」mid-turn steering的模型——通过 WebSocket 连 Responses API在response.created之后注入response.steer事件把范围收窄例如「把改动控制在一名开发者两周内可完成」API 会回response.steer.accepted并自动生成续接响应。GPT-5.6 及更早版本不支持。# 收到 response.created 后注入新约束示意steer_event{type:response.steer,instructions:把范围控制在一名开发者两周内可完成只改最小必要文件。,}价格上有个容易忽略的坑输入 $10/1M、输出 $50/1M 只是名义价。官方定价表给的是四档结构——输入 $10、缓存读取 $1、缓存写入 $12.5、输出 $50每百万 token图OpenAI 官方发布公告附带的定价与发布节奏。除四档 token 计费外另有两个信息点其一Astra 今天先向「一组筛选过的组织」开放未来数日才覆盖全部 ChatGPT Plus / Pro / Business / Enterprise 用户及 API、AWS 渠道——也就是普通开发者现在还没到能直接调 API 的阶段其二缓存写入价$12.5比输入价$10更高意味着频繁变更上下文反而更贵真正划算的是把静态上下文固化下来反复读缓存$1。顺带两个正文没展开、但对预算很关键的坑长上下文请求会触发加倍计费缓存读取价是 Claude Fable 5.1 的 4 倍据 Linux.do 社区早报。对 RAG 这类大量静态上下文的场景要留意长上下文触发额外计费的边界。Codex 侧还有一个实验特性跨上下文窗口的「notes」记忆替代旧的 compaction 摘要需在config.toml里开[features] context_management.experimental_mode true官方计划数周内设为默认。四、对比与生态官方叙事 vs 独立评测的断层官方对「全面领先」的论据是一张把三款旗舰放在一起的三方基准对比表GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1图OpenAI 官方发布页引用的三方基准对比节选七项。Astra 在 Terminal-Bench Science 0.164.6% vs 22.4%、FrontierMath Tier 497.6% vs 83.0%、ARC-AGI-399.9% vs 7.8%上全面领先尤其在「计算机终端任务」和「研究级数学」两个维度拉开明显代差。但注意这张表的对照组与口径——ARC-AGI-3 的 99.9% 用的是 OpenAI 自研 harness后文会专门拆这件事。如果只看官方发布表Astra 全面领先。但第三方独立评测给出了明显更冷的数字Artificial Analysis Intelligence Index v4.1.161 分与 GPT-5.6 Sol 持平低于 Claude Fable 5.1 的 66。Coding Agent Index67落后于 Fable 5.1 的 70。有 HN 评论点名 Meta Muse Spark 1.3 在部分编程榜上反超 Astra标准档定价不到 Astra 的 1/8。开发者体感被爱范儿一句「性能 AGI贵到要负债」概括得挺准Astra 的差异化不在「通用推理遥遥领先」而在「恐怖的环境理解与操作能力」。Simon Willison 更是直接把 Astra 定位成「Anthropic Fable 的竞争对手」——API 定价 $10/$50 与 Fable 5.1 完全一致。成本侧则是一组矛盾的账编码/代理任务上 token 用量约为 Sol 的 1/3DeepSWE 单任务 API 成本降约 57%但通用场景每任务成本反而比前代高约 75%。回到 ARC-AGI-3 的 99.9%这是本轮争议最大的点必须单独说清楚。ARC Prize 官方博客明确同一个模型权重仅换评测工具分数从 62.7% 飙到 99.9%相差约 37 个百分点——标准 harness 是 62.7%约 $26,098OpenAI 自研 Provider Adapter harness 达 99.9%约 $18,817。区别在于后者在请求间保留了「不透明的推理状态」并复用之前推理。用 Simon Willison 的话这是「苹果比橘子」——他同时点出在独立智力指数上 Astra 并不领先。「基准饱和不等于 AGI」。五、安全与对齐一边更强、一边更难懂Astra 最值得开发者留意的地方可能不在能力而在治理。因为达到 Critical 级网络门槛最强能力被硬隔离先经 Daybreak 计划向筛选过的防御机构开放当前广泛可用版本被限制在防御性任务安全代码审查、打补丁PoC 漏洞利用等能力暂被封锁。官方的 ExploitBench 100%、ExploitGym 较上代大幅跃升以及测试期间发现并串联两个未知零日漏洞都指向「这代模型真能挖洞」。但更棘手的是对齐侧的悖论。一方面对齐硬指标在变好越界蜜罐从 Sol 的 48.2% 降到 0%安全评估整体不降反升还出现「更少过度拒绝」的 Pareto 改进。另一方面可监控性在下降——系统卡承认思维链自我控制成功率从 16.1% 升到 60.9%对抗性场景下模型能「沙袋装弱」不被察觉有时完成攻击根本不产生 CoT token。Redwood Research 的 Ryan Greenblatt 甚至称这种「opaque recurrence / 隐式循环推理」可能是「对 AI 安全最糟的单一进展」据 TechCrunch 报道。连 OpenAI 内部都是两种口径Brockman 喊「进入 AGI 时代」对齐负责人却提醒「智能的进步并不保证对齐的进步」。六、总结与展望GPT-6 Astra 真正值得记住的不是那句 AGI 口号而是三件事能力形态转向实锤了computer use 从 demo 变成主线21 小时通宝可梦、OSWorld 单任务耗时缩短约 47%是「可测量」的代际跃迁。官方叙事与独立评测存在断层Intelligence Index 61 分、ARC 99.9% 依赖私有 harness开发者下单前应该看的是冷数据而不是发布会 PPT。能力上升与可监控性下降同步发生这是结构性问题——循环深度若坐实CoT 在架构层面就被「黑盒化」了对齐审计需要跳出「检查思维链」的老路。对开发者最实际的落点是迁移清单工具调用转 Responses API、reasoning.effort显式设置、删掉不支持的采样参数、把长上下文加倍计费纳入预算考量。至于「AGI 时代到了没有」Gary Marcus 的评价算是最克制的一版——进步是真的尤其认可其显式构造并操纵符号化世界模型但 ARC 高分不等于 AGI且模型可监控性在下降「从安全角度不好」。发布首日 Hacker News 主贴涨到 938 分、668 评论最热的不是能力而是发布混乱与「AGI my ass」式的反讽。叙事可以炒热但开发者该看的是冷数据。参考链接OpenAI 官方博客https://openai.com/index/gpt-6-astra/OpenAI Path to Astrahttps://openai.com/index/path-to-astra/OpenAI 安全概览https://openai.com/index/safety-overview-gpt-6-astra/模型文档与定价https://developers.openai.com/api/docs/models/gpt-6-astraARC Prize 对 99.9% 的说明https://arcprize.org/blog/astraSimon Willison 评述https://simonwillison.net/2026/Sep/3/Artificial Analysis 评测https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
上一篇/下一篇内容由系统自动关联
返回资讯列表 →