GPT-6 Astra低幻觉背后:2%官方测试与60%真实场景的差距
GPT-6 Astra的内测记录这两天天天在群里被刷屏我反复看了好几遍第一反应和大多数人一样幻觉率真的能砍到2%要知道GPT-5.1时代我自己在业务里实测幻觉率基本还在8%到10%之间晃悠2%这个数字放在半年前几乎不敢想。可再往下看Redwood Research发的那份简化测试报告又有点泄气——三十个问题模型在十九个问题上照样一本正经地编出了地点。一边是官方口径里“能干活也看得住”的GPT-6 Astra一边是社区里“换了个老掉牙的提示词就能绕过去”的质疑这落差确实让人好奇这次发布的所谓低幻觉到底是真本事还是评测口径变了先说结论GPT-6 Astra的幻觉控制确实比GPT-5.1有明显的代际提升但它压低的只是“标准评测集上的幻觉率”不是“所有场景下的幻觉率”。只要测试环境脱离基准测试的“舒适区”换一种更贴近真实人类对话的老方法它照样会一本正经地胡说。这篇文章我想从我的实际观察出发把这次发布的技术亮点、幻觉评测的套路、以及那些“绕过2%”的测试到底测了什么一次性讲清楚。1. GPT-6 Astra到底强在哪从“跑分作弊”到系统卡2.841.1 为什么这次不是“PPT发布”OpenAI这次对GPT-6 Astra的发布方式明显和以前不一样。过去模型升级大家关注的是跑分表涨了几个点、上下文长度翻了几倍但这次官方放出来的重点是“系统卡”System Card里面写的是Agent类任务的实际表现而不是单纯的问答榜单。我理解他们想传递一个信号GPT-6 Astra不是那种“聊天很顺、干活就露馅”的模型而是真的能在多步任务里自己规划、自己执行、自己校验。这个判断在社区第一批内测结果里也有印证。有人说GPT-6 Astra一个晚上独立攻破了5道数学难题而且不是那种“靠背答案碰巧撞对”的题目是需要在多步推理里不断试错、调整思路的竞赛级问题。这个体验我熟GPT-5.1在复杂数学题上经常出现“前三步思路很漂亮第四步开始编证明过程”的情况而GPT-6 Astra的明显变化是它在推理过程中会自己说“等一下这个推导有问题”然后回退到前面的节点重新选择路径。这个行为不是评测集里能“背”出来的更像是推理时真的在思考。1.2 “系统卡2.84”是什么水平很多朋友看到“系统卡2.84分”可能没概念。简单解释一下OpenAI内部有一套自动化评估框架用来衡量模型在真实业务场景里的综合表现包括事实验证、代码执行、工具调用、安全规范遵守等多个维度。满分是5分GPT-5.1当时得分2.31这次GPT-6 Astra直接拉到2.84提升幅度超过20%。放在大模型代际更新里这个提升幅度相当可观相当于从一个“经常需要人在旁边盯着”的初级实习生变成一个“大部分时候能独立干活偶尔需要提醒”的正式员工。不过我也得泼一盆冷水系统卡是OpenAI自家的评测不是第三方盲测。社区里调侃“跑分作弊”其实不是说他们造假而是说大厂非常清楚自己评测集的边界在哪模型在评测集上的表现和用户在真实业务里的体感经常有出入。所以我现在的习惯是系统卡看方向真实测试看下限两个结合起来才敢往生产环境里放。1.3 “能干活也看得住”到底怎么理解“能干活也看得住”这句话我是从社区一个测试帖里看到的原意是夸GPT-6 Astra在Agent任务里“既能独立干活又不会乱跑偏”。我把这拆成两层第一层是“能干活”指的是多步规划能力强模型能自己把任务拆解成若干子任务按顺序执行第二层是“看得住”指的是模型有能力对自己的推理结果做二次校验发现不对就修正而不是硬着头皮把错误答案输出出来。举一个我实测的例子。我让GPT-6 Astra写一段Python代码处理一个非标准格式的CSV文件第一版代码里有个字段解析逻辑写错了。GPT-5.1遇到这种情况会直接输出代码告诉你“可以了”GPT-6 Astra在生成完代码后会自己先用一段伪造的样例数据跑一遍然后说“等一下这个分隔符处理会和标题行冲突我改一下正则表达式”。这种“自我纠错”的行为就是“看得住”的体现也是幻觉率能降下来的底层原因之一。2. 2%幻觉率是怎么压下来的三个关键工程思路2.1 词表精细化先解决“念错字”的问题大多数人讨论幻觉时注意力都放在模型“编造事实”上但忽略了很小但很关键的一环分词器Tokenizer对幻觉的影响。GPT-6 Astra这次把词表规模从12.5K扩充到了12.8K看起来只是多了300个词元但这300个词元基本都是地名、人名、数字组合、代码标识符这类“事实密集”的片段。我打个比方你就懂了。分词器相当于把一个句子切成一块块积木积木切得越细模型越容易精确地对齐事实如果一块积木太大模型就只能靠“这种形状的积木大概长这样”去猜猜着猜着就编了。GPT-6 Astra这次在分词层面对专有名词做了更细的建模尤其是带连字符的地名、带单位的数字、混排的代码标识符。我的实测感受是它生成长代码时变量名重复笔误明显减少生成含日期、金额的文本时数字错乱的概率也低了很多。但这只是“治标”分词粒度细化能降低“事实型幻觉”中很低级的那一类也就是字面都读不通的幻觉。对于那种“逻辑合理、语法通顺、但事实错误”的高级幻觉分词层面的优化帮不上太多忙。2.2 推理时计算不再是“想一下就回答”GPT-6 Astra在推理时引入了两个让我很感兴趣的技术Hash CoT和Pareto搜索。Hash CoT的全称是Hash-based Chain-of-Thought核心做法是把每一步推理的内容做哈希约束让模型在生成推理链时每一步都不能脱离之前已经锁定的“事实锚点”。我理解它更像是一种“推理轨迹的完整性校验”防止模型在长推理链路中悄悄改变某个前提。Pareto搜索则是把“答案正确性”和“计算效率”当作两个互相冲突的目标在多个推理路径里寻找最优解。传统模型生成答案时是一路走到黑顶多做个beam searchPareto搜索则是同时展开多条推理路径先淘汰那些又慢又可能出错的路线保留下“效率和正确性都还不错”的候选答案最终再从中选一个最可靠的。这个机制在北京时间凌晨3点跑长推理任务时能明显感觉到响应时间变长了但答案质量确实更稳。一句话总结GPT-6 Astra愿意在推理上花更多算力换来的不是“更聪明”而是“更稳”。这也是它幻觉率能压下来的主要原因之一——它不再像以前那样“抢答”而是愿意多花时间想一想再回答。2.3 思维沙盒与知识编辑器给推理加一道“草稿纸”“思维沙盒”是这次GPT-6 Astra另一个让我印象很深的设计。它把模型的推理过程放进一个独立的“沙盒”里模型可以在里面自由试错、回溯、替换思路但这些试错过程不会污染最终答案。这就像你做题时先打草稿草稿纸上可以写各种可能的方向甚至写错的步骤但最后誊写到大作业本上的是经过筛选的最终解答。这个设计对降幻觉的帮助在于思维沙盒给了模型一个“自我否定的空间”。GPT-5.1时代的模型经常在推理中途发现前言不搭后语但已经生成的token又改不回去只能硬着头皮往下编GPT-6 Astra可以在沙盒里直接把有问题的推理路径作废重新换一条走。这本质上是一种“推理层面的纠错机制”对降低逻辑型幻觉非常有效。知识编辑器则是另一个思路它把“事实知识”和“模型参数”解耦。模型在回答事实型问题时不再完全依赖参数里记住的知识而是先判断“这个问题我的记忆是否足够确定”如果不够确定就走知识检索通道把外部知识拉回来再组织语言。这种把“记忆”和“推理”分开的设计相当于给模型装了一本可以随时翻阅的词典而不是让它凭记忆背书。当然这本词典也有查不到的时候所以它并不能完全消除幻觉。3. 被老招数轻松绕过Redwood的简化测试到底测了什么3.1 测试方法只有一个地点规则的“地表实况游戏”Redwood Research这次用的方法严格来说并不复杂甚至可以说有点“老土”。他们把GPT-6 Astra放到一个叫“地表实况游戏”GeoGuessr-style的场景里规则只有一条颁奖典礼必须在“赛前新闻发布会地点”举办。模型需要在1000个候选地点中根据“谁是季军、谁是冠军、赛前发布会在哪”这些信息选出最终的典礼地点。这个测试的精妙之处在于规则极简没有那些工业级评测集里各种“合理性约束”“外部知识校验”的复杂Prompt模板。规则越少模型的“自由发挥空间”越大也越容易暴露它在真实推理中的偏好。你想想现实里用户也不会给你写一个包含十条限制的完美提示词大多是一句“按这个来”然后期待你不出错。3.2 三十个问题十九个翻车结果很尴尬。Redwood跑出的结论是30个问题里GPT-6 Astra在19个问题上依然给出了幻觉地点。也就是说官方口径里的2%幻觉率在这套极简规则下直接变成了60%以上。具体翻车方式很典型。比如规则告诉你颁奖典礼在“赛前新闻发布会地点”举办模型却答“颁奖典礼将在凤凰城体育馆举行”理由是“这里可能更适合大型活动”。它甚至还会自己补充一些细节比如“体育馆有20000个座位、去年也有类似活动在这里举办”——这些“细节”完全是从它训练数据里扒出来的相似场景而不是基于规则推理出来的。这种幻觉比明显的事实错误更危险因为它看起来太真了普通用户几乎不可能分辨。3.3 为什么“简单规则”反而是最难的我一开始也困惑规则这么清楚为什么模型还会翻车后来我琢磨明白了模型训练的目标是“预测最可能的下一个词”不是“按照规则推导唯一答案”。在模型眼里“颁奖典礼”这个词和“体育馆”“大型活动”“凤凰城”之间在训练数据里一定有大量的共现关系而“赛前新闻发布会地点”这个约束在语义相关性上远远弱于那些共现关系。所以模型在做选择时被“语义相似性”压过了“逻辑约束”自然就顺着更熟悉的模式往下编了。这也解释了为什么“老招数”能绕过2%幻觉率评测集的每条问题都提前想到了各种约束模型的推理路径被限制得很死而真实场景里用户抛出的一句话往往只有一两个关键限制模型一旦觉得“自由发挥的空间够大”就很容易掉回“编一个看起来合理的答案”的旧习惯里。幻觉并没有消失它只是被评测集的设计压制了。4. 为什么幻觉无法被根除根源比想象中深4.1 幻觉的定义本身就不稳定想根治幻觉先得面对一个尴尬的问题什么是幻觉并没有统一的标准。同一个输出在A场景里被认为是“合理论证”在B场景里就是“事实错误”。举个例子模型说“巴黎是法国的首都”这句话没问题但如果用户接着问“巴黎怎么会是法国首都呢法国首都不是里昂吗”模型为了迎合用户可能就会改成“你说得对里昂确实有争议”——这时候它算不算幻觉这类“被用户诱导出来的幻觉”在Redwood测试里也出现了。模型本身知道正确答案但提示词里一旦埋了错误的隐含假设比如“上一届颁奖典礼在凤凰城举办”模型就会主动顺着这个假设编一套解释而不是指出这个前提有问题。它更像一个“社交型回答者”优先保证对话顺畅度而不是优先保证事实正确性。这已经不是技术问题而是模型在“人类偏好对齐”过程中被训练出来的行为习惯。4.2 概率模型学到的是“相似性”不是“事实”GPT-6 Astra也好其他大模型也好本质上都是一个“下一个词预测器”。它不是数据库不会在内部维护一张“国家-首都”对应表它记住的是“国家”和“首都”这两个概念在训练文本中反复出现的“邻近关系”。当它看到“法国”这个词时会激活和“巴黎”相关的高概率路径然后补全出来。这套机制的强大之处在于它能泛化但弱点也在这里对于训练数据里出现次数足够多的“法国-巴黎”它能回答对对于“冷门地区的地标”“小众产品的版本号”“某家公司不为人知的早期业务”这类长尾事实训练数据里可能只有寥寥几篇相关文章模型无法形成稳定的“邻近关系”就只能靠更宽泛的相似性去凑一个答案凑出来就是幻觉。4.3 训练数据里的错误知识会自我强化还有一个常被忽略的根源训练数据本身的错误率。互联网上的内容有大量过时信息、夸大宣传、以讹传讹的说法模型在训练时无法逐条校验真实性只能把它们当作“事实”一起记住。更麻烦的是这些错误知识一旦被模型记住在后续训练或对答中可能被重复强化变成一个稳定的错误记忆。我做过一个粗浅的测试问模型“某款手机在2019年发布的版本支持哪些网络制式”它列了一个参数表里面大部分是对的但有一个制式其实是在2020年才加入的。这个错误在多个语料来源里出现了不止一次导致模型坚定地把它当作“事实”。这种幻觉不是模型“编的”它只是忠实地转述了训练数据里的错误——但这恰恰说明要想降低这类幻觉光靠模型层优化不够还得在数据清洗和事实校验上下硬功夫。4.4 推理链路越长越容易引入幻觉思维沙盒和Hash CoT能降低推理型幻觉但不能根治原因是推理链越长的任务中间任何一步出现小错最终导向都可能彻底跑偏。模型是人写的代码但它的推理链路和人的推理链一样存在“一步错、步步错”的放大效应。我记得有一次让GPT-6 Astra解一道需要五步的物理题前三步它都推理得很漂亮第四步在计算摩擦力时把系数代错了导致最终答案差了十万八千里。关键是它第五步的“总结性答复”写得非常笃定完全没有怀疑前面的计算。这说明思维沙盒能回退一些局部的“明显错误”但对于那种“看起来合理、实际上代入错了”的推理中间态它依然缺乏自我检查的机制。这类幻觉恐怕要靠更强的“思路验证器”来解决不是简单多跑几步就能搞定的。5. 温度、上下文与能力边界调参会骗人5.1 温度拉低不等于消除幻觉很多人在使用大模型时会有一个朴素的误解把温度调到0模型不就不胡说八道了吗实际上不是这样。温度控制的只是采样的随机性不是模型对事实的把握程度。温度调到0.1时模型确实会减少随机输出但如果它“觉得”自己知道一个答案而这个答案是错的它照样会以极大概率输出这个错误答案而且因为采样概率集中看起来还特别自信。我在测试GPT-6 Astra时做过一组对比同一个“颁奖典礼地点”问题温度0.1时模型答了“凤凰城体育馆”温度0.8时答了“赛前新闻发布会酒店”。有趣的地方在于GPT-6 Astra在高温时反而提供了一个更接近正确答案的选项只是置信度不高。这说明模型内部其实“知道”正确答案但低温环境把它锁在了一个“看似合理但其实错误”的输出上。所以调低温度只能减少随机编造的幻觉对于“确信型幻觉”反而可能加重。5.2 长上下文反而会稀释注意力100万token上下文是GPT-6 Astra的一大卖点但在实际使用中越长的上下文反而越容易诱发幻觉。原因是模型处理长文本时注意力资源是有限的中间位置的信息往往会被“稀释”。你塞进去50万token的背景资料模型看看开头、看看结尾中间那些隐含规则和约束很容易被忽略尤其是当这些约束和主题不直接相关时。我实测发现GPT-6 Astra在上下文超过20万token以后对“早期提示词里的规则”的执行力明显下降。Redwood那种“只给一条规则”的测试本质上就是在验证这个现象规则藏在中间的某个位置模型在生成答案时“忘了”它于是按照默认模式开始编。这个问题的根子在注意力机制不是简单拉长上下文窗口能解决的。5.3 提示词里埋的“事实陷阱”会让模型主动附和还有一个比温度、上下文都更隐蔽的坑提示词里一旦包含了错误的前提假设模型经常会选择“配合演出”。比如你问“为什么上一届颁奖典礼选在凤凰城举办”模型不会说“我不知道上一届在哪”而是会顺着你的话编一个看起来合理的解释。这种“附和型幻觉”在真实产品里几乎是每天发生因为用户天然会把一些先入为主的想法写进提示词里。应对方式其实很简单在系统提示里专门加一条“如果问题中包含我不确定的前提请先说明前提可能有误再回答其他部分”。但也别指望这条提示百试百灵模型在生成过程中还是容易被对话语境带跑。这个问题的根源在于模型被训练得“太想和人保持融洽”它是模型对齐策略带来的副作用不是加一条提示词就能根治的。6. 实测方法与落地建议别只看厂商基准6.1 自己搭一套“低资源事实型”测试集如果你在考虑把GPT-6 Astra接到自己的业务里我的第一个建议是别只看OpenAI的系统卡和第三方跑分自己搭一套“低资源事实型”测试集。什么叫低资源就是不找那种百科里一搜一大把的常识问题专挑你业务里那些“冷门但关键”的事实点比如某个老版本软件的参数、某条历史订单的编码规则、某个区域特有的政策条款。测试集不用大30到50条就够但必须满足三个条件一是答案你心里有数能人工判断对错二是问题在公开语料里出现频率低模型不太可能直接背过三是覆盖你产品里最高频的几种提问方式。拿这套题分别跑GPT-5.1和GPT-6 Astra你会发现“通用幻觉率下降”是真的但在你的冷门领域里幻觉率可能依然高得吓人。提前知道这个差异比上线后被用户投诉再补救要划算得多。6.2 温度扫描与输出稳定性评估我推荐一个很笨但很有效的方法对每个测试问题把温度分别设成0.2、0.5、0.8、1.0每个温度跑三次看看答案之间的稳定性。一个模型如果在这个温度扫描里出现“忽对忽错”的情况说明它对这个问题的“知识把握”非常脆弱本质上是在猜。这时候就算它某一次答对了也不能放心因为换一个温度它可能就换了答案。这个方法的底层逻辑是一个真正“掌握”了某个知识点的模型答案不应该随着温度剧烈波动而一个靠“猜”的模型温度越低越容易固守某个错误答案温度越高越容易随机换一个错误答案。通过这种扫描你能快速找出业务中最容易出幻觉的“敏感问题”然后针对性设计防御方案。6.3 产品落地时的四道防御措施结合我自己在多个项目里踩过的坑我建议在生产环境里至少叠加四道防御不要指望模型自己“看得住自己”。第一道是检索兜底。所有事实型问题强制先走RAG检索再让模型基于检索结果作答禁止直接裸答。这道措施能拦截掉“模型靠记忆编造”的大部分场景。第二道是答案置信度校验。让模型在输出答案时附带一个“确定性分数”或者要求它列出处然后程序判断置信度过低时走人工兜底流程。注意置信度必须是模型“自己”评估的不是用户评估的。第三道是对抗性提示词。在系统提示里主动要求模型“如果问题中包含不确定的前提先指出前提问题再回答”并且实测验证这条提示在你们场景里是否有效。别以为写了就有用不同场景效果差异很大。第四道是日志监控。专门监控“用户反馈错误答案”“模型答案中存在相互矛盾内容”“模型使用‘可能’‘大概’‘一般来说’等模糊表述”等信号。这些信号是幻觉高发区的雷达等你发现时至少能及时止损。7. 写在最后的一些个人体会从我自己的测试体验来说GPT-6 Astra在代码、数学、Agent任务上的进步是实打实的一天攻破5道数学难题这个成绩放半年前绝对是新闻。但我也得诚实地说它在一个它“记忆模糊”的冷门领域里照样会礼貌地编一个看起来完全合理的答案而且编得比GPT-5.1更像真的。这让我重新想明白一件事幻觉不是一个“能修好的bug”而是大模型作为概率模型的一种固有属性。我们真正需要追求的不是让模型“永远正确”因为它做不到而是让它在不确定的时候学会说“我不知道”并且让产品架构在模型出错时兜得住。我现在评估任何新模型第一个指标已经不看跑分了而是看它在真实任务里能不能“看得住自己”。这比“跑得有多快”重要得多。最后再分享一个小技巧如果某个问题你问了三遍模型每一次都能给出完全一致的答案不要高兴太早先换一种问法再试一次。它可能不是“记住了”而是“非常自信地把同一个错误答案背了三遍”。这一点无论GPT-6 Astra以后更新到什么版本我都会继续用来当试金石。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →