尧图精选

三大巨头接连翻车,大模型的安全防线怎么总绷不住?

🕒 发布时间:2026/9/25 19:30:14 📁 来源:尧图网络
安全负责人走了一批又一批AI对齐到底难在哪先是Anthropic再是OpenAI现在连谷歌的Gemini也出现安全问题了大模型又双叒叕一次突破防火墙了。不过这些事故看多了反倒会让人意识到一件更根本的事整个行业都在拼命地堆算力、喂数据甚至开始押注让模型自己改进自己的“递归自我改进”RSI。可真正决定这些模型能走多远的或许并不是性能而是安全对齐。当“能不能更强”被默认只是时间问题“能不能被信任”就成了那道绕不过去的坎。麻烦的是这道坎在不少公司眼里反倒成了拖慢发布的最大阻碍。为了实现安全对齐各大AI公司都做了很多尝试光是2026年团队就进行了大换血。但结果就是毫无进展。那么这个安全对齐到底是什么到底为何又让巨头们如此“痛不欲生”呢01安全对齐团队人事动荡Gemini的事其实并不孤单。过去这几个月OpenAI、Anthropic、Meta都先后曝出过模型在评测中“越界”的问题。要么逃出沙箱要么连上公网、碰到了真实系统。这类事如今已算不上新话题毕竟情节本身大同小异多半是环境隔离出了纰漏未必是模型“主动越狱”。或许正是因为安全问题如此频发几家公司的安全团队正在经历一轮罕见的大换血。2026年7月安全系统团队负责人约翰内斯·海德克Johannes Heidecke离职。这已是两年内第六位离开OpenAI的高级安全负责人。此前包括扬·莱克Jan Leike曾联合领导超级对齐团队。2024年出走Anthropic迈尔斯·布伦戴奇Miles Brundage 与 史蒂文·阿德勒Steven Adler原政策Policy团队先后离开去做 AI 安全方向的非营利机构安德烈亚·瓦洛内Andrea Vallone在OpenAI待了三年、创办“模型政策”Model Policy研究团队、参与GPT-4与GPT-5最后同样也去了Anthropic对齐团队。所谓超级对齐团队指的是OpenAI在2023年7月成立的专项团队为“比人更聪明的AI”超级智能研究对齐方案。然而OpenAI在这事上“反复横跳”。超级对齐团队于2024年5月解散莱克称OpenAI这些年来都不重视安全和对齐将算力和资源全都给了产品团队。与约翰内斯同期离职的还有约书亚·阿基阿姆Joshua Achiam他在OpenAI做了九年安全研究。他领导的“使命对齐”Mission Alignment小组本是超级对齐团队解散后的接棒者2024年9月成立结果2026年2月又被解散六名成员被打散进研究与产品团队。在此之后首席研究官马克·陈Mark Chen宣布安全团队今后统一向原对齐负责人米娅·格蕾丝Mia Glaese汇报后者升任“研究与安全”副总裁。马克表示这么做是为了让安全“更早、更直接地介入关键模型、产品与发布决策”。换句话说OpenAI把安全并进了前沿模型开发这条线。同时马克也表示安全面临的要求持续上升整个安全对齐团队的压力非常大。“我们训练模型的速度快得多发布周期也大幅缩短。结果是今天围绕安全的协调问题比以往任何时候都更大。”马克写到。Anthropic也在面对相似的情况。莱克加入Anthropic后牵头组建并领导“对齐科学”Alignment Science团队方向正是他在OpenAI组建超级对齐团队所做的那些事比如可扩展监督、弱到强泛化、越狱鲁棒性以及自动化对齐研究。2026年1月前文提到的安德烈亚也加入了Anthropic的对齐科学团队直接向莱克汇报负责“对齐与微调、塑造Claude在新情境下的行为”。2026年5月OpenAI联合创始人、前特斯拉Autopilot负责人卡帕西加入Anthropic预训练团队组建“用Claude加速预训练研究”的小组。6月谷歌DeepMind做机制可解释性、代表作《真实场景中的可解释性》Interpretability in the Wild的亚瑟·康米Arthur Conmy也宣布加入说要“在模型训练的过程中就把它们对齐”。不止是OpenAI和Anthropic其实谷歌这边也在安全对齐上做文章。谷歌成立了AGI安全与对齐团队ASAT负责人是罗欣·沙阿Rohin Shah。他是UC伯克利CHAI人类兼容人工智能中心的博士早年靠一份《对齐通讯》Alignment Newsletter在圈内出名。团队的定位是不做面向当下产品的“打补丁”专攻更先进 AI 带来的更严重危害目标是降低AI的存在性风险。ASAT隶属于DeepMind的“AI安全与对齐”部门这个部门还包含专管当前Gemini模型安全训练的Gemini Safety等团队。7月ASAT公开招募多岗位目标是降低AI的存在性风险。但有意思的地方是ASAT让应聘者另填一张“特殊表格”以绕过谷歌自家的AI简历筛选。理由是罗欣不信任自家的AI筛选器。02这个行业在解决什么既然所有头部AI厂都在调整自己的安全对齐团队那到底什么才是安全与对齐呢对齐Alignment是让AI的目标和人类真正想要的东西保持一致。10年前有个笑话“小明下午大扫除你去不去”“我去我不去”很显然小明并不想参加扫除。对齐就是让AI如何理解“小明其实不想去”这件事。它不能只“听得懂指令”还应该符合人类的预期比如不能撒谎不能表面上按规矩背地里使坏。安全Safety指的是如何让AI别造成伤害。既包括模型自己失控也就是对齐失败也包括被人恶意滥用以及大规模铺开之后带来的系统性风险。对齐是安全的底座但安全不止于对齐。一个模型可以“对齐良好”却仍不安全比如它可以被人拿去作恶也可以“能力很强”却因对齐失败而闯祸。所以行业里才常常把两者连起来叫“安全对齐”。这个行业最重要解决的问题只有一个模型的能力可以靠数据和算力堆出来但是当AI有一天比人更聪明人类凭什么相信它OpenAI组建超级对齐团队时就说到“目前没有任何方案去控制可能失控的超级智能”。不过很可惜目前安全对齐不像模型性能一样有个许多基准测试集看一眼跑分就知道模型强弱了。今天的安全与对齐主要围绕四根支柱展开。第一根RLHF人类反馈强化学习。它是现在大模型的地基真人标注员判断“两个回答里哪个更好”用这些偏好数据训练出一个奖励模型再用强化学习去优化大模型让它越来越贴近奖励模型的口味即近端策略优化PPO。但是PPO很容易导致奖励黑客reward hacking模型发现了一个能拿高分、却没真正完成任务的取巧办法。于是后来RLHF更多的是采用直接偏好优化DPO。可这又产生了两个问题。一个是“虚假讨好”模型会学会迎合人而不是讲真话。另一个是“对齐税”为了让模型输出更安全更符合人类预期的答案就必须使用更合规的训练素材模型性能被迫降低。强化对齐奖励会让某些问答基准掉十几分而对推理模型做安全对齐平均推理准确率也可能下滑约30%。安全不是免费的午餐它是拿一部分性能换来的。第二根可解释性。就好像核磁共振查看大脑内部活动一样可解释性就是通过各种办法观测模型内部到底如何思考。Anthropic用的是“字典学习”的办法从Claude里提取出数百万个可解释特征比如金门大桥、性别偏见、保密话题各自对应一组可被点名的神经活动并且证明操纵这些特征能因果地改变模型行为。这样一来未来的模型进行思考时只需要观察它激活了哪些参数再对照着这本字典就知道模型是如何思考的了。然而问题就在于这种查字典的方法太累了每一句话都要在查找上消耗大量算力一旦上下文稍微长一点算力成本水涨船高。第三根红队测试。RLHF和可解释性主要是从模型内部找问题红队测试则是从外部找。它的实现方法很好理解雇佣一些专业人士拼命从外部攻击模型看哪儿能打穿。2023年7月Anthropic官方披露在6个月内投入超过150小时邀请顶级生物安全专家绕过常规安全监控通过专用安全接口与模型对话、越狱、评估其输出有害生物信息的能力。第四根可扩展监督与超级对齐。前面三个方面都存在一个共同的前提那就是人类比AI聪明。可这并不能解决OpenAI提出的那个问题即如果模型比监督它的人还聪明人类就没有办法监督它。既然如此学生比老师聪明了老师应该怎么给学生打分呢于是就有了可扩展监督和超级对齐。Anthropic和OpenAI共同的判断是“让AI监督自己并且辅助人类监督。”OpenAI的一个答案是“弱到强泛化”。用GPT-2级别的弱模型去监督GPT-4再配一个“增强自信”的辅助损失效果能恢复到接近GPT-3.5的水平。但OpenAI同时也表示靠人类打分的RLHF“可能无法训练出超级模型”。2023年7月OpenAI前首席科学家伊利亚和莱克牵头启动了超级对齐计划。承诺投入20%算力计划4年内取得突破。其终极目标是造出一个人类水平的自动对齐研究器然后用海量算力让它迭代对齐超级智能。之后的故事前面也讲过了伊利亚和莱克均离开了OpenAI超级对齐团队也解散。03行业的争议又有哪些但是问题来了为什么安全团队的人一批批走安全对齐的问题却还是频繁出现甚至变本加厉答案不在技术在结构。安全是成本产品是利润。这个商业逻辑不改变安全团队永远是“被咨询的”不是“拍板的”。产品直接带来收入和增长安全却只会花钱、拖慢进度。于是在“先到者通吃”的赛道上理性的公司几乎总把资源优先喂给产品。更关键的是这种“安全让位于产品”的逻辑并不是说AI公司不够道德相反已经有研究证实这是一种能被建模的结构性规律。芝加哥大学Becker Friedman研究所在2026年发表了一篇标题为《AGI竞赛与存在性风险》的论文其中提到这样一件事。把一家公司的资源拆成“速度”与“安全”两块。往速度上多投一分抢先抵达AGI的概率就高一分但留给安全的就少一分往安全上多投一分灾难概率被压低可抵达的时点又要往后推。论文的结论是竞赛的激烈程度本身就在制造风险。当行业的总资源固定时参与者越多、越分散这块蛋糕就越会被挤向“速度”全行业跑得更快、灾难概率也更高。论文还给出了一个“临界市场规模”。一旦越过即便达成AGI的期望值是负的理性的公司仍会拼命去抢因为先到者通吃。所以他们的落点不是“技术不够好”而是AGI 风险不只取决于技术还取决于市场结构、资源约束以及决定“速度与安全如何分配”的制度。也就是说如果想让安全对齐和产品获得相似的地位那就必须得更改整个行业的规则。发布周期压缩后安全审查时间也被压缩。 马克自己都说了“训练速度快得多发布周期大幅缩短协调问题比以往更大”。模型的参数水涨船高因此安全对齐团队的工作量在翻倍可是模型发布的周期越来越快留给安全对齐团队的时间又在缩减。然而不只是工作量增加的问题“安全审查通过”这件事本身也未必算数。2024年的论文《安全清洗》中研究团队就发现许多安全基准的分数其实主要由模型的通用能力决定于是“能力变强”很容易被包装成“安全进步”。当审查既没时间、又没算力、连标尺都可能掺水模型必然会出事。原文链接三大巨头接连翻车大模型的安全防线怎么总绷不住-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
上一篇/下一篇内容由系统自动关联 返回资讯列表 →