[论文学习]SafeSeek:语言模型中安全回路的通用归因
SafeSeek: Universal Attribution of Safety Circuits in Language ModelsICML 2026论文重点SafeSeek 提出了一种统一的、基于优化的安全可解释性框架将语言模型中的安全电路发现问题重构为可微分二元掩码的梯度下降优化问题从而克服了传统启发式方法在泛化性和可靠性上的局限。该方法在后门攻击和安全对齐两个关键场景中均验证了有效性——仅需移除 0.42% 的稀疏电路即可将后门攻击成功率从 100% 降至 0.4%同时保留超过 99% 的通用能力。核心研究内容问题定义机械可解释性研究表明大型语言模型中的安全关键行为如对齐、越狱、后门根植于专门的功能性组件之中。然而现有的安全归因方法严重依赖启发式的、特定于领域的度量标准和搜索算法导致泛化能力差、可靠性不足。更关键的是这些方法往往只能孤立地识别个别注意力头或神经元而无法阐明负责安全行为的完整功能回路。因此如何实现通用的、可靠的安全电路定位与操控是该领域亟待解决的核心问题。创新方法SafeSeek 的核心创新体现在以下三个层面1基于优化的电路发现范式。与传统依赖因果归因或启发式搜索的方法不同SafeSeek 将电路发现重构为一个基于梯度的优化问题。通过对每个电路单元引入可学习的潜在变量并借助 Straight-Through EstimatorSTE实现严格的二元掩码使离散的子图提取过程保持端到端的可微性。2多粒度电路单元设计。SafeSeek 支持从单个权重weight、广义神经元neuron、注意力头attention head到完整层layer的四种粒度级别。这种灵活的多粒度视角使其能够根据不同架构和任务需求进行定制化归因。3安全电路微调SaCirT。在完成电路归因后SafeSeek 进一步提出了一种高效的微调策略——仅更新已识别安全电路中的参数而非全参数微调从而在显著提升安全性的同时保持计算效率。研究成果SafeSeek 在 LLaMA-3.1-8B-Instruct 和 Qwen-3-8B 两个模型上进行了广泛验证主要成果如下场景关键指标结果后门攻击拒绝型后门电路稀疏度0.42%移除后 ASR中毒输入100% →0.4%通用能力保留率99%安全对齐注意力头占比3.03%神经元占比0.79%移除后 ASR越狱攻击0.8% →96.9%通用能力保留率92.1%SaCirT 微调帮助性微调中的安全保留率96.5%实际落地应用的可能性SafeSeek 的应用价值主要体现在三个方向1后门防御——通过定位并移除极稀疏的后门电路可彻底消除植入的后门威胁且对模型正常能力影响极小2安全护栏保护——在追求模型“有帮助性”的微调过程中通过冻结安全电路可有效防止对齐能力的退化3模型安全审计——为第三方审计机构提供了一种可解释、可验证的工具用于评估模型的安全机制是否存在脆弱点。技术细节问题形式化将语言模型视为一个有向计算图 (\mathcal{G}(\mathcal{V},\mathcal{E}))其中节点为功能组件如注意力头、MLP 层边为计算依赖关系。电路 (\mathcal{C}\subseteq\mathcal{G}) 定义为控制模型在特定任务上行为的主要子图其发现目标可形式化为[\frac{|\mathcal{C}|}{|\mathcal{G}|}\leq\tau,\quad\min_{\mathcal{C}\subseteq\mathcal{G}}\mathbb{E}{x\sim\mathcal{D}}\left[D{\text{KL}}\big{(}p(y|x;\mathcal{G}),|,p(y|x;\mathcal{C})\big{)}\right]]其中 (D_{\text{KL}}) 衡量行为差异(\tau) 为稀疏度阈值。二元掩码优化对每个单元 (u\in\mathcal{D}_u)引入潜在变量 (z_u\in\mathbb{R}) 并导出掩码变量[m_u\text{sigmoid}(z_u),\quad u_m(\mathbf{x})u(\mathbf{x})\oplus m_u]掩码通过元素级乘法 (\oplus) 集成到单元计算中。优化目标为[\min_{\mathcal{Z}}\mathbb{E}{x\sim\mathcal{D}}\left[D{\text{KL}}\big{(}p(y|x;\mathcal{G}),|,p(y|x;\mathcal{G}\oplus\mathcal{Z})\big{)}\right]\lambda\sum_{u\in\mathcal{D}_u}|m_u|_1]其中第一项为忠实度损失确保电路保留完整模型的预测分布第二项为 (L_1) 正则化鼓励稀疏性。Straight-Through EstimatorSTE为实现严格的二元掩码同时保持可微性采用 STE 技术[m_u\text{sigmoid}(z_u),\quad \hat{m}_u\mathbb{I}(m_u\eta)][m^{\text{ste}}_um_u\text{sg}(\hat{m}_u-m_u)]前向传播使用离散值 (\hat{m}_u)梯度反向传播时则直接流向连续潜在变量 (m_u)。双掩码优化DMO在后门场景中SafeSeek 引入双掩码优化同时优化干净子图 (\mathcal{G}{\text{clean}}) 和后门电路 (\mathcal{C}{\text{bkd}})[\min_{\mathcal{Z}}\left(\mathcal{L}{\text{cs}}\mathcal{L}{\text{bc}}\lambda\mathcal{L}_{\text{sparsity}}\right)]其中 (\mathcal{L}{\text{cs}}) 确保干净子图保留正常行为并中和后门(\mathcal{L}{\text{bc}}) 隔离恶意功能(\mathcal{L}_{\text{sparsity}}) 约束分解的稀疏性。研究设定硬件配置论文未明确披露具体硬件但考虑到涉及 8B 参数级别模型的掩码训练100 轮次推测需使用多卡 GPU 集群如 4×A100 或 8×A100。模型选择LLaMA-3.1-8B-Instruct 和 Qwen-3-8B。后门注入在 1,000 条样本上以 10% 投毒率进行指令微调训练 8 轮学习率 (10^{-4})批次大小 8采用 LoRA秩 (r16)。掩码训练从域内数据集中采样 100 条样本训练 100 轮学习率 (10^{-2})对稀疏度损失施加高惩罚权重。电路微调SaCirT在安全数据集上微调 16 轮学习率 (10^{-4})。评估基准通用能力GSM8k数学推理、MMLU常识问答、HellaSwag情境理解后门评估ROUGE 分数和攻击成功率ASR对齐评估Llama-Guard-3-8B 评估的越狱 ASR粒度选择后门攻击场景采用统一的神经元级粒度安全对齐场景对 MHA 模块采用注意力头粒度对 MLP 保留神经元粒度。综合分析范式突破从启发式搜索到优化驱动。SafeSeek 最根本的贡献在于将电路发现从一个依赖人工设计的启发式规则和昂贵搜索的问题转化为一个可微分的优化问题。这一转变不仅大幅提升了方法的泛化能力更使得电路发现可以与下游任务如安全微调形成端到端的协同。稀疏性的深刻启示。实验揭示了一个极具理论意义的现象安全行为无论是后门激活还是安全对齐依赖于高度稀疏的电路1%且这些电路在结构上与通用能力组件正交。这意味着安全机制并非散布于模型各处而是集中在少数关键组件中——这一发现对安全增强和后门防御都具有直接的指导意义。多粒度灵活性的实用价值。不同安全场景对解释精度的需求不同后门攻击可能需要更细粒度的神经元级定位以精确切除恶意功能而安全对齐分析则可能受益于注意力头级的粗粒度以获取更可解释的语义理解。SafeSeek 的多粒度设计使其能够适配不同场景的需求。局限性思考。尽管 SafeSeek 在 8B 模型上取得了优异效果但将其扩展到更大规模模型如 70B、405B时掩码训练的计算成本可能成为瓶颈。此外当前验证主要集中在两类安全场景其在更广泛的安全威胁如 prompt injection、数据泄露等中的适用性仍有待探索。实践应用1. 后门防御部署对于已部署的 LLM 服务若怀疑模型被植入后门可使用 SafeSeek 的 DMO 机制定位后门电路然后通过电路移除或 SaCirT 微调进行修复。实验表明仅需 100 条样本即可完成掩码训练数据需求极低适合实际部署场景。2. 安全微调流程优化在 RLHF 或指令微调过程中可将 SafeSeek 作为前置步骤先定位安全对齐电路然后在后续的帮助性微调中冻结这些电路从而在提升模型有用性的同时避免“对齐税”alignment tax。3. 模型安全审计第三方审计机构可利用 SafeSeek 对闭源或开源模型进行安全机制的可解释性分析通过定位安全电路并实施消融实验量化评估模型的安全防护能力是否充足。4. 安全研究工具链集成研究人员可将 SafeSeek 作为安全可解释性分析的标准工具用于探索新型攻击的机制、评估防御策略的有效性或比较不同模型架构在安全机制上的差异。参考资料原始论文SafeSeek: Universal Attribution of Safety Circuits in Language ModelsICML 2026代码仓库https://github.com/Ymm-cll/SafeSeek
上一篇/下一篇内容由系统自动关联
返回资讯列表 →