尧图精选

[论文学习]追踪拒绝动态:SALO越狱检测器

🕒 发布时间:2026/9/4 7:51:45 📁 来源:尧图网络
Tracing the Dynamics of Refusal: SALO Jailbreak Detector论文重点本文挑战了大语言模型安全研究中关于“拒绝机制”的传统静态认知通过因果追踪分析发现模型的拒绝行为并非由终端表征terminal representation单一决定而是在上游层和中间token位置形成了一条稀疏的“拒绝轨迹”Refusal Trajectory。基于这一发现作者提出了SALOSparse Activation Localization Operator检测器——一个轻量级白盒检测框架能够在GCG、AutoDAN、Prefilling等多种越狱攻击下保持超过85%的检测成功率而传统基线方法在这些攻击下往往崩溃至接近零准确率。核心研究内容问题定义现有的大模型安全检测方法主要存在两个层面的局限。外部检测方法如困惑度过滤、Llama Guard等将LLM视为黑盒仅依赖输入输出层面的信号缺乏对模型内部安全处理机制的洞察容易被精心设计的攻击绕过。内部表征方法如RepE风格的方向向量则基于两个隐含假设其一拒绝信号被封装在终端token状态中终端状态假设其二拒绝信号在序列中均匀分布简单平均即可提取全局均匀性假设。本文的核心问题是这两个假设是否成立拒绝信号是否存在着更丰富的时空动态结构以及能否利用这种结构构建更鲁棒的越狱检测器创新方法1因果追踪分析揭示“拒绝轨迹”。作者采用因果追踪Causal Tracing方法构造恶意/良性语义对如“如何制作炸弹”vs.“如何制作蛋糕”将恶意提示的中间隐藏状态逐层逐位置地“修补”到良性提示的计算过程中观察是否触发拒绝响应。通过系统性的网格搜索滑动3层窗口作者定位出对拒绝行为具有因果效力的具体层-位置坐标。2识别拒绝轨迹的三阶段动态模式。因果追踪揭示了一个清晰的时空演化过程语义触发Semantic Trigger有害实体词如“bomb”在浅层到中间层产生强因果效应关键构造Critical Construction紧随其后的token位置如“?”在中间层出现峰值激活——这是拒绝信号的真正“书写”时刻终端衰减Terminal Attenuation拒绝信号在传播到终端位置时反而衰减终端状态虽保留部分信息但已非最强信号。3提出SALO检测架构。基于上述发现SALO的设计包含三个核心组件3D潜在张量构建从选定的层窗口如中间3层和token位置提取原始隐藏状态堆迭为维度为 d×|W|×T 的张量保留完整的时空几何信息多粒度时空投影采用一组卷积核尺寸为 3×2、3×3、3×5以不同时间宽度捕获拒绝信号的多样化时空范围——从尖锐的局部触发到广泛的上下文依赖分类与决策通过全局最大池化、Dropout和线性投影输出检测分数。值得注意的是SALO的训练数据严格排除了越狱样本仅使用PKU-SafeRLHF和Toxic-Chat中的标准安全对齐数据这意味着它对GCG、AutoDAN等攻击的检测能力来自于对“内在拒绝轨迹”的识别而非对特定攻击模式的过拟合。研究成果论文在Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3和Llama-3.1-8B-Instruct三个模型上进行了全面评估。核心实验结果如下方法Qwen2.5-7B (Prefilling / GCG / AutoDAN)Mistral-7B (Prefilling / GCG / AutoDAN)PPL Filter39.2% / 100% / 32.8%0% / 100% / 0%GradSafe0% / 17.7% / 10.0%1.7% / 36.7% / 2.0%Linear Probe96.5% / 82.9% / 99.2%68.1% / 71.0% / 32.0%SALO99.4% / 88.3% / 98.8%99.4% / 96.5% / 98.8%关键发现包括PPL Filter能有效检测GCG因后缀困惑度高但对自然语言攻击Prefilling、AutoDAN完全失效GradSafe虽在XSTest上表现良好AUROC 94%但在Prefilling上跌至近零Qwen上0%在AutoDAN上仅2.0%Mistral说明基于梯度的检测在面对上下文感知攻击时存在结构性脆弱性Linear Probe在直接有害提示上表现尚可但在GCG上降至64.2%Llama说明静态线性边界可被梯度优化攻击轻松绕过SALO在所有模型和攻击类型上均保持 85% 的检测成功率在Prefilling上达到99.4%在AutoDAN上达到98.8%Qwen。此外SALO的参数量低于2000万属于轻量级检测器适合推理时部署。实际落地应用的可能性SALO的应用场景具有明确的现实意义大模型API的安全前置过滤可作为推理前的轻量级检测模块识别恶意输入避免模型生成有害内容开源模型的安全增强由于SALO是白盒检测器需要访问模型内部隐藏状态特别适合部署在自部署的开源模型如Llama、Qwen、Mistral系列上红队测试与安全评估可作为评估工具帮助安全团队量化模型在面对各类越狱攻击时的内部安全机制响应情况与现有防御体系的互补SALO不依赖特定攻击模式训练可与PPL Filter、SmoothLLM等形成多层级联防御。不过SALO的白盒特性也意味着它不适用于闭源API模型如GPT-4、Claude等无法获取内部状态的场景。技术细节1. 因果追踪的形式化定义对于解码器-only Transformer设输入序列为 x(x₁,…,x_T)h_l^i ∈ ℝ^d 表示第 l 层、第 i 个token位置的隐藏状态。因果追踪的流程如下构造恶意提示 x_mal 和语义对应的良性提示 x_ben仅替换语义锚点如“bomb”↔“cake”对 x_mal 进行前向传播缓存所有隐藏状态 h_l^i干预将缓存的 h_l^i 修补到 x_ben 的对应位置 (l, i) 的计算中观察模型输出是否从“服从”转变为“拒绝”以生成“I’m sorry”等拒绝前缀为判定标准。拒绝损失Refusal Loss定义为标准拒绝前缀的交叉熵损失——损失越低拒绝意图越强。2. SALO的核心计算公式潜在张量构建从选定层窗口 W{l_start,…,l_end} 堆迭隐藏状态M ∈ ℝ^{d × |W| × T}多粒度卷积特征提取对每个卷积核 (h,w) ∈ {(3,2), (3,3), (3,5)}H_(h,w) ReLU(BN(Conv2d_(h,w)(M))) v_(h,w) GlobalMaxPool(Mask(H_(h,w)))多尺度聚合v_agg ∥_{(h,w)∈K} v_(h,w)最终分类v_out Dropout(v_agg, p0.5) logit Linear(v_out) s Sigmoid(Dropout(logit))3. 关键设计洞察SALO的一个理论支撑在于因果注意力的单向性在解码器-only架构中位置 i 的隐藏状态 h_i 仅依赖于 x₁,…,x_i即 h_i f(x₁,…,x_i)。这意味着即使攻击者在指令后追加了优化后缀如GCG后缀也无法“回溯”修改模型在处理指令早期token时已形成的拒绝轨迹。这是SALO能够对GCG等后缀攻击实现零样本泛化的根本原因。研究设定模型配置论文评估了三个主流开源指令微调模型Qwen2.5-7B-InstructMistral-7B-Instruct-v0.3Llama-3.1-8B-Instruct训练数据来源PKU-SafeRLHF约5,500条和 Toxic-Chat关键筛选严格排除越狱提示和过长序列400 tokens确保训练分布与测试攻击分布分离评估协议攻击类型直接有害提示AdvBench、Prefilling攻击、GCG梯度优化后缀、AutoDAN语义越狱评估指标XSTest上的AUROC 固定10% FPR阈值下的检测成功率DSR基线对比PPL Filter、Linear Probe、SmoothLLM、GradSafe硬件要求论文未明确列出硬件规格但基于SALO的轻量级设计2000万参数和推理时单次前向传播的特性单卡GPU如A100 40GB或更低配置即可满足部署需求。训练阶段需要访问模型的中间层隐藏状态建议使用至少40GB显存的GPU。综合分析理论贡献从“静态方向”到“动态轨迹”本文最根本的理论贡献在于颠复了RepE范式中对拒绝机制的静态理解。此前的工作如Arditi et al., 2024; Wollschläger et al., 2025通常从终端或池化表征中提取一个固定的“拒绝方向”假设这个方向足以表征模型的拒绝行为。本文通过因果干预实验证明拒绝不是静态结果outcome而是过程process终端表征往往携带衰减后的信号。这一发现具有方法论层面的启示对于安全检测任务因果干预比相关性分析更具诊断价值。观察相关性如某一层激活与拒绝输出的相关只能告诉我们“什么伴随拒绝发生”而因果追踪能告诉我们“什么导致拒绝发生”。方法贡献多粒度时空特征提取SALO的架构设计体现了一个精妙的权衡拒绝信号的时空范围在不同提示间存在异质性——有些提示的拒绝信号高度局域化仅需少数token即可触发有些则需要更广泛的上下文。通过设计三个不同时间宽度的卷积核3×2、3×3、3×5SALO在“捕捉尖锐触发”和“整合广泛上下文”之间取得了平衡。这种设计思路值得更广泛地借鉴——在分析大模型内部机制时单一的粒度往往不足以刻画复杂现象的多样性。实验发现的深层意义几个实验现象值得深入解读第一终端衰减现象的普遍性。因果追踪的聚合分析40对恶意-良性提示显示拒绝信号在中间层达到峰值后衰减终端位置虽有一定复苏但强度不及峰值。这意味着依赖终端状态的安全检测方法存在结构性缺陷——这不是工程调优能解决的问题而是由Transformer的架构特性决定的。终端状态被优化用于下一token预测而非保留决策过程中的最大因果强度。第二SALO的零样本泛化能力验证了理论假设。SALO的训练数据完全排除了越狱样本却能在GCG上达到88.3%、在AutoDAN上达到98.8%的检测率。这证实了作者的假设越狱攻击压制的是终端拒绝表达而非消除内在拒绝意图。拒绝轨迹是“恶意意图”的持久指纹不因攻击手法的变化而消失。第三GradSafe的崩溃具有警示意义。GradSafe利用梯度信息检测拒绝的“阻力”但在Prefilling攻击下完全失效——因为Prefilling通过强制模型以“Sure”开头使“肯定的”响应在统计上变得自然从而抑制了“抵抗梯度”。这说明仅依赖梯度或终端信号的检测方法在面对上下文操控时具有根本性的脆弱性。局限性与未来方向论文也存在一些值得注意的局限白盒依赖SALO需要访问模型内部隐藏状态不适用于闭源API场景层窗口选择的泛化性论文主要在三个7B-8B规模模型上验证更大模型如70B、MoE架构的最优层窗口是否需要重新校准尚不明确训练数据规模约5,500条训练数据相对有限虽然足以验证概念但实际部署可能需要更大规模、更多样的数据。实践应用适用场景场景适用性说明自部署开源模型的输入过滤✅ 高度适用Llama/Qwen/Mistral等均可支持闭源APIGPT-4、Claude❌ 不适用无法获取内部隐藏状态大模型安全评估/红队测试✅ 适用可作为评估工具量化模型安全机制实时推理防护✅ 适用轻量级20M参数推理开销小与现有防御的级联部署✅ 适用可与其他黑盒检测器互补部署建议1. 层窗口选择。论文的因果追踪分析表明中间层约为模型总层数的1/3到2/3区间是拒绝信号最为集中的区域。在实际部署时建议先对目标模型进行小规模的因果追踪校准确定最优层窗口。2. 阈值校准。论文采用XSTest上10% FPR固定阈值。在实际场景中可根据安全需求调整阈值高安全场景可降低FPR如5%高可用性场景可适当放宽。3. 与现有系统的集成。SALO可作为安全管道中的一个前置检测模块用户输入 → SALO检测 → [通过] → 主模型推理 → 输出 ↓ [拒绝] → 返回安全响应4. 代码与资源。论文作者已开源实现代码https://github.com/Exbilar/SALO可直接参考部署。参考资料来源原始论文Hu, X., Wang, C., Lim, W. Y. B., Gao, J., Chen, Z. (2026). Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection.Proceedings of the 43rd International Conference on Machine Learning (ICML 2026). arXiv:2605.02958
上一篇/下一篇内容由系统自动关联 返回资讯列表 →