[论文分析]MRMMIA:面向聊天代理内存的成员推理攻击
MRMMIA面向聊天代理内存的成员推理攻击论文重点本文由弗吉尼亚大学研究团队提出了一种名为Multi-Recall Memory MIAMRMMIA的成员推理攻击方法首次系统性地研究了聊天代理Chat Agent长期记忆模块的隐私泄露风险。论文通过多轮召回探针recall probes的设计在黑盒、灰盒和白盒三种访问场景下均实现了对记忆单元成员身份的高精度推断揭示了当前聊天代理系统中被忽视的隐私安全隐患。核心研究内容问题定义: 聊天代理在交互过程中会动态地将用户对话片段、偏好信息、个人事实等写入长期记忆模块。这些记忆单元通常是高度压缩的陈述句长度短且信息稀疏与传统LLM训练样本或RAG检索文档相比提供的损失和token概率信号非常微弱。此外记忆单元之间存在关联性即使目标样本未被存储代理也可能从相关记忆中推断出部分内容同时记忆内容常与模型的先验知识重迭代理的回应可能来自参数化记忆而非目标记忆。本文要解决的核心问题是攻击者能否通过与被攻击聊天代理的交互判断一个给定的候选记忆单元是否存在于该代理的记忆存储中。创新方法: 作者提出MRMMIAMulti-Recall Memory MIA其核心思想是利用多个精心设计的召回探针向代理发起查询通过分析代理的回应来提取成员资格信号。方法分为两个步骤1召回查询生成使用辅助LLM生成复盖候选陈述不同方面如时间、地点、物品等的多个召回查询2探针与评分根据不同访问场景黑盒/灰盒/白盒设计差异化的评分模块。黑盒场景下使用辅助LLM对代理回应与候选陈述的匹配程度进行打分灰盒场景额外引入回应token的平均对数概率作为信号白盒场景则可进一步访问代理检索到的记忆单元进行相似度比对。研究成果: 实验在三种记忆数据集PerLTQA、LoCoMo、MSC和两种记忆后端Mem0、MemGPT上展开以Qwen/Qwen2.5-7B-Instruct为目标模型。结果显示MRMMIA在所有设置下均一致优于基线方法。在灰盒设置下MRMMIA在LoCoMo数据集上将TPRFPR1%从基线的13.5%提升至55.9%Mem0在白盒设置下MRMMIA在MSC数据集上达到99.0%的TPRFPR1%。消融实验表明增加召回探针数量可提升攻击性能并在K5左右趋于饱和。实际落地应用的可能性: 本文的攻击方法具有较高的实际落地可能性。攻击仅需通过标准用户界面与代理进行交互黑盒场景无需修改系统、访问系统提示词或读取其他用户记忆。这意味着任何普通用户都可能对部署的聊天代理发起此类攻击。对于企业部署聊天代理的场景这是一个真实且紧迫的安全威胁。代码已在GitHub开源https://github.com/DPLab-UVA/cea-mia进一步降低了攻击复现的门槛。技术细节攻击形式化定义论文将聊天代理记忆成员推理攻击形式化定义如下给定目标聊天代理F及其记忆存储M{m₁,…,m_N}其中每个m_i是代理写入或维护的记忆单元。对于候选陈述x和成员规则R攻击者A在访问设置c下与代理交互并输出预测A^{c,R}(x; F) → {0,1}其中1表示预测x是M的成员0表示非成员。成员规则采用精确成员规则Exact Membership RuleR_exact(x, M) I[∃ m_i ∈ M 使得 x m_i]召回查询生成攻击者使用辅助LLM G_q生成K个召回查询{q₁, …, q_K}。查询设计遵循三个准则原子主题每个查询聚焦于候选陈述的一个具体主题保留其他必要细节作为上下文后续理据问题不仅询问候选陈述本身还追问“你怎么知道的”或“你从哪获得这个信息”以提取更多信号多样性查询复盖候选陈述的不同方面时间、地点、物品等减少其他记忆单元的干扰评分函数黑盒评分s_b (1/K) · Σᵢ w_r · M_r(x, q_i, r_i)其中M_r是辅助评分模型输出回应r_i与候选陈述x的匹配程度。灰盒评分s_g (1/K) · Σᵢ [w_r · M_r(x, q_i, r_i) w_p · log P̄(r_i | q_i)]引入回应token的平均对数概率作为额外信号。白盒评分s_w (1/K) · Σᵢ [w_r · M_r(x, q_i, r_i) w_p · log P̄(r_i | q_i) w_m · max_ℓ M_m(x, m_{i,ℓ})]进一步引入检索记忆单元的相似度信号其中m_{i,ℓ}是代理为查询q_i检索的第ℓ个记忆单元。最终通过阈值γ判断s ≥ γ则预测为成员否则为非成员。研究设定硬件与软件配置目标代理后端Mem0和MemGPT两种本地记忆增强聊天代理目标模型Qwen/Qwen2.5-7B-Instruct通过vLLM的OpenAI兼容Chat Completions端点提供服务辅助模型同样使用Qwen/Qwen2.5-7B-Instruct作为查询生成器G_q和回应评分器M_r默认参数召回探针数量K5权重{w_r, w_p, w_m}{1.0, 1.0, 1.0}数据集PerLTQA个人长期问答基准复盖语义记忆和情景记忆LoCoMo包含超长多轮对话基于人物角色和时间事件图测试长程对话记忆和时间推理MSC人-人多轮开放域对话数据集说话者在重复对话中相互了解成员/非成员分割在用户级别构建确保成员和非成员之间的语义相似性。评估指标采用ROC-AUC、PR-AUC和TPRFPR1%三个指标每个实验运行三次并报告均值和标准差。综合分析作者与团队背景本文作者均来自弗吉尼亚大学University of Virginia。通讯作者Tianhao Wang是弗吉尼亚大学计算机科学系助理教授2022年起任职主要研究方向为差分隐私、隐私保护机器学习和可部署的隐私保护系统。他于2021年获得普渡大学博士学位在隐私与安全领域有丰富的顶级会议论文发表记录。第一作者Kai Chen是Tianhao Wang指导的二年级博士生研究方向包括差分隐私及其在生成模型中的应用。该团队长期深耕隐私保护领域具备扎实的理论基础和工程实现能力。技术真实性与可行性分析理论层面论文对聊天代理记忆成员推理问题的形式化定义清晰严谨攻击方法的设计逻辑自洽。多召回探针的设计有效应对了记忆单元“短而稀疏”的特性——单个查询的信号可能太弱但多个查询的聚合信号足以区分成员与非成员。不同访问场景下评分函数的渐进式设计从纯文本到概率再到检索记忆也符合直觉。实验层面论文在三个不同的记忆数据集和两种记忆后端上进行了充分实验且与五种基线方法进行了对比。实验结果的一致性标准差极小多为0.00表明攻击效果稳定可靠。代码已开源实验结果可复现。局限性需要指出几点值得注意的问题威胁模型的强假设攻击者需要持有候选陈述的精确文本exact membership rule。在实际场景中攻击者可能只知道部分信息或语义等价的内容而非精确的原文。论文在附录中讨论了语义等价规则的情况但主实验基于精确匹配这在一定程度上简化了问题。辅助LLM的依赖攻击需要额外的辅助LLM来生成查询和评分回应。虽然论文使用7B开源模型即可胜任但这仍然增加了攻击的成本和复杂性。不过考虑到目前LLM API的普及程度这一假设在现实中是合理的。目标模型的规模限制实验仅使用了7B参数量的模型。更大规模的模型如70B是否同样脆弱以及模型规模与攻击成功率之间的关系论文未做探讨。防御措施的缺失论文揭示了隐私风险但未提出相应的防御方案。从学术角度看这属于“暴露问题”型研究但从实用角度看缺少“解决问题”的环节。理论性与落地性的平衡本文属于实验性安全研究兼具理论贡献和实际价值。理论贡献在于首次系统性地定义了聊天代理记忆成员推理问题并提出了解决方案实际价值在于攻击方法在黑盒场景下即可实施对真实部署的聊天代理构成实际威胁。论文不是纯粹的数学推导型理论工作而是有完整实现和实验验证的应用安全研究落地可能性较高。实践应用对聊天代理开发者的建议隐私风险评估在部署聊天代理前应使用类似MRMMIA的方法进行内部隐私审计评估记忆模块的成员信息泄露风险。访问控制加固限制对代理的查询频率和类型防止攻击者通过大量精心设计的探针提取成员信号。记忆模糊化考虑在记忆存储和检索过程中引入噪声或差分隐私机制降低单个记忆单元对模型输出的影响。响应校准对可能泄露记忆成员信息的查询进行检测和响应抑制例如当检测到多轮针对同一主题的详细探询时模糊化回应或拒绝回答。对隐私研究者的启示本文揭示了LLM代理系统中一个被忽视的隐私攻击面——长期记忆模块。未来的隐私研究应更多地关注代理系统的记忆组件而非仅关注训练数据或检索数据库。多召回探针的设计思路可以推广到其他类型的隐私攻击中尤其是在目标信息稀疏、单一查询信号微弱的情况下。本文的实验框架可作为代理记忆隐私评估的基准后续研究可在此基础上探索更有效的攻击方法和防御措施。参考资料来源原始论文: https://arxiv.org/html/2605.27825v1作者GitHub仓库: https://github.com/DPLab-UVA/cea-mia
上一篇/下一篇内容由系统自动关联
返回资讯列表 →