Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs

📅 2026/8/27 12:58:40
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
文章主要内容和创新点主要内容本文聚焦于大型语言模型(LLMs)的多触发器投毒攻击(multi-trigger poisoning)问题,通过实验和分析探讨了三个核心问题:多个后门触发器能否在模型中共存而不相互干扰;触发器激活和泛化的机制是什么;能否通过选择性重训练模型组件来恢复被污染的模型。研究发现:多个不同的后门触发器可在单个模型中共存,且不会降低彼此的有效性(攻击成功率差异在±2%以内),模型在非触发输入上的表现也保持稳定。高嵌入相似度的触发器会强化彼此的潜在表示,提升攻击的有效性和鲁棒性——即使触发器被 token 替换(如“James Bond”替换为“Jim Bind”)或被长序列 token 分隔(如插入20个中性 token),仍能有效激活后门。通过权重差异分析发现,投毒主要影响模型的嵌入层和MLP层(尤其是早期MLP层),针对性重训练这些组件可在仅更新少量参数的情况下有效移除后门行为,恢复模型的干净性能。创新点提出了LLMs多触发器投毒的研究框架,首次证明多个触发器可在模型中共存且不相互干扰,拓展了对LLM后门漏洞的理解。揭示了嵌入相似度和 token 分离对触发器泛化的影响:高相似度触发器会形成“鲁棒触发区域”,增强攻击的灵活性和持久性(如支持长距离激活)。提出轻量级选择性重训练防御方法,通过靶向更新MLP层(尤其是早期层),在减少参数更新量的同时有效移除后门,为后门修复提供了实用方案。