后门攻击 和 对抗攻击

📅 2026/8/2 3:52:39
后门攻击 和 对抗攻击
如果模型本身是干净且正常的但测试数据被恶意篡改或插入了特定图案/干扰这不属于后门攻击而是典型的对抗样本攻击Adversarial Attack更通俗的称呼是对抗攻击或测试期攻击/Inference-time Attack为什么它不是后门攻击后门攻击的核心特征是“预先植入暗号”——模型在训练阶段就被注入了特定的关联规则。而在这个场景中模型完全干净、正常没有被预先植入任何“后门”。攻击发生的时间发生在测试/推理阶段Inference Time而不是训练阶段。这种攻击是怎么运作的对抗攻击利用的是深度学习模型自身的盲点和不稳定性寻找脆弱点攻击者利用算法找出模型决策边界Decision Boundary附近最敏感的区域。精心设计扰动攻击者在正常的测试数据上添加非常微小的、人类难以察觉的噪声称为对抗扰动 Adversarial Perturbation。误导模型对于人类来说这张图片看起来依然是一只普通的猫但对于模型来说这些微小的噪声会彻底改变其特征提取结果直接将图片误判为“路障”或“大象”。经典案例在停止交通标志牌Stop Sign上贴几张看似无害的贴纸导致自动驾驶系统将其识别为“限速 45”。核心对比后门攻击 vs 对抗攻击维度后门攻击Backdoor Attack对抗攻击Adversarial Attack受污染的对象训练数据 / 模型本身测试数据 / 输入数据模型状态内部权重已被“毒化”模型本身完全干净触发机制输入包含预设的特定暗号Trigger输入包含精心算的对抗噪音Perturbation攻击发生阶段训练阶段Training Time推理/测试阶段Inference Time攻击效果只有带触发器的特定输入才会出错精心构造的对抗样本会让模型出错 一句话总结如果你在训练时给模型下了毒以后用特殊暗号就能控制它这是后门攻击。如果模型完全正常但你在测试时利用模型的漏洞去“戏弄/误导”它这叫对抗攻击。