大家读完觉得有帮助记得关注和点赞摘要数据投毒攻击对计算机视觉中的联邦学习FL系统构成严重的安全威胁。尽管研究关注度不断增加现有防御技术仍面临两个关键挑战1准确区分良性模型更新与恶意模型更新2在模型聚合过程中有效减轻投毒模型更新的影响。为应对这些挑战我们提出了一种针对定向投毒攻击的新型防御框架——STAR-FL该框架结合了时空分析与鲁棒聚合。首先我们采用时空聚类来识别并从 FL 训练过程中移除潜在的恶意更新。其次我们在聚合过程中调整学习率以减轻任何逃避检测的恶意更新的影响。第三我们在多个基准数据集上进行了大量实验以评估 STAR-FL 中的时空分析和鲁棒聚合。实验结果表明它们的协同效应使 STAR-FL 能够有效保护 FL并在抵御定向投毒攻击方面持续优于现有最先进的防御方法显著降低了攻击成功率ASR。源代码可在 https://github.com/mlsysx/STAR-FL 获取。索引词 联邦学习定向投毒攻击后门防御时空分析鲁棒聚合。I. 引言联邦学习FL[1] 是一种分布式机器学习ML范式广泛用于隐私保护模型训练。FL 支持跨多个客户端的去中心化训练每个客户端拥有自己的本地数据集。在每个通信轮次中选择一部分客户端参与 FL 训练。被选中的客户端接收当前全局模型在其私有数据上进行本地训练并将模型更新返回给中央服务器进行聚合。尽管具有多项优势FL 仍然容易受到各种对抗性攻击 [2, 3, 4, 5, 6, 7, 8, 9]。这些攻击不仅损害客户端数据的隐私还通过干扰学习过程降低模型性能。在数据投毒攻击中恶意客户端修改其本地数据样本并向服务器发送投毒更新。在聚合过程中这些投毒更新与诚实客户端的良性更新混合在一起。在非定向投毒攻击 [3, 10] 中对手旨在通过发送投毒更新来降低全局模型性能。这些更新偏离正确的优化方向导致全局模型对输入样本分类错误。因此当服务器聚合诚实更新和投毒更新时模型准确率下降。相比之下定向投毒攻击 [2, 11, 12] 使模型对特定输入分类错误同时保持对良性数据的高准确率这使得此类攻击特别难以检测。为缓解 FL 中的这些对抗性威胁已有多种防御方法被提出。一类工作聚焦于聚合前防御旨在聚合前识别并排除恶意客户端更新。这些方法通常利用无监督学习技术通过分析空间特征如梯度相似性或距离度量来区分良性更新和恶意更新 [13, 14, 15]。一些方法基于时间行为检测恶意客户端并将其更新从聚合过程中排除 [16]。另一类工作采用鲁棒聚合技术 [17, 18, 19]通过在聚合过程中重新加权客户端贡献来减轻对抗性更新的影响。尽管这些防御措施可以提高鲁棒性但它们常常错误地丢弃良性更新导致有用信息丢失和模型性能下降。这些局限性突显了迫切需要一种能够同时进行可靠攻击检测和鲁棒聚合的整体防御框架。在本研究中我们提出了 STAR-FL一种将时空分析与鲁棒聚合相结合以保护 FL 系统抵御定向投毒攻击的防御框架。我们特别关注后门攻击其中恶意客户端将触发模式植入特定训练样本并更改其标签。我们的关键洞察是恶意客户端更新通常与良性更新表现出异常的空间关系并且与自身历史行为存在时间上的不一致性。基于这一观察STAR-FL 联合分析客户端更新的空间相似性及其跨训练轮次的时间一致性以识别可疑行为。被标记为恶意的更新在聚合之前被排除。为进一步减轻逃避时空检测的对抗性更新的影响STAR-FL 采用了一种鲁棒聚合策略该策略在每轮中自适应调整服务器学习率以重新加权客户端贡献。该机制在保留主任务有效学习的同时抑制了投毒更新的影响。通过将时空分析与鲁棒聚合相结合STAR-FL 为 FL 中的后门攻击提供了统一的防御方案。我们在三个基准数据集上评估了 STAR-FLFashion-MNISTFMNIST[20]、CIFAR-10 [21] 和 CIFAR-100 [21]涉及多种投毒攻击包括后门攻击、模型替换攻击、分布式后门攻击和自适应攻击。实验结果表明STAR-FL 显著降低了攻击成功率同时保持了较高的模型效用并优于现有最先进的防御方法。本文的主要贡献总结如下• 我们提出了 STAR-FL一种新型防御框架能够有效检测恶意客户端更新并缓解联邦学习中的后门攻击。• 我们设计了一种时空分析机制检查客户端更新之间的相似性及其跨轮次的时间一致性以识别投毒更新。我们进一步集成了一种鲁棒聚合策略在抑制恶意更新影响的同时保留良性客户端的贡献。• 我们在多个基准数据集和攻击场景下进行了大量实验证明 STAR-FL 显著降低了攻击成功率同时保持了较高的模型效用。II. 相关工作在定向投毒攻击中对手操纵本地训练数据以将隐藏行为植入全局模型。一种常见策略是将触发模式插入训练样本并将其与目标标签关联从而注入后门使模型对触发输入分类错误同时保持对干净数据的高准确率 [22, 15, 23]。通常攻击者将相同的触发模式注入目标输入 [24]。另一种攻击变体是分布式后门攻击DBA[4]它将触发模式分布到多个恶意客户端以逃避检测。标签翻转攻击 [5, 25] 将样本从源类别的标签修改为目标类别从而在不引入显式触发器的情况下投毒学习过程。已有多种防御机制被提出以减轻联邦学习中投毒更新的影响 [26, 27]。一类工作聚焦于更新过滤即在聚合前检测并排除恶意更新。若干研究基于距离度量如余弦距离对模型更新进行聚类以分离良性和恶意客户端 [14, 13]。降维技术如 PCA已被研究以提高聚类性能 [5]。在 [16] 中如果客户端的更新与其基于历史行为预测的更新不一致则该客户端被标记为恶意。然而这些防御方法往往倾向于错误分类并丢弃良性更新损害全局模型效用。鲁棒聚合技术 [17, 19] 也已被研究以减少 FL 训练中对抗性客户端的影响。鲁棒学习率RLR[18] 基于客户端更新的符号调整服务器学习率以抑制对抗性贡献。然而此类方法通常仅在恶意客户端数量非常小时有效残留的投毒更新仍可能降低全局模型性能。III. 问题陈述III-A 威胁模型攻击的目标是操纵模型使其正确分类良性样本但投毒样本被误分类为攻击者指定的目标类别从而实现高攻击成功率。攻击者旨在确保全局模型在主任务和后门任务上均实现高准确率。攻击者不直接操纵全局模型而是通过将触发模式插入特定样本并更改其标签来利用本地数据集。我们假设攻击者对 FL 系统具有部分了解即本地训练数据但对聚合器或中央服务器无任何了解。设模型 f 在 (x, y) 上训练其中 x 为输入样本y 为真实标签。训练后的模型对干净输入 x 预测输出 f(x)。当攻击者通过添加某种触发器 μ 投毒输入 x 时模型将投毒样本 xμ 误分类为特定目标标签 y使得 f(xμ) y。我们考虑后门攻击攻击者的目标是在存在触发器的情况下保持模型对良性数据的行为同时修改其对投毒数据的行为。攻击者优化以下目标其中损失函数 L1 和 L2 分别在干净数据集 D_H 和投毒数据集 D_P 上同时最小化。图 1FMNIST上和 CIFAR-10下数据集的投毒图像示例。在图像左上角插入加号模式作为触发器。(a)-(f) 分别展示不同类别的投毒示例。III-B 防御目标设 ℳ_t ⊆ _t 为第 t 轮的恶意客户端集合_H 和 _P 分别表示诚实数据分布和投毒数据分布。给定权重为 W 的全局模型 f_W 和损失函数 ℓ防御目标是通过最小化主任务损失同时最大化后门任务损失来优化方程2中定义的目标我们的目标是设计一种有效的防御方法使全局模型在主任务上表现良好能够准确分类良性样本。同时当攻击者存在时模型不会学习后门任务或将投毒样本误分类为目标标签。它应正确将良性和投毒样本均分类为其真实标签。算法 1 STAR-FL 框架1: 输入轮次数 T客户端数 N服务器学习率 η衰减参数 β符号阈值 δ每个客户端 i 的本地数据集 D_i。2: 输出最终全局模型 W_G。3: 初始化全局模型 W_0每个客户端 i 的历史更新 R_i^0 0。4: for 每一轮 t 1 到 T do5: for 每个客户端 i 1 到 N do6: 接收全局模型 W_{t-1}7: 执行本地训练并发送 ΔW_t^i8: end for9: // 时空分析10: {h_t} ← DetectMaliciousClients({ΔW_t^i}, {R_i^{t-1}}, β)11: // 鲁棒聚合12: for 每个维度 k ∈ {1, 2, 3, …, K} do13: 计算符号和M_t^k ∑{i∈h_t} sign(ΔW_t^{k,i})14: 调整学习率η_k^t { η, 若 |M_t^k| δ; -η, 否则 }15: end for16: 更新全局模型W_t W{t-1} ∑{i∈h_t} (|D_i| / ∑{j∈h_t}|D_j|) · (η_t ⊙ ΔW_t^i)17: end for18: return 最终模型 W_GIV. STAR-FL 概述我们提出的防御框架 STAR-FL 包含以下步骤。首先我们获取最后一层模型更新并降低其维度。然后我们将这些更新分为两个聚类。其次我们利用客户端的历史更新来预测其在特定轮次的更新。然后我们将预测更新与本地训练后从客户端接收的实际更新进行比较。被空间和时间分析均识别为恶意的更新将从该轮中移除。第三我们在聚合剩余模型更新时根据更新符号的和调整服务器学习率。算法 1 和算法 2 展示了 STAR-FL 的详细步骤。我们的工作完全在水平联邦学习HFL环境下进行其中每个客户端持有数据集的一个不同子集。我们的问题表述、威胁模型、攻击和防御均在 HFL 环境下实现。算法 2 DetectMaliciousClients检测恶意客户端1: 输入本地模型更新 {ΔW_t^i}历史更新 {R_i^{t-1}}衰减参数 β。2: 输出诚实客户端 {h_t}。3: // 空间分析4: for 每个客户端 i 1 到 N do5: 提取最后一层梯度 ∇W_t^i6: 应用 PCA 获得降维梯度 V_i^t7: end for8: 对 {V_i^t} 应用 K-Means 聚类得到聚类 C_1, C_29: 计算每个聚类的平均余弦相似度 S_{C_p}S_{C_p} avg (V_i · V_j) / (||V_i|| ||V_j||); ∀ i, j ∈ C_p, i ≠ j10: if S_{C_1} S_{C_2} then11: C_1 中的客户端可能为恶意12: else13: C_2 中的客户端可能为恶意14: end if15: // 时间分析16: for 每个客户端 i 1 到 N do17: 预测更新R_i^t β R_i^{t-1} (1-β) ΔW_t18: 计算相似度γ_i^t (R_i^t · ΔW_t^i) / (||R_i^t|| ||ΔW_t^i||)19: end for20: 对 {γ_i^t} 应用 KDE 以检测时间异常值21: {h_t} ← 在两个分析中均被检测为诚实的客户端22: return {h_t}IV-A 空间分析在这一步中我们首先分析当前轮次 t 中每个客户端 i ∈ {1, 2, 3, …, N} 训练的本地模型的最后一层更新 ∇W_t^i。诚实客户端 h ⊂ i 主要关注提高主任务准确率并在多样化数据集 D_i 上训练本地模型以提高全局模型性能。因此良性更新之间差异较大表现出较高的方差。相比之下投毒更新表现出较高的相似性因为恶意客户端 m ⊂ i \ h 具有共同的目标即提高后门任务准确率。因此从良性和恶意客户端接收的模型更新遵循不同的梯度分布。我们对最后一层更新 ∇W_t^i 应用主成分分析PCA以利用这种差异来检测投毒更新。PCA 突出数据变化的主方向有助于检测模型更新中的模式。我们观察到在通过 PCA 将维度降至二维后更新倾向于形成不同的聚类。如图 2 所示投毒更新表现出较高的均匀性而良性更新表现出较高的方差。我们关注最后一层更新因为最后一层提供了计算高效且紧凑的表示能够捕捉诚实客户端与恶意客户端之间本质的行为差异。此外在定向投毒攻击中对手主要操纵最终分类层以将触发器与目标标签关联同时保留早期层的良性行为以逃避检测 [28, 7]。接下来我们应用 K-Means 聚类将低维更新向量 {V_1, V_2, V_3, …, V_N} 分为两个聚类 C_1 和 C_2。由于较小的聚类不一定包含恶意更新 [29]我们进一步分析每个聚类以避免错误分类更新。我们计算每个聚类内模型更新之间的成对余弦相似度 S如下所示恶意客户端表现出相似的行为并产生相似的更新因此其聚类内的平均余弦相似度较高。我们计算每个聚类的平均相似度 S_{C_p}5并将具有较高相似值的聚类识别为恶意聚类。最后我们按照 [30] 中提出的方法进行离群值检测。我们计算每个客户端更新到其分配的聚类中心的欧氏距离。任何超出距离阈值的更新均被标记为离群值并移除。图 2所有通信轮次中良性绿色和恶意红色更新的 PCA 可视化m10%。(a) FMNIST 数据集(b) CIFAR-10 数据集。IV-B 时间分析我们采用固定频率攻击 [2]其中攻击者仅在某些通信轮次中投毒其本地数据集。通过降低发送投毒更新的频率攻击者变得更加隐蔽同时仍然能够影响全局模型 [12]。在我们的工作中攻击者每三轮在训练样本中插入一次触发器。为基于客户端历史更新的模式识别攻击者我们对每个客户端进行时间分析。我们根据客户端在前几轮的梯度计算每个客户端 i 在当前轮次 t 的预测梯度 R_i^t。具体地我们利用过去更新的指数移动平均来预测当前轮次的预期更新如下式所示其中 β 是平衡预测更新和实际更新贡献的衰减参数。该方法使我们能够捕捉恶意客户端的时间行为该行为在连续轮次中不一致。接下来我们将预测更新 R_i^t 与客户端 i 在当前轮次发送的实际更新 ΔW_t^i 进行比较。为衡量这两个更新向量之间的相似度 γ_i^t我们使用余弦相似度7。较低的相似度意味着客户端的当前行为与其过去行为不一致从而将其标记为潜在恶意客户端。然后我们对余弦相似度值 {γ_1, γ_2, γ_3, …, γ_N} 应用核密度估计KDE。该技术帮助我们基于余弦相似度值的密度识别恶意客户端。关键思想是良性客户端的行为随时间保持一致。因此它们在高相似度分数周围形成密集的聚类。相比之下恶意客户端形成独立且较小的聚类如图 3 所示。最后我们将客户端数量较少的聚类标记为恶意聚类因为恶意客户端的数量通常少于良性客户端的数量。图 3 FMNIST 数据集第 30 轮和第 15 轮上以及 CIFAR-10 数据集第 90 轮和第 45 轮下的核密度估计图。(a) m10%(b) m20%(c) m20%(d) m30%。IV-C 鲁棒聚合在这一步中我们通过利用自适应服务器学习率来采用额外的防御机制。与传统方法在聚合过程中保持固定学习率不同我们在不同训练轮次动态调整学习率。该方法通过减轻恶意更新的影响进一步增强全局模型的鲁棒性。逐客户端的学习率调整策略不切实际因为恶意客户端可能操纵训练过程以利用此类学习率调整策略并增强其对全局模型的影响。我们采用更现实的防御设置即基于特定维度中更新符号的聚合来修改服务器学习率。设 △W_t^i 表示第 t 轮从客户端 i ∈ h_t 接收的更新其中 h_t 是被识别为诚实的客户端集合。我们分析更新的符号并将其跨客户端聚合。具体地我们计算每个参数维度 k ∈ {1, 2, 3, …, K} 的符号和 M_t^k如8所示如果聚合符号的绝对值 |M_t^k| 超过阈值 δ则表明大多数更新在维度 k 上是一致的。这也表明良性更新在该维度上占主导地位因为在我们的设置中良性客户端的数量多于恶意客户端。在这种情况下服务器学习率 η 乘以 1使全局模型能有效从这些更新中学习。然而如果 |M_t^k| 小于 δ则意味着更新在该维度上不一致。因此正负更新趋向于相互抵消。我们将这种不一致性归因于投毒更新的更强影响。在这种情况下我们将学习率 η 乘以 -1从而最小化恶意更新对全局模型的贡献。δ 根据经验设置为 3 或 4以在准确率和攻击成功率之间取得平衡。此处目标是减轻逃避时空检测的投毒更新的影响。通过利用自适应学习率这些更新的影响被显著降低同时确保全局模型在对抗性攻击下保持强大和鲁棒。V. 实验分析V-A 实验设置数据集。 我们在三个基准数据集上进行实验Fashion-MNISTFMNIST[20]、CIFAR-10 [21] 和 CIFAR-100 [21]。FMNIST 数据集包含 60,000 张训练图像和 10,000 张测试图像CIFAR-10 和 CIFAR-100 数据集各包含 50,000 张训练图像和 10,000 张测试图像。FMNIST 和 CIFAR-10 数据集均包含 10 个类别CIFAR-100 包含 100 个类别。模型架构。 对于 FMNIST 数据集我们使用包含两个卷积层、一个最大池化层和两个带 dropout 的全连接层的卷积神经网络CNN。对于 CIFAR-10我们使用包含三个卷积层、一个最大池化层和三个带 dropout 的全连接层的 CNN。最后我们使用 ResNet-18 架构训练 CIFAR-100 数据集。攻击方法。 在我们的设置中考虑 20 个客户端每轮随机选择 50% 的客户端参与 FL 过程。攻击者按照 BadNets [24] 攻击将加号模式作为触发器图 1插入特定类别基类的所有样本中以投毒本地数据集。然后他们执行以下标签翻转sandal凉鞋→ sneaker运动鞋FMNISTdog狗→ horse马CIFAR-10bed床→ beetle甲虫CIFAR-100。超参数。 我们在 FMNIST、CIFAR-10 和 CIFAR-100 数据集上分别运行 FL 训练 30、100 和 100 轮。本地训练的学习率设为 0.1服务器学习率初始设为 1.0。FMNIST 和 CIFAR-10 的批量大小设为 256CIFAR-100 设为 128。FMNIST 数据集的本地训练轮数为 5CIFAR-10 和 CIFAR-100 为 2。FMNIST 和 CIFAR-10 实验在 IID 设置下进行而 CIFAR-100 实验在非 IID 设置下进行Dirichlet 参数 α 0.7。所有实验均使用 PyTorch 框架进行。评估指标。 我们使用三个评估指标主任务准确率MA、基类准确率BA和攻击成功率ASR以评估全局模型在对抗性环境中的性能。MA 和 BA 在干净验证集无触发器上测量ASR 在仅包含基类投毒样本的投毒验证集上测量。我们防御的目标是最大化 MA 和 BA同时最小化 ASR。a) 主任务准确率总体准确率指示模型对干净样本的分类准确程度。b) 基类准确率基类上的准确率指示模型对来自基类的干净样本的分类准确程度。c) 攻击成功率在存在触发器的情况下基类样本被分类为攻击者指定的目标类别的百分比。V-B STAR-FL 的有效性表 I不同恶意客户端百分比下的主任务准确率、基类准确率和攻击成功率。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。数据集恶意客户端 %MA (%)(↑)BA (%)(↑)ASR (%)(↓)FMNIST1091.4997.502.302090.9497.102.903089.9696.803.60CIFAR-101074.6357.703.202074.6159.403.903072.5852.604.10为评估所提出的 STAR-FL 框架的有效性我们在不同恶意客户端比例m 10%/20%/30%下进行了实验。表 I 展示了不同攻击比例下的实验结果。在 FMNIST 数据集上STAR-FL 显示出对对抗性操纵的强大抵抗能力。在 10% 恶意客户端的情况下该框架实现了 91.49% 的主任务准确率保持了 97.50% 的高基类准确率同时将 ASR 限制在仅 2.30%。随着恶意客户端比例增加到 20% 和 30%总体准确率逐渐下降但退化幅度适中。即使在 30% 恶意客户端参与的情况下该框架仍保持了 89.96% 的主任务准确率ASR 为 3.60%。这突显了 STAR-FL 在减轻对抗性影响的同时保持主任务性能的鲁棒性。在 CIFAR-10 数据集上的实验由于数据复杂性的增加而呈现更具挑战性的场景。在 10% 恶意客户端的情况下该框架获得 74.63% 的主任务准确率和 57.70% 的基类准确率ASR 低至 3.20%。当恶意客户端比例增加时主任务准确率得以保持但基类准确率出现更急剧的下降。在 30% 恶意客户端的情况下基类准确率降至 52.60%而 ASR 略微上升至 4.10%。这些结果表明虽然 STAR-FL 能有效限制后门攻击的成功率但在复杂数据集上维持准确率方面存在一定的权衡。总之结果表明 STAR-FL 在不同攻击比例下实现了鲁棒性与准确率之间的平衡。该框架在两个数据集上均将 ASR 持续限制在 5% 以下。这表明 STAR-FL 在隔离恶意更新方面具有显著优势从而增强了联邦学习系统在对抗性环境中的安全性。我们进一步评估了 STAR-FL 针对高级攻击的有效性。第 V-D 节中的结果表明 STAR-FL 对多样化攻击策略提供了具有韧性和灵活性的防御。V-C 与现有防御方法的比较我们将 STAR-FL 与 RFA [17]、Trimmed Mean [19]、Median [19]、RLR [18] 和 FoolsGold [15] 进行比较。表 II 展示了在 30% 恶意客户端下的实验结果。CIFAR-100 实验在连续攻击 [4] 设置下进行其中攻击者在每一轮都投毒数据集。此外他们还缩放更新以放大攻击。对于所有非 IID 实验我们使用 Gap Statistics [31] 方法确定空间分析中的最佳聚类数而非固定为两个聚类并且省略了 IID 实验中使用的离群值剔除步骤。这些更改确保在非 IID 设置下框架在隔离恶意客户端的同时不会错误地排除诚实更新。表 II我们提出的防御与现有防御的有效性比较。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。防御方法FMNISTCIFAR-10CIFAR-100MA (%)(↑)ASR (%)(↓)MA (%)(↑)ASR (%)(↓)MA (%)(↑)ASR (%)(↓)--------------------------------------------------------------------------------No Attack92.52N/A78.63N/A59.31N/AFedAvg [1]92.33100.078.1177.5059.2552.00RFA [17]92.41100.078.4078.8055.6847.00Trimmed Mean [19]92.2999.5077.0268.9057.9044.00Median [19]91.3177.4072.3866.0042.8134.00RLR [18]90.9848.6074.6843.6051.7321.00FoolsGold [15]91.8839.5074.9871.3057.8343.00STAR-FL89.963.6072.584.1053.627.00在 FMNIST、CIFAR-10 和 CIFAR-100 数据集上FedAvg 实现了较高的主任务准确率但作为防御完全失败ASR 分别为 100%、77.50% 和 52%。RFA 使用几何中值聚合更新以减少离群值的影响。它在准确率上几乎与 FedAvg 一样好但鲁棒性较低ASR 分别为 100%、78.80% 和 47%这表明基于几何中值的聚合对精心设计的恶意更新无效。Trimmed Mean 在平均之前丢弃最大和最小的坐标更新。与 FedAvg 和 RFA 相比它在 ASR 方面有微小改进但效果仍然可忽略因为准确率几乎不变。Median 是另一种逐坐标聚合方法在每个维度选择中间的更新。它提供了更强的鲁棒性将 ASR 降至 FMNIST 上的 77.40%、CIFAR-10 上的 66% 和 CIFAR-100 上的 34%。然而它实现了较低的准确率尤其是在 CIFAR-100 上这反映了丢弃良性信息会降低模型性能。RLR 是一种自适应防御根据客户端更新的一致性调整服务器学习率。它实现了更强的防御效果将 ASR 降至 FMNIST 上的 48.60%、CIFAR-10 上的 43.60% 和 CIFAR-100 上的 21%。然而RLR 完全依赖于更新的符号一致性当恶意更新被设计为模仿良性更新时它容易受到攻击。与其他基线相比FoolsGold 部分消除了投毒更新的影响。在 FMNIST 上它实现了较高的主任务准确率91.88%和相对较低的 ASR39.50%表明它能在较简单数据集上有效保持主任务准确率同时降低 ASR。然而在 CIFAR-10 和 CIFAR-100 上FoolsGold 表现出较高的 ASR分别为 71.30% 和 43%表明攻击在更复杂的特征空间中仍然可以成功。相比之下STAR-FL 表现出更高的鲁棒性将 ASR 降至 FMNIST 上的 3.60%、CIFAR-10 上的 4.10% 和 CIFAR-100 上的 7%。尽管 STAR-FL 在准确率上有适度的降低但其在 ASR 上的显著改进明显超过了这一权衡。通过将时空过滤与鲁棒聚合相结合STAR-FL 为联邦学习建立了一个更可靠和更强有力的防御框架。V-D 消融研究表 III空间和时间过滤不同组合下的主任务准确率、基类准确率和攻击成功率。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。数据集防御方式MA (%)(↑)BA (%)(↑)ASR (%)(↓)FMNIST空间分析92.1098.292.00时间分析92.1898.791.90空间时间92.1998.192.60CIFAR-10空间分析78.2269.204.60时间分析78.2667.696.50空间时间78.0163.804.20时空分析的有效性。 我们检查了空间和时间过滤单独及组合使用的有效性。这些实验在 10% 恶意客户端下进行。表 III 突出显示了这三种防御设置的结果。在 FMNIST 数据集上空间和时间过滤单独使用实现了相当的性能主任务准确率分别为 92.10% 和 92.18%。时间过滤提供了最低的 ASR1.90%和最高的基类准确率98.79%展示了其在减轻对抗性行为方面的有效性。空间时间组合防御实现了最高的主任务准确率92.19%但 ASR 略有增加。这些结果表明两种防御在较简单数据集上均高度有效时间过滤在鲁棒性方面提供了微小优势。在更复杂的 CIFAR-10 数据集上空间过滤优于时间过滤实现了更低的 ASR 和更高的基类准确率。空间时间组合防御进一步将 ASR 降至 4.20%但代价是基类准确率明显下降。这种权衡突显了在高维设置中区分恶意更新与良性更新的困难更严格的过滤提高了鲁棒性但降低了准确率。总体而言结果证实 STAR-FL 有效约束了后门攻击的成功率持续将 ASR 保持在 7% 以下。虽然时间过滤在较简单数据上略微更有效但组合方法在复杂场景中提供了更强的鲁棒性验证了 STAR-FL 中空间和时间过滤组件的有效性。表 IV时空过滤与鲁棒聚合不同组合下的主任务准确率、基类准确率和攻击成功率。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。数据集防御方式MA (%)(↑)BA (%)(↑)ASR (%)(↓)FMNIST空间鲁棒91.3497.602.80时间鲁棒91.2997.892.70鲁棒聚合仅91.3296.791.30CIFAR-10空间鲁棒73.9553.104.60时间鲁棒73.9758.996.10鲁棒聚合仅75.3257.404.70鲁棒聚合的有效性。 我们进一步通过将鲁棒聚合与空间和时间过滤相结合来检查 STAR-FL 的性能。表 IV 突出显示了这些防御设置的结果。在 FMNIST 数据集上所有防御组合均保持了稳定的性能主任务准确率约为 91%。空间鲁棒和时间鲁棒实现了可比的结果时间鲁棒在基类准确率97.89%和 ASR2.70%方面略优。仅使用鲁棒聚合在降低 ASR 方面最为有效达到 1.30%但代价是基类准确率较低。这些发现表明鲁棒聚合的集成抑制了 ASR但有时以准确率为代价。在 CIFAR-10 数据集上空间鲁棒和时间鲁棒的主任务准确率分别为 73.95% 和 73.97%时间鲁棒实现了最高的基类准确率58.99%和最高的 ASR6.10%。仅使用鲁棒聚合提供了最佳平衡实现了最高的主任务准确率75.32%并保持低 ASR4.70%同时保持了有竞争力的基类准确率57.40%。因此鲁棒聚合在保持高准确率的同时控制 ASR展示了有利的权衡。总体而言这些发现突显了 STAR-FL 受益于时空过滤和鲁棒聚合的互补优势同时根据数据集复杂性提供灵活的防御。在 FMNIST 等较简单数据集上时空过滤提供的益处有限仅使用鲁棒聚合在 ASR 方面优于 STAR-FL。相比之下完整框架在 CIFAR-10 等复杂数据集上提供了更大的益处。表 V不同数据异质性下的主任务准确率和攻击成功率。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。α恶意客户端 %FMNISTCIFAR-10MA (%)(↑)ASR (%)(↓)MA (%)(↑)ASR (%)(↓)0.51079.322.5046.153.202078.166.1042.197.803079.2420.1042.6813.001.01088.912.1058.058.402086.564.1052.4311.603088.249.1056.3310.60在非 IID 数据上的有效性。 为进一步评估 STAR-FL 在非 IID 设置下的性能我们在 30% 恶意客户端下进行实验并通过改变 Dirichlet 分区参数 α 来控制数据异质性。在 Dirichlet 分布中较低的 α 意味着更偏斜非 IID的数据而较高的 α 接近 IID 分布。表 V 中的结果表明更高的异质性降低了准确率并增加了 ASR。在 α0.5 时与 α1.0 相比准确率下降ASR 显著上升。例如在 FMNIST 上 30% 恶意客户端时主任务准确率在 α0.5 时约为 79%在 α1.0 时约为 88%ASR 从约 9%α1.0跃升至约 20%α0.5。在 CIFAR-10 上准确率从 α0.5 时的约 43% 提高到 α1.0 时的约 56%而 ASR 保持适中约 10–13%。这些结果表明当客户端数据分布不平衡时我们的防御仍然有效。总之更高的异质性使 STAR-FL 更难区分恶意更新与良性更新因为恶意更新也变得高度多样化。然而非 IID 设置下的结果表明STAR-FL 通过时空过滤和鲁棒聚合即使在数据异质性下也能保持鲁棒性。表 VI不同攻击下的主任务准确率、基类准确率和攻击成功率。↑ 表示数值越高性能越好↓ 表示数值越低性能越好。攻击方式数据集MA (%)(↑)BA (%)(↑)ASR (%)(↓)MRAFMNIST89.3296.103.60CIFAR-1074.4058.893.30DBAFMNIST89.6296.703.20CIFAR-1073.4355.105.10MRADBAFMNIST89.3995.493.63CIFAR-1075.5458.794.30自适应攻击FMNIST89.4892.803.40CIFAR-1075.8662.804.30在不同攻击上的有效性。 我们测量了 STAR-FL 针对不同类型攻击的性能模型替换攻击MRA[11]、分布式后门攻击DBA[4]、MRADBA 组合攻击以及自适应攻击。这些实验在 30% 恶意客户端下进行以模拟更强的攻击场景。对于 MRA 攻击恶意更新在发送到服务器之前乘以缩放因子。对于 DBA 攻击后门触发器分布在三个攻击者之间它们共同形成一个模式作为触发器。表 VI 总结了在这些攻击下的实验结果。在 FMNIST 数据集上STAR-FL 对所有类型的攻击表现出一致的韧性。在 MRA 攻击下STAR-FL 保持了 89.32% 的主任务准确率和 96.10% 的基类准确率同时将 ASR 保持在相对较低的 3.60%。在 DBA 攻击下ASR 降至 3.20%主任务准确率和基类准确率略有提高。当 MRA 和 DBA 攻击组合时ASR 略微上升至 3.63%反映了并发攻击策略带来的累积挑战。基类准确率也适度下降至 95.49%。这些结果表明时空过滤和鲁棒聚合有效减轻了后门威胁尽管复杂的同步攻击可能对模型性能产生可测量的影响。在 CIFAR-10 数据集上攻击的影响更为明显。MRA 攻击导致主任务准确率为 74.40%基类准确率为 58.89%ASR 为 3.30%。DBA 攻击导致主任务准确率为 73.43%ASR 为 5.10%这意味着 DBA 在高维数据集上更有效。有趣的是MRADBA 使主任务准确率提高到 75.54%同时将 ASR 保持在相对较低的 4.30%。这表明不同攻击的组合可对模型性能产生非平凡的影响。STAR-FL 的鲁棒性在自适应攻击下得到进一步评估其中攻击者修改攻击以绕过检测。自适应攻击包括三个步骤1向投毒更新添加高斯噪声2在每个通信轮次进行攻击3每个恶意客户端注入多个触发器。尽管存在这些攻击STAR-FL 仍保持强大的鲁棒性在 FMNIST 上实现 89.48% 的准确率和 3.40% 的 ASR在 CIFAR-10 上实现 75.86% 的准确率和 4.30% 的 ASR。这些结果表明即使对手试图绕过防御STAR-FL 也能有效检测自适应对手。总之虽然复杂的攻击可能略微影响准确率和 ASR但时空过滤与鲁棒聚合的组合能够可靠地抑制攻击同时保持稳定的模型性能。V-E STAR-FL 的计算与通信开销我们评估了 STAR-FL 的计算开销以评估其可行性。具体地我们测量了 CIFAR-10 上的训练时间和 GPU 内存使用量如图 4 所示。时空分析和学习率调整在服务器端引入了一些开销。STAR-FL 需要约 44 分钟和约 1 GB接近 RLR 的训练时间和 GPU 使用量。Trimmed Mean 和 FoolsGold 分别产生最高的训练时间和 GPU 使用量。Trimmed Mean 中的逐坐标排序操作和 FoolsGold 中基于历史的相似性检查引入了显著的计算复杂度。总体而言STAR-FL 比 Trimmed Mean 和 Median 快 10-15%。在 GPU 使用方面STAR-FL 比 RFA、Trimmed Mean 和 FoolsGold 少使用 10-18% 的内存。结果表明虽然 STAR-FL 执行额外的聚类和学习率调整但这些步骤实现高效并未显著增加计算成本。STAR-FL 不引入任何额外的通信开销。在每轮中客户端传输大小为 s字节的模型更新服务器将聚合后的全局模型发送回客户端。设 c 为每轮参与的客户端数r 为轮次数。总通信成本为 2·s·c·r 字节。空间和时间分析完全在服务器端对接收到的更新进行不需要来自客户端的任何额外信息。因此STAR-FL 的每轮通信成本与 FedAvg 相同。图 4 STAR-FL 在 CIFAR-10 上与基线方法相比的训练时间和 GPU 使用开销。VI. 结论在本文中我们提出了 STAR-FL一种增强联邦学习系统针对后门攻击的安全性和鲁棒性的新型防御框架。首先我们利用时空分析联合检查客户端更新之间的相似性及其跨训练轮次的历史一致性区分良性和恶意行为。其次我们开发了一种基于聚类的检测机制基于客户端更新的空间特征识别恶意更新同时利用其时间模式检测随时间演变的异常行为。第三我们集成了一种鲁棒聚合策略自适应调整客户端更新的学习率以减轻逃避检测的对抗性贡献的影响。通过将时空分析与鲁棒聚合相结合STAR-FL 提供了一个统一的防御框架提高了对后门攻击的鲁棒性。大量实验表明STAR-FL 优于现有最先进的防御方法同时保持较高的模型效用并显著降低攻击成功率。