【CVPR 2026】POUR:神经坍缩驱动的可证明最优表示级机器遗忘|从隐私合规与表示几何视角 📅 2026/8/9 4:01:26 摘要本文解读 CVPR 2026 论文《POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse》。该论文提出POUR可证明最优的表示遗忘通过融合Neural Collapse 的 simplex ETF 几何、表示级弱遗忘定义与RUS 评估指标把遗忘一个类重述为沿该类方向做一次正交投影其特别之处在于证明了 ETF 在正交投影下保持 ETF 结构、保留类仍 Bayes 最优。实验表明 POUR-P 在 CIFAR-10 上达到AUS 1.01超过重训练上界、遗忘类精度 0%POUR-D 在表示级 RUS 上以 0.47 全面领先基线为 GDPR 合规与医学影像等敏感场景的机器遗忘提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么 logit 对齐 ≠ 真正遗忘研究主线从问题到结论基准/方法设计表示级弱遗忘 RUS 指标分类全景机器遗忘方法的版图方法细节一次正交投影的遗忘实验设计与结果评测协议CIFAR-10 主结果CIFAR-100更困难的类纠缠场景PathMNIST 域偏移内部 vs 外部测试跨模态扩展CLIP 文本嵌入遗忘结果对比总结关键发现局限性常见问题FAQPOUR 和传统机器遗忘方法的核心区别是什么POUR-P 和 POUR-D 两个变体怎么选为什么 CIFAR-100 上所有方法都更困难RUS 指标和 AUS 指标有什么区别POUR 能在 LLM 或基础模型上直接用吗遗忘类在 POUR 之后变成什么参考链接论文基本信息项目内容标题英文POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse标题中文神经坍缩驱动的可证明最优表示级机器遗忘作者Anjie Le · Can Peng · Yuyuan Liu · J. Alison Noble机构Institute of Biomedical Engineering, University of Oxford会议CVPR 2026arXivarXiv:2511.19339项目网站github.com/ale256/representation_unlearning背景与动机为什么 logit 对齐 ≠ 真正遗忘机器遗忘的目标是让模型在不从头重训的前提下移除特定类别或训练数据的影响。现有方法大多只对齐遗忘集与保留集的预测概率被称为弱遗忘weak unlearning——但 Kim 等人 2025 年的研究用线性探测攻击证明只扰动分类器 logits 并不会真正擦除内部表示中的知识残余信息仍可被线性探测或特征反演恢复带来隐私泄露风险。关键问题在于表示层仍在泄露。此前的最相关工作 Kodge 等人 2024 年用 SVD 分解在激活空间做启发式投影遗忘但缺少几何一致性与理论保证。与此同时Papyan 等人 2020 年提出的Neural Collapse 理论揭示了深度分类器收敛后的几何规律类特征集中在等距中心附近分类器权重构成一个单纯形等角紧框架simplex ETF——每个类对应一条 ETF 方向遗忘一个类本质上就是移除这条方向。从历史脉络看机器遗忘经历了三个阶段2021 年 SISA、梯度上升等范式建立Bourtoule 2021, Graves 2021→ 2024 年 SVD 投影做无保证的启发式擦除 → 2026 年 POUR 证明 ETF 投影不变性让遗忘第一次拥有最优性定理。下图展示 POUR 在病理图像上的实际擦除效果。图 1PathMNIST 上 POUR 遗忘 adipose 类前后的 Grad-CAM遗忘类激活完全消失保留类debris/lymphocytes/mucus注意力保持清晰理论层面本文还给出一个三项目标分解遗忘模型与重训练模型的特征分布差距受类分离项、遗忘类差异项、保留类差异项共同约束。当类间分离弱时如 CIFAR-100仅用遗忘集的监督不足——这个理论预言精确解释了后续实验现象。研究主线从问题到结论图 6POUR 研究主线Mermaid 流程图——从表示层泄露问题到域偏移下全面 SOTA基准/方法设计表示级弱遗忘 RUS 指标本文先把弱遗忘的定义提升到表示层面遗忘后模型的特征分布必须与只用保留集重训的参考模型不可区分即差距 $\mathcal{K}(P_z^{\mathcal{U}(M,\mathcal{D}_f)}, P_z^{M_r}) \epsilon$ 对某个分布度量成立。为了在实践中估计这个差距作者引入RUSRepresentation Unlearning Score把遗忘效力与保留保真两个目标用调和均值统一为 $\mathrm{RUS} \frac{2\Phi_f\,\mathrm{CKA}_r}{\Phi_f \mathrm{CKA}_r}$。 其中保留保真 $\mathrm{CKA}_r$ 用 Centered Kernel Alignment 衡量对特征旋转与缩放不变鲁棒应对训练随机性遗忘指标 $\Phi_f$ 取偏离原模型或接近重训练参考两种形式。RUS 取值 $[0,1]$两个目标缺一不可随成功遗忘单调上升。CKA 定义式$\mathrm{CKA}(X,Y) \frac{\langle XX^{\top}, YY^{\top}\rangle_F}{|XX^{\top}|_F |YY^{\top}|_F}$。分类全景机器遗忘方法的版图图 7机器遗忘方法版图Mermaid 流程图——POUR 属于带理论保证的表示级擦除方法细节一次正交投影的遗忘POUR 的核心建立在两个新的 Neural Collapse 理论性质上ETF ⇒ Bayes 最优在各向同性高斯假设下单纯形 ETF 唯一最大化类均值间的最小夹角极限下等价于 Bayes 最优分类器——保持 ETF 几何就等于保持最优分类能力。ETF 投影不变性核心命题设 $P I - v_u v_u^{\top}$ 为遗忘类方向的正交投影则 ${Pv_i / |Pv_i|}_{i \neq u}$ 仍是 $C-1$ 类的 simplex ETF——遗忘一个类不会破坏保留类的最优角分离。基于此POUR-P用闭式投影 $P I - w_u w_u^{\top}/|w_u|^2$ 直接作用于特征$z Pz$瞬时完成遗忘当分类器权重不可得时如视觉语言模型用遗忘集特征的类均值估计 $w_u$。POUR-D是投影引导的蒸馏变体把 POUR-P 投影后的模型作为教师学生在遗忘集上最小化 L2 损失 $\mathcal{L}_{\mathrm{POUR-D}}(x) |\theta_s(x) - P\theta(x)|_2^2$把遗忘效果下沉进特征提取器本身通常几百步内收敛。图 2POUR 框架总览——训练时用正交投影算子移除遗忘类贡献保留类 NC 几何不变遗忘类预测退化为均匀分布最优性定理保证POUR-P 得到的保留类表示与重训练模型仅差一个正交变换表示级差距为零遗忘类特征坍缩到原点、预测均匀。一句话总结遗忘被重述为沿遗忘类方向做正交投影——闭式、可解释、且有定理保证最优。实验设计与结果评测协议实验遵循标准遗忘协议只用遗忘集、不访问保留集、不干预原始训练。数据集CIFAR-10/100ResNet-18、PathMNISTImageNet 预训练 ViT-S/16评测内部外部测试集考察域偏移、CLIP 跨模态、VOC2012 分割。指标分两类分类级Acc$_r$、Acc$_f$、AUS与表示级rMIA、CKA、RUS基线覆盖 Finetune、FCS、随机标签、梯度上升、边界收缩/扩展、DELETE。CIFAR-10 主结果方法Acc$_r$ ↑Acc$_f$ ↓AUS ↑RUS$^{(r)}$ ↑Gradient Ascent86.7115.370.800.29Boundary Shrink85.3012.330.810.42DELETE88.732.430.920.39POUR-Pours94.970.001.01--POUR-Dours92.860.370.970.47Retrained上界94.680.001.001.00POUR-P 以 94.97% 保留精度实现 0% 遗忘类精度AUS 1.01 甚至超过重训练上界POUR-D 表示级 RUS 0.47 为全部 forget-set-only 方法最佳DELETE 0.39、梯度上升 0.29。图 3CIFAR-10 遗忘后表示空间 t-SNE——POUR 的保留类结构与重训练Gold模型最接近遗忘类被压离原有流形CIFAR-100更困难的类纠缠场景方法Acc$_r$ ↑Acc$_f$ ↓AUS ↑RUS$^{(r)}$ ↑rMIA ↓Gradient Ascent50.466.000.690.4450.00Random Label61.9811.000.760.4649.00DELETE64.678.000.810.5860.00Boundary Shrink68.874.000.880.6249.00POUR-Pours77.650.001.00--62.00POUR-Dours73.441.000.950.6546.00CIFAR-100 类间纠缠更强、类分离更弱理论预测的遗忘集监督不足现象确实出现即便如此POUR-P 仍以 77.65 保留精度实现完全遗忘POUR-D 表示级CKA$_r$、RUS、rMIA全面领先。图 4CIFAR-100 遗忘后表示空间 t-SNE——即使类间纠缠更强POUR 表示结构仍最接近重训练模型PathMNIST 域偏移内部 vs 外部测试方法内 Acc$_r$内 Acc$_f$外 Acc$_r$外 Acc$_f$外 AUSRandom Label78.7123.7370.6125.340.67Gradient Ascent81.439.0376.7210.610.81DELETE72.750.0073.040.000.86POUR-Pours87.140.0087.440.001.00POUR-Dours81.097.8880.907.920.87随机标签、梯度上升在外部测试集显著掉点暴露其学会掩盖遗忘集而非真正擦除POUR 两个域上均 AUS 1.00证明真擦除能在域偏移下泛化为预训练与基础模型的合规遗忘提供可行路径。跨模态扩展CLIP 文本嵌入遗忘词嵌入与视觉-语言模型嵌入呈近各向同性结构几何遗忘原则可直接迁移。POUR-P 从图像编码器移除对应文本嵌入方向后CIFAR-10 零样本设置下遗忘类准确率显著下降、其余类基本不变还观察到概念纠缠现象遗忘 airplane 影响 bird、遗忘 ocean 波及 ship。图 5CLIP 零样本遗忘CIFAR-10 前五类——每色为遗忘一个类柱高为该类准确率变化量此外VOC2012 语义分割遗忘实验中遗忘类 IoU 消失而保留类 IoU 保持分类器权重角分布与理想 ETF 角在三个数据集上几乎重合PathMNIST 偏差 1.1°验证了 NC 前提在实际训练中成立。结果对比总结图 8结果对比总结Mermaid 流程图——分类级与表示级双维度 SOTA域偏移下内外一致关键发现闭式遗忘超越重训上界POUR-P 在 CIFAR-10 上 AUS 1.01、遗忘类精度 0.00%、保留精度 94.97%全程无需训练单次投影即可完成。表示级遗忘真正发生POUR-D 的 rMIA 降至 51.8CIFAR-10/ 46CIFAR-100均为 forget-set-only 方法最低线性探测攻击成功率显著下降。域偏移暴露掩盖式方法随机标签、梯度上升在 PathMNIST 外部测试上大幅掉点外 AUS 0.67/0.81 vs 内 0.74/0.86POUR 内外一致 AUS 1.00。NC 前提在数据上成立三个数据集分类器权重角分布与理想 ETF 角几乎重合PathMNIST 偏差 1.1°。跨模态可迁移CLIP 文本嵌入遗忘精准降低对应类准确率VOC2012 分割遗忘类 IoU 消失、保留类保持。理论闭环完整ETF 投影不变性Prop. Bayes 最优性Prop. 最优性定理Thm.三者互相印证紧度证明显示投影模型与重训练模型仅差正交变换。局限性依赖 NC 假设理论需要充分过参数化与训练收敛NC 弱或部分坍缩时投影可能不再最优POUR-P 修改表示的能力有限。弱类分离时监督不足理论分解表明仅用遗忘集的策略受限于重训练空间的类间距离CIFAR-100 表现弱于 CIFAR-10 印证。RUS$^{(o)}$ 只是代理无法访问重训练模型时它以原模型为参考衡量相对变化而非绝对最优对齐。未来方向动态估计 NC 强度、为部分坍缩表示设计自适应投影、推广到大规模预训练与多模态基础模型CLIP / LLaVA 类共享子空间。常见问题FAQPOUR 和传统机器遗忘方法的核心区别是什么传统方法梯度上升、边界收缩、DELETE 等只调整分类器层的输出分布不动内部表示POUR 直接在表示空间沿遗忘类方向做正交投影并证明保留类的 ETF 几何不变、仍 Bayes 最优从根源上消除表示层泄露。POUR-P 和 POUR-D 两个变体怎么选POUR-P 是闭式投影秒级完成、无需训练适合只修改特征或分类头POUR-D 用遗忘集做几百步蒸馏把遗忘下沉进编码器参数表示级指标RUS、rMIA更强适合需要彻底修改骨干的场景。为什么 CIFAR-100 上所有方法都更困难CIFAR-100 类间纠缠更强、类分离 $\Delta_c$ 更小理论分解显示此时仅用遗忘集的监督信号不足遗忘更难同时保留类结构——这也是本文理论直接预测的实验现象。RUS 指标和 AUS 指标有什么区别AUS 只基于分类准确率保留精度下降 遗忘类精度RUS 基于特征表示的 CKA 相似度量化的是表示层的遗忘与保留能捕捉 AUS 看不到的logit 对了但表示还在泄露的情况。POUR 能在 LLM 或基础模型上直接用吗CLIP 跨模态实验证明其几何原则可迁移到近各向同性嵌入空间词嵌入、视觉-语言模型作者也把大规模预训练与多模态基础模型列为未来方向对非 ETF 几何的模型需先验证 NC 强度。遗忘类在 POUR 之后变成什么投影后遗忘类特征坍缩到原点$Pv_u 0$其在保留类上的 logits 全部消失预测退化为保留类上的均匀分布$\alpha 0$——不偏向任何保留类也不会残留可探测的旧知识。参考链接arXiv:2511.19339 — POUR 论文原文POUR 官方代码仓库representation_unlearningPapyan et al. — Prevalence of Neural Collapse (PNAS 2020)Kodge et al. — Deep Unlearning via SVD-based Representation Erasure (2024)Zhou et al. — DELETE: Decoupled Unlearning2025CVPR 2026 官方主页给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件