分类器引导、可控生成、可控遗忘 📅 2026/7/27 16:23:10 分类器引导Classifier Guidance是扩散模型实现“按需生成”的一种核心技术简单来说就是在扩散模型的去噪生成过程中借助一个额外的分类器来“指路”引导生成结果向我们指定的类别或特征靠拢。一、 什么是分类器引导Classifier Guidance基础的扩散模型如无条件的 DDPM生成图像时就像在盲盒抽奖你无法精确控制它具体生成什么。为了实现可控生成研究人员提出了分类器引导基本原理在扩散模型逐步去噪从纯噪声还原为图像x0x_0x0的过程中每一步ttt都将当前的中间噪声图像xtx_txt输入给一个预先训练好的分类器C(y∣xt)C(y\vert{}x_t)C(y∣xt)。引导机制分类器计算出当前中间图像xtx_txt属于目标类别yyy的概率并计算出对该概率的梯度∇xtlogP(y∣xt)\nabla_{x_t} \log P(y\vert{}x_t)∇xtlogP(y∣xt)。这个梯度指示了“图像应该朝什么方向修改才能更像类别yyy”。结合去噪扩散模型在去噪预测时将原有的去噪方向与这个分类器梯度相结合。通过调大梯度的权重Guidance Scale可以强行拉动去噪轨迹使其精准收敛到符合目标类别yyy的图像上。延伸无分类器引导Classifier-Free Guidance, CFG由于训练一个能识别高噪声图像的分类器成本较高且容易不稳定后来学者提出了CFG。它不需要独立的分类器而是让同一个扩散模型在训练时随机丢弃条件比如文本 Prompt生成时通过比较“有条件预测”和“无条件预测”的差值来做引导目前更为常用。二、 三者的联系分类器引导、可控扩散生成、可控遗忘学习这三者不是孤立的技术而是从机制手段、总体目标到反向应用的递进与映射关系扩散模型的核心能力是对概率分布P(x)P(x)P(x)进行拟合与采样。1. 分类器引导与可控扩散生成【手段 与 目的】可控扩散生成Controllable Diffusion Generation是宏观目标。指通过给定文本、图像、类别等条件精准控制扩散模型生成符合特定属性的输出。分类器引导是实现可控生成的具体技术手段之一。通过引入条件概率P(y∣x)P(y\vert{}x)P(y∣x)的梯度人为改变扩散模型去噪时的采样轨迹采样自条件分布P(x∣y)P(x\vert{}y)P(x∣y)使得输出强行落入目标条件的概率空间中。2. 可控扩散生成与可控遗忘学习【正向生成 与 正交擦除】可控扩散生成是“加法/定向输出”希望模型增强并生成符合条件yyy的内容。可控遗忘学习Machine Unlearning / Concept Erasure是“减法/定向擦除”希望模型在保留大部分生成能力的同时安全擦除或遗忘特定敏感、版权或有害的概念例如去除特定艺术家的画风、去除暴力图片生成能力。二者的关系它们是模型条件控制的正反两面。可控生成要求在给定条件时模型精准响应可控遗忘要求在遇到敏感条件时模型拒绝响应或将其重定向到安全分布。3. 分类器引导与可控遗忘学习【正向推导 与 负向引导/对抗擦除】分类器引导的技术思想在可控遗忘学习中有非常直接的应用和延伸负向引导Negative Guidance / Anti-Guidance在生成时我们可以利用分类器引导做“逆向操作”。如果想让模型遗忘/拒绝生成概念AAA只需将梯度方向反转取 negative gradient−∇logP(A∣x)-\nabla \log P(A\vert{}x)−∇logP(A∣x)。去噪过程中模型就会主动推开任何含有概念AAA的生成轨迹实现即时的“可控遗忘”。参数微调与反向对齐在模型训练/遗忘阶段研究人员也会利用分类器或打分模型来计算损失Loss。通过让模型在敏感条件下的输出向“非敏感概念”或“随机噪声”对齐例如最小化分类器将输出识别为概念AAA的概率从权重层面擦除该概念。总结分类器引导是利用梯度动态拉偏去噪路径的具体算法可控扩散生成是利用引导及其他条件机制实现按需创造的最终形态可控遗忘学习则是将可控生成的控制力翻转用来精准安全消减其中分类器引导的思想如负向梯度推离是实现概念擦除的关键工具之一。