目录1.摘要2.研究背景与相关工作3.扩散采样与条件引导基础3.双种子协同全局搜索4.基于引导反演的局部变异5.结果分析6.参考文献7.算法辅导·应用定制·读者交流1.摘要扩散模型已成为条件生成尤其是文本到图像T2I主流方法但其输出对初始噪声种子极其敏感。现有噪声优化大多依赖随机高斯采样、启发式筛选或局部调整难以系统覆盖噪声空间也常偏向单一评价指标。论文提出基于进化种子优化方法 SOE把全局进化搜索与局部语义细化结合起来用 CLIPScore 选择语义匹配最强种子用 ImageReward 选择人类偏好最高种子再通过退火双种子插值探索两者之间的潜在区域并用少步扩散反演注入条件语义。2.研究背景与相关工作复杂组合提示词常导致目标实体缺失、属性错配和对象关系不合逻辑。注意力增强方法通常依赖 U-Net梯度或反演方法属于局部搜索容易受初始区域限制将初始噪声映射为黄金噪声方法则需要针对生成模型训练额外网络。基于奖励模型的全局筛选能够生成更高质量图像但单一评价标准往往只改善视觉质量语义对齐提升有限。论文据此提出双目标噪声搜索在保持扩散先验分布的同时让两个具有互补优势的种子共同决定搜索方向。全局阶段负责覆盖更广的噪声区域局部阶段通过反演在有意义的语义轨迹附近细化两者交替执行形成不需要训练的进化式优化流程。3.扩散采样与条件引导基础扩散前向加噪过程可表示为x t α ˉ t x 0 1 − α ˉ t ϵ , ϵ ∼ N ( 0 , I ) . x_t\sqrt{\bar{\alpha}_t}\,x_0\sqrt{1-\bar{\alpha}_t}\,\epsilon,\qquad \epsilon\sim\mathcal{N}(0,I).xtαˉtx01−αˉtϵ,ϵ∼N(0,I).DDIM 通过确定性的非马尔可夫轨迹逐步将初始噪声x T x_TxT去噪为图像DDIM Inversion 则沿相反方向把低噪声图像映射回高噪声状态以恢复与提示词一致的初始噪声。分类器无关引导CFG在条件和无条件噪声预测之间插值ϵ ^ ( x t , t , c ) ϵ θ ( x t , t , ∅ ) s [ ϵ θ ( x t , t , c ) − ϵ θ ( x t , t , ∅ ) ] , \widehat{\epsilon}(x_t,t,c)\epsilon_\theta(x_t,t,\varnothing)s\bigl[\epsilon_\theta(x_t,t,c)-\epsilon_\theta(x_t,t,\varnothing)\bigr],ϵ(xt,t,c)ϵθ(xt,t,∅)s[ϵθ(xt,t,c)−ϵθ(xt,t,∅)],其中s ss为引导尺度c cc为文本条件。3.双种子协同全局搜索每轮先从标准高斯先验采样N s N_sNs个噪声向量{ x j } j 1 N s \{x_j\}_{j1}^{N_s}{xj}j1Ns分别用两个代表不同偏好的评价函数打分R 1 R_1R1为语义相关性 CLIPScoreR 2 R_2R2为人类偏好 ImageReward。由此得到两类极值种子x s e m arg max x j R 1 ( x j ) , x h u m arg max x j R 2 ( x j ) . x_{\mathrm{sem}}\arg\max_{x_j}R_1(x_j),\qquad x_{\mathrm{hum}}\arg\max_{x_j}R_2(x_j).xsemargxjmaxR1(xj),xhumargxjmaxR2(xj).x s e m x_{\mathrm{sem}}xsem匹配提示词语义x h u m x_{\mathrm{hum}}xhum符合视觉偏好。为在两个极值之间探索SOE 使用带随机扰动插值生成候选噪声x i ( 1 − e i ) x s e m e i x h u m z 2 n i , z ∼ N ( 0 , I ) , x_i(1-e_i)x_{\mathrm{sem}}e_i x_{\mathrm{hum}}\frac{z}{\sqrt{2n_i}},\qquad z\sim\mathcal{N}(0,I),xi(1−ei)xsemeixhum2niz,z∼N(0,I),其中e i ∈ [ 0 , 1 ] e_i\in[0,1]ei∈[0,1]控制插值偏向n i n_ini为迭代编号。按噪声范数的概率密度构造目标L S O E ∑ j 1 N e log P ( x j ) ∥ x j ∥ exp ( − n i − e i 2 ) , L_{\mathrm{SOE}}\sum_{j1}^{N_e}\log P(x_j)\,\lVert x_j\rVert\exp\!\left(-\frac{n_i-e_i}{2}\right),LSOEj1∑NelogP(xj)∥xj∥exp(−2ni−ei),4.基于引导反演的局部变异双种子插值负责全局探索局部变异则通过少步 DDIM 反演实现。SOE 先用 DDIM 将选中的潜变量x T x_TxT映射到中间状态x t i n v x_{t_{\mathrm{inv}}}xtinv再利用带引导差异的反演得到新的初始噪声从而在语义相关轨迹附近寻找更优点。5.结果分析论文从 HPDv2、Pick-a-Pic 和 DrawBench 三个数据集抽取提示词前两个各随机抽取 200 条DrawBench 抽取 100 条。实验使用 SDv1.4、SDv2.1、SDXL 和 SDv3.5 mediumSDv1.4 与 SDv2.1 输出512 × 512 512\times512512×512图像其余模型输出1024 × 1024 1024\times10241024×1024图像。评价指标包括 CLIPScore、ImageReward、PickScore、Aesthetic Evaluation ScoreAES和 Human Preference Score v2HPSv2。为综合不同指标的相对提升定义平均增益Average GainAGA G ∑ i S i − S b a s e S b a s e , \mathrm{AG}\sum_i\frac{S_i-S_{\mathrm{base}}}{S_{\mathrm{base}}},AGi∑SbaseSi−Sbase,其中S i S_iSi是 SOE 在第i ii个指标上的得分S b a s e S_{\mathrm{base}}Sbase是对应基础模型得分AG 越高表示综合改善越明显。基线包括 Vanilla SD、Whole-inversion、Z-Sampling、Zigzag、Inversion、Attention Excite、Initno、Golden noise 和 RewardSelect。文本结果显示SOE 在语义对齐和视觉质量上都稳定优于基线。SOE 将扩散模型初始噪声优化表述为一种全局—局部协同进化搜索用两个评价模型分别保留语义和人类偏好优势通过退火式双种子插值覆盖更广噪声区域再以少步引导反演进行局部细化无需微调生成模型即可作为即插即用模块接入不同扩散架构。6.参考文献Tan Y, He Y, Zhu Y, et al. Dual-seed evolutionary algorithm for noise optimization in diffusion models[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2026, 40(11): 9341-9349.7.算法辅导·应用定制·读者交流xx