Stable Diffusion入门第16-18天:从文生图到图生图——用一张图“导演”你的AI创作

📅 2026/8/14 21:27:03
Stable Diffusion入门第16-18天:从文生图到图生图——用一张图“导演”你的AI创作
如果文生图是“无中生有”那图生图就是“借力打力”。前两周我们已经跑通了文生图工作流也搞懂了节点、连线和数据类型。今天我们要进入一个更有趣的领域——图生图Image to Image简称img2img。简单来说图生图就是把一张已有的图片作为起点让AI基于它生成一张新图片。你可以用它做风格迁移、线稿上色、老照片修复、图像增强……应用场景非常广泛。而这一切的核心只有一个参数——denoise降噪强度。它决定了一张图在“忠于原图”和“自由创造”之间到底站在哪个位置。一、图生图 vs 文生图差的不只是一张图在深入搭建工作流之前先搞清楚一个根本问题图生图和文生图在原理上到底有什么不同文生图的起点是一张纯粹的随机噪声——KSampler从Empty Latent Image拿到一张空白画布全是噪声然后根据你的提示词一步步去噪最终变成一张有内容的图片。图生图的起点则是一张已有的图片。流程是这样的VAE Encoder把你上传的图片编码成潜空间表示LATENT根据denoise参数的设定往这个潜空间表示里加入一定量的噪声KSampler从这个“加了一半噪声”的状态开始结合你的提示词进行去噪VAE Decoder把去噪后的潜空间数据解码回像素图像关键区别文生图从100%噪声开始图生图从“部分噪声”开始。denoise决定了这个“部分”到底是多少——denoise1.0相当于100%噪声文生图denoise0.0相当于0%噪声原图不变。二、图生图核心工作流五个节点一条线图生图工作流比文生图只多了一个节点少了一个节点——把Empty Latent Image换成Load ImageVAE Encode。完整的工作流是这样的Load Checkpoint → Load Image → VAE Encode → CLIP Text Encode正/负→ KSampler → VAE Decode → Save Image节点逐个拆解1. Load Checkpoint紫色输出和文生图一样加载你的基础模型。输出MODEL、CLIP、VAE三个端口。2. Load Image蓝色输出这是图生图新增的节点。点击节点上的“upload”按钮上传你要作为起点的图片。这个节点输出的是IMAGE类型蓝色——也就是像素空间的图像数据。注意Load Image输出的是像素图像IMAGE而KSampler需要的是潜空间图像LATENT。所以中间必须加一个转换节点。3. VAE Encode粉色输出这个节点把Load Image传来的像素图像IMAGE蓝色编码成潜空间表示LATENT粉色。它需要两个输入pixels从Load Image的IMAGE输出接入vae从Load Checkpoint的VAE输出接入玫瑰色4. CLIP Text Encode正/负橙色输出和文生图完全一样。正向提示词描述你想要什么负向提示词描述你不想要什么。两个节点都需要从Load Checkpoint的CLIP端口黄色接入。5. KSampler粉色输出这是整个工作流的心脏。图生图和文生图在KSampler上的唯一区别是——denoise参数必须小于1。KSampler需要的输入model从Load Checkpoint的MODEL接入紫色positive从正向CLIP编码节点接入橙色negative从负向CLIP编码节点接入橙色latent_image从VAE Encode的输出接入粉色——这是图生图和文生图最关键的区别6. VAE Decode蓝色输出把KSampler输出的潜空间图像LATENT粉色解码成可视的像素图像IMAGE蓝色。需要samples从KSampler的LATENT输出接入vae从Load Checkpoint的VAE输出接入玫瑰色7. Save Image保存最终结果和文生图一样。连线速查表按颜色从到颜色Load Checkpoint (MODEL)KSampler (model)紫色 → 紫色Load Checkpoint (CLIP)CLIP Text Encode ×2 (clip)黄色 → 黄色Load Checkpoint (VAE)VAE Encode (vae)玫瑰色 → 玫瑰色Load Checkpoint (VAE)VAE Decode (vae)玫瑰色 → 玫瑰色Load Image (IMAGE)VAE Encode (pixels)蓝色 → 蓝色VAE Encode (LATENT)KSampler (latent_image)粉色 → 粉色CLIP Text Encode (CONDITIONING)KSampler (positive/negative)橙色 → 橙色KSampler (LATENT)VAE Decode (samples)粉色 → 粉色VAE Decode (IMAGE)Save Image (images)蓝色 → 蓝色注意整个工作流中数据类型的流转是IMAGE(蓝) → LATENT(粉) → CONDITIONING(橙)参与去噪 → LATENT(粉) → IMAGE(蓝)。颜色不匹配的地方就是你需要加转换节点的地方。三、Denoise图生图的“灵魂参数”如果说图生图有一把钥匙那这把钥匙的名字就叫denoise。Denoise到底是什么denoise的取值范围是0.0到1.0。它的含义是在潜空间中往原始图片里加入多少噪声。denoise 1.0加入100%噪声原始图片完全被覆盖相当于文生图denoise 0.0加入0%噪声原始图片完整保留相当于什么都没做denoise 0.5加入50%噪声从“一半原图、一半噪声”的状态开始去噪Denoise不同取值的效果denoise值效果适用场景0.0 - 0.3几乎不变仅做微小调整图像修复、细节增强、降噪0.3 - 0.5细微变化保留构图和主体风格微调、色彩调整、高清放大0.5 - 0.7明显变化保留大致结构风格迁移、换装、背景替换0.7 - 0.9较大变化仅保留粗略轮廓草图转写实、大幅度风格转换0.9 - 1.0几乎完全重绘接近文生图仅保留极少量原图信息一个直观的理解方式想象你有一幅铅笔素描原图现在想把它变成水彩画denoise 0.2AI基本照着素描描一遍稍微润色一下线条——你几乎看不出变化denoise 0.5AI保留了素描的构图和轮廓但把线条渲染成了水彩的笔触——看得出是同一幅画但风格变了denoise 0.8AI只保留了素描的大致构图比如人物位置、物体分布但细节全部重新生成——看起来像“根据素描重新画了一幅水彩”denoise 1.0AI完全无视素描只根据你的提示词“水彩画”重新生成——素描相当于没起任何作用Denoise和其他参数的关系Denoise和Steps的关系denoise控制的是“从哪个步数开始去噪”。如果总步数是20步denoise0.5意味着从第10步开始——前10步的噪声去除过程被跳过了。所以denoise越低实际生效的步数越少这也是为什么低denoise时细节会少一些。Denoise和CFG的关系denoise控制“原图的影响力”CFG控制“提示词的影响力”。两者是独立的——高denoise 高CFG 完全按照提示词重画低denoise 高CFG 在原图基础上用力按照提示词调整可能导致画面撕裂。一般建议图生图时CFG设置在7-9之间。四、实战从搭建到调试一步步来第一步搭建工作流从空白画布开始依次添加7个节点上文列出的全部按照颜色匹配表完成连线。第二步上传图片在Load Image节点点击“upload”按钮选择一张你准备好的图片。建议先从简单图片开始——比如一张清晰的照片或插画分辨率不要太大512×512左右最佳。第三步填写提示词在正向CLIP节点中输入你想要的效果。比如原图是一只猫的照片你想把它变成水彩风格watercolor painting, a cute cat, soft colors, artistic, gentle brush strokes负向提示词输入通用内容blurry, low quality, distorted, ugly, bad anatomy第四步设置KSampler参数Seed随机或固定固定可以复现结果Steps20-30步CFG7-8SamplerDPM 2M Karras 或 Euler aSchedulerKarras 或 Normaldenoise先从0.5开始第五步生成并观察点击Queue Prompt或CtrlEnter等待生成完成。第六步反复调整denoise这是最关键的一步。从0.1到0.9每个值生成一张图观察变化。你会发现一个连续的渐变光谱denoise0.1几乎看不出变化只是稍微锐化或柔化了一下denoise0.3颜色和纹理有了细微调整但构图完全没变denoise0.5风格开始转变但主体轮廓、物体位置依然清晰可辨denoise0.7风格大变细节被重新生成但还能看出“原图的影子”denoise0.9几乎是一张全新的图只有构图层面还隐约有原图的痕迹这就是图生图最迷人的地方——你可以在“忠实原图”和“自由创造”之间找到一个完美的平衡点。五、进阶玩法图生图的三种典型场景掌握了基础工作流之后来看看图生图最常见的三种应用场景。场景一风格迁移把一张写实照片变成动漫风格、水彩风格、油画风格……配置建议denoise0.5-0.7提示词详细描述目标风格如“anime style, cel shaded, vibrant colors, studio ghibli”负向提示词排除原风格如“realistic, photographic, 3d render”CFG8-10较强风格引导场景二高清放大把一张低分辨率图片放大并增加细节。配置建议在VAE Encode之前加一个Image Scale节点把图片放大到目标尺寸如2倍denoise0.3-0.5低denoise保留原图结构同时增加细节提示词“high resolution, sharp focus, detailed, 8k, masterpiece”场景三草图→写实把一张线稿或粗糙草图变成细节丰富的写实图像。配置建议denoise0.7-0.9高denoise因为草图本身信息量少需要AI大量“脑补”提示词详细描述你想要的最终效果——材质、光影、色彩、氛围这可能是最能体现图生图“创造力”的场景——AI从一条线稿中“读懂”了你想要的画面六、常见问题与排障Q1生成结果和原图几乎一样完全没有变化原因denoise设置得太低接近0。解决逐步提高denoise从0.3开始试每次增加0.1直到看到明显变化。Q2生成结果完全不像原图等于重新画了一张原因denoise设置得太高接近1.0。解决降低denoise到0.5-0.7区间。记住denoise1.0 文生图原图不起任何作用。Q3生成的图片模糊或细节丢失可能原因原图分辨率太低——先用图像处理软件把原图放大到512×512以上Steps太少——增加到25-30步denoise太低导致实际生效步数太少——适当提高denoiseQ4颜色变得很奇怪或画面撕裂可能原因CFG太高——图生图中CFG过高容易导致画面不自然建议降到6-8提示词和原图冲突太大——比如原图是猫提示词却写“a dog”AI会左右为难Q5VAE Encode节点报错检查Load Image的IMAGE输出蓝色是否接到了VAE Encode的pixels输入蓝色Load Checkpoint的VAE输出玫瑰色是否接到了VAE Encode的vae输入玫瑰色颜色不匹配会导致连接失败写在最后图生图把一张静态的图片变成了创作的起点而不是终点。你不必每次都从零开始“无中生有”——你可以拿一张草图、一张照片、一幅旧作让AI帮你把它变成全新的样子。而这一切的控制权就握在denoise这个小小的参数手里。从0.1到0.9你可以在“忠于原图”和“自由创造”之间自由滑动找到那个最符合你创作意图的平衡点。一张图 一段提示词 一个denoise值 无限可能。接下来的路你可以尝试把图生图和LoRA结合在保留原图结构的同时注入特定风格把图生图和ControlNet结合用姿态、深度图等更精确地控制生成把图生图用在局部重绘Inpaint上只修改图片的特定区域图生图的世界比你想象的更大。