AI 画图的主流方法叫扩散模型。本文用先打碎再学会复原的比喻解释两个方向:训练时不断往图片加噪声,生成时从纯噪声一步步去噪,说明它为何比早期方法更稳定,以及为什么需要多步迭代。

核心要点

  • 训练阶段学习如何一步步把清晰的图变成纯噪声
  • 生成阶段反过来,从噪声出发按学到的规律逐步去噪
  • 多步迭代让结果更稳定,代价是生成需要多轮计算

先把画弄脏,再学会擦干净

扩散模型的训练思路很反直觉:它不是直接学怎么画出一张图,而是学怎么把一张好图一点点加噪声,直到变成一片雪花点的纯噪声。每一步只加一点点,所以每一步的变化都很小、很好学。模型反复练习,掌握了每个噪声程度下该去掉多少杂点。

到了生成阶段,过程被倒过来:先随机生成一张纯噪声图,然后让模型一步步预测并去掉噪声,几十步之后,一团杂乱的像素逐渐收敛成一张清晰的图像。你看到的那些从雪花点逐渐变清晰的演示动画,正是这个过程的可视化。

文字是怎么参与进来的

如果只做去噪,模型只能随机画出它见过的某类图。要让画面符合你的描述,需要在每一步去噪时把文字的含义也考虑进去:模型一边看当前的图,一边参考文字提示,判断该往哪个方向收敛。也正因为如此,同样的提示词配上不同的随机起点,会得到完全不同的画面。

这就是为什么提示词里的形容词、风格词、构图词会明显影响结果。也解释了另一个现象:提示词的顺序与权重会改变画面,因为它们在每一步都被反复参考,而不只是在开始时读一次。理解这一点,就能明白提示词的微调为何会带来明显的画面变化。

为什么它取代了前辈

在扩散模型之前,生成图像的主流方法是对抗式训练,效果不错但训练过程容易失控,出现模式崩溃,即模型反复输出几乎一样的图。扩散模型的训练目标明确、过程稳定,对复杂分布的学习能力更强,因此很快成为主流。

它的代价是慢:生成一张图要走几十步去噪。近年大量研究都在做加速,包括减少步数、在低分辨率的压缩空间里计算等,让普通显卡也能在几秒内出图。今天出图速度的明显提升,很大程度上就来自这些工程上的改进。

常见问题

为什么画出来的人手总是很奇怪?

模型学习的是统计规律,对手部这种结构复杂、姿态多变且在图片中常常很小的部位,学习难度很高。它倾向于合成一个大致合理的形状,细节就容易失真。这是当前图像生成的常见短板。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。