从噪点云到清晰风景画的渐变插画

导语:在输入框里打一句“雪山下的湖泊,日落时分”,几秒钟后一张像模像样的图就出来了。这中间发生了什么?AI 并不是从库里“找”了一张图,而是从一团纯粹的噪点开始,一步步“擦”出了一张画。这套魔法背后的主角叫扩散模型。

核心要点

  • 扩散模型的核心思路是:先学会把清晰图片一步步变成噪点,再倒过来把噪点一步步还原成图片
  • 生成过程像“雕塑”,每一步都是把画面往“更像一张合理的图”的方向修一点
  • 你的文字描述通过一个“翻译器”变成引导信号,告诉去噪过程该往哪个方向走
  • 起点的噪点是随机的,所以同一个提示词每次生成的图都不一样

先学“毁图”,再学“救图”

听起来有点反直觉:让 AI 学会画图,第一步居然是教它毁图。训练时,程序拿来一张清晰照片,往上加一层轻微的噪点,再加一层,再加一层……重复几十上百步之后,照片彻底变成了一团雪花噪点。这个“逐渐变模糊”的过程,就是“扩散”这个名字的由来——很像一滴墨水在水里慢慢散开。

在加噪的每一步,模型都在旁边看着,任务是预测“这一步加了什么噪点”。练了几百万张图之后,它对“一张图怎么一步步变坏”了如指掌。而真正的魔术在于:这个过程完全可以倒过来走。如果模型能准确预测每一步加了什么,那从一团纯噪点开始,一步步减去预测出的噪点,就能反向还原出一张清晰的图。

当然,倒着走到底不会还原出原来那张照片——起点是随机噪点,中间每一步的选择也有很多种可能。模型只是保证每一步都“往一张合理图片的方向”靠近。于是最终得到的是一张全新的、符合图像世界规律的图,而不是训练集里某张图的复读。

文字是怎么“指挥”画面的

只有去噪能力还不够——那样只会生成一些“平均意义上像照片”的图,你想要的雪山湖泊它完全不知道。这就需要文字来引路。你输入的提示词会先经过一个把文字和图像“对齐”的模型:它在训练中见过海量成对的“图片和描述”,学会了把一句话变成一串图像空间里的引导信号。

生成时,去噪的每一步都会被这个信号拉着走。可以把去噪过程想象成在浓雾里雕塑:模型每一步都把石头削掉一点,而你的文字描述就是那张设计图纸,告诉它削往哪个方向。描述越具体,指引越强;“雪山、湖泊、日落”这样的词,会在几千步的累积中把画面一步步推向最终的样子。

这也解释了两个常见现象。一是为什么提示词里写关键的词有效——它们是持续拉着整个画面的“主缰绳”。二是为什么有些细节怎么调都改不好——因为去噪是整体推进的,早期几步定下的大轮廓,后期的小修小补已经很难推翻。

为什么同样的提示词,每次画得不一样

起点的那团噪点是纯随机的,这是每张图都不一样的根源。两次生成,相当于从雾里两块完全不同的石头开始雕,虽然图纸相同、刀法相同,成品必然有差异。有些工具会提供“种子”设置:固定种子就是固定了起点的噪点,同样的提示词就能得到几乎一样的图。想微调一张满意的图,就把它当时的种子记下来。

另外,“步数”这个常见参数也值得理解:去噪是一步步走的,步数太少,噪点没擦干净,图上会残留脏斑和怪纹理;步数太多,画面早已定型,多走的部分基本是浪费时间。所以默认步数往往是画质和速度权衡后的结果。

至于“AI 有时会画出六根手指、两只左手”的老毛病,根源也在这个机制里:模型学的是图像的统计规律,而不是真正理解“人有两只手”。当画面复杂、遮挡多时,去噪过程可能走出一个局部合理但整体荒谬的结果——这也是各家持续在改进的方向。

从“能画”到“能控制”

早期的扩散模型只能听提示词,画什么全看模型心情。后来人们给它加上了越来越多的“缰绳”:可以指定画面布局的线稿控制、可以保持角色长相一致的角色参考、可以局部重绘的涂抹工具。这些技术本质上都是在去噪过程的不同环节插入额外的约束信号,让“从噪点里长出图”这个随机过程变得更听话。

理解了扩散模型“逐步去噪”的本质,很多使用技巧就变得好懂了:为什么负面提示词(告诉它“不要画什么”)有效——那是给去噪方向加了一道反向的力;为什么图生图(拿一张已有照片微调)有效——那是从一个“半成品”而不是纯噪点开始走,起点越清晰,成品越接近原图。

常见问题

AI 画图是把训练过的图片拼起来吗?它算不算抄袭?

从机制上说,模型存储的是图像世界的统计规律,而不是一张张原图;生成的图通常不会与任何一张训练图雷同。但在某些情况下,模型可能过度贴近某位创作者的风格或某些高频出现的图像,由此引发的风格模仿、版权归属争议,目前在世界各地仍在讨论和诉讼之中,还没有完全统一的结论。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。