一张照片配上名画的笔触,背后是把“画了什么”和“怎么画”拆开再重组。本文解释风格迁移如何用网络的不同层分离内容与风格,格拉姆矩阵为何能描述笔触,以及它如何从慢速优化走向实时生成。
核心要点
- 卷积网络的高层特征对应内容,浅层特征对应纹理与色彩
- 格拉姆矩阵统计特征通道间的共现关系,忽略位置只留风格
- 前馈网络把逐图优化变成一次前向计算,实现实时风格化
内容与风格可以被分开吗
一幅画给人的印象可以拆成两层:一层是画了什么,比如一座桥、几棵树;另一层是怎么画,比如厚重的油彩笔触、夸张的漩涡线条。风格迁移(style transfer)的想法正是把这两层拆开,把一张照片的内容与另一幅画的风格重新拼在一起。
这个想法在 2015 年前后因一篇论文广为人知。研究者发现,卷积网络的不同层恰好对应不同抽象程度:靠后的层对物体布局敏感,靠前的层对纹理色彩敏感。于是可以分别度量内容差异与风格差异,再用优化方法生成一张两者都满足的新图。
如何用数字描述“风格”
描述内容相对直接:把照片和生成图同时送进网络,比较高层特征的距离,越接近说明构图越像。描述风格则需要一个巧妙的工具——格拉姆矩阵(Gram matrix),它统计同一层中不同特征通道之间的相关性,可理解为哪些纹理倾向于一起出现。
相关性不记录位置,只记录共现关系,这恰好对应我们对风格的理解:笔触遍布全画,却不必固定在某个坐标。因此用格拉姆矩阵匹配风格,能让生成图拥有相似的色彩分布与纹理组合,而不必复制原画的构图。
从慢速优化到实时生成
最早的做法对每张图都要反复迭代优化,生成一张需要几秒到几分钟。后来研究者训练一个前馈网络,让它学会给定照片直接输出风格化结果,速度提升到可以实时处理视频。此后还出现了能融合多种风格、调节强度与空间位置的改进版本。
风格迁移也是生成式 AI 的一次预演。它证明神经网络学到的中间表示可以被重新组合,从而创造新图像。今天文生图模型里的画风提示词,本质上与之思路相通,只是规模更大、可控性更强。
它算不算艺术创作
围绕风格迁移的争论不少:它是否只是模仿艺术家,生成图像能否算作品,训练数据中的画作是否需要授权。技术本身中立,但在商用之前了解素材版权与许可条款,已经是行业内逐渐形成的基本共识。
常见问题
风格迁移会用原画的像素吗?
一般不会直接复制像素。它匹配的是统计特征:让生成图在纹理与色彩的相关性上接近目标画作,同时保留照片的构图。所以你看到的是相似的笔触感觉,而不是把梵高的画面拼贴到你的照片上。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。