主页 > 生成式AI >

生成式AI

图像、视频、语音生成技术,扩散模型与 AIGC 应用实践。

全部 AI基础 机器学习 深度学习 大模型 生成式AI 计算机视觉 语音与NLP 强化学习与机器人 伦理安全与社会 算力与产业 历史与未来 大模型大全

语音合成与声音克隆:技术原理与风险

几分钟录音就能复制一个人的声音,这背后是什么技术?本文梳理语音合成从拼接波形到神经声学模型的演进,解释音色与内容如何被分离建模,并讨论假冒风险、检测手…

生成式AI 2026-09-10 420 次阅读

生成对抗网络 GAN:两个网络互相博弈

让两个神经网络互相对抗:一个专心造假,一个专心鉴伪,最后造假者的作品能以假乱真——这就是生成对抗网络的设计思路。本文讲清生成器与判别器如何互相推动,也…

生成式AI 2026-09-07 1380 次阅读

AI 视频生成是怎么做到的

视频比图片难在哪?本文解释时序一致性这一核心挑战,介绍在扩散模型基础上引入时间维度的常见做法,以及关键帧、插值、音画合成等工程手段,并说明当前能做什么…

生成式AI 2026-09-07 383 次阅读

Stable Diffusion 与 Midjourney 的原理浅析

同为文生图工具,底层思路并不相同。本文从公开原理出发,解释开源路线与在线服务在模型、部署与使用方式上的差异,以及潜空间、采样器、引导强度这些常见概念的…

生成式AI 2026-09-02 346 次阅读

扩散模型:AI 画图是怎么从噪声开始的

AI 画图的主流方法叫扩散模型。本文用先打碎再学会复原的比喻解释两个方向:训练时不断往图片加噪声,生成时从纯噪声一步步去噪,说明它为何比早期方法更稳定,以…

生成式AI 2026-08-27 309 次阅读

多模态大模型:看得见、听得懂、说得出的 AI

能看图说话、听音作答的模型叫多模态模型。本文解释模态对齐的基本思路:把图像、音频切成小块转成与文字同类的表示,让它们在同一个空间里被一起处理,并介绍典…

生成式AI 2026-08-17 1972 次阅读