风格迁移:让照片拥有梵高的笔触
一张照片配上名画的笔触,背后是把“画了什么”和“怎么画”拆开再重组。本文解释风格迁移如何用网络的不同层分离内容与风格,格拉姆矩阵为何能描述笔触,以及它…
图像分类、目标检测、人脸识别、OCR 等让机器看懂世界的技术。
一张照片配上名画的笔触,背后是把“画了什么”和“怎么画”拆开再重组。本文解释风格迁移如何用网络的不同层分离内容与风格,格拉姆矩阵为何能描述笔触,以及它…
把图片里的字变成可复制的文本,听起来只是认字,实际要先后处理版面、行位置、字符序列与语言纠错。本文拆解现代 OCR 的流水线,并说明印刷体已经可靠、手写体与…
人脸识别不是简单地比对两张照片,而是检测、对齐、提取向量、比较距离的一整套流程。本文讲清它的技术原理与能力提升的来源,并客观呈现围绕准确性、不可重置性…
面对同一张街景照片,计算机视觉能回答三种不同精度的问题。本文用一张照片串起图像分类、目标检测与图像分割三类任务:输出从一句话到一组框,再到逐像素的涂色…
摄像机交给计算机的只是一张数字表,机器却要从中认出猫、行人和路牌。本文拆解计算机视觉的完整链路:像素如何变成数字,卷积如何用小窗口扫描全图,分层抽象怎…