主页 > 深度学习 >

深度学习

神经网络、卷积网络、注意力机制与 Transformer 等深度学习核心技术。

全部 AI基础 机器学习 深度学习 大模型 生成式AI 计算机视觉 语音与NLP 强化学习与机器人 伦理安全与社会 算力与产业 历史与未来 大模型大全

迁移学习与微调:站在巨人肩膀上

从零训练一个大模型代价高昂,多数人其实只是在已有模型上做小幅调整。本文解释预训练模型学到的通用能力为何能迁移到新任务,并介绍冻结层、小学习率微调等常见…

深度学习 2026-08-25 1343 次阅读

Dropout 与正则化:防止死记硬背

模型把训练题背得滚瓜烂熟,遇到新题却一塌糊涂,这是机器学习最常见的失败。正则化就是一组专门对抗死记硬背的技巧。本文讲清权重惩罚与 Dropout 的思路差异,以及…

深度学习 2026-08-12 1306 次阅读

归一化:批归一化与层归一化

训练深层网络时,输入分布会随着前面层的更新不断漂移,让学习变得困难。归一化技术把每层的数据重新拉回稳定范围。本文对比批归一化与层归一化的做法差异,并说…

深度学习 2026-07-30 1269 次阅读

词嵌入:把词语变成向量

计算机只认数字,怎么把“猫”这样的词交给它处理?词嵌入给每个词分配一串数字,让意思相近的词在空间中彼此靠近。本文讲清为什么向量能表达语义,以及那些广为…

深度学习 2026-07-17 1232 次阅读

Transformer 架构详解

2017 年提出的 Transformer 放弃了循环结构,几乎完全建立在注意力之上,从此改变了整个领域的走向。本文逐层拆解它的编码器与解码器,说明位置编码、多头注意力和前馈…

深度学习 2026-07-04 1195 次阅读

注意力机制:让模型学会聚焦

翻译一句话时,人不会盯着整段原文平均用力,而是随时把目光落在最相关的词上。注意力机制就是把这种聚焦写成可计算的公式。本文讲清查询、键、值三者的配合,以…

深度学习 2026-06-21 1158 次阅读

循环神经网络 RNN 与长短期记忆 LSTM

句子、语音、股价都是一串有先后次序的数据,普通网络看不出顺序。循环神经网络引入了记忆,让上一步的结果影响下一步;LSTM 则用门控结构解决了记忆容易流失的问…

深度学习 2026-06-08 1121 次阅读

卷积神经网络 CNN:如何看懂一张图

让计算机看懂照片,是深度学习最早取得的重大突破之一。卷积神经网络用一块块小窗口在图像上滑动,先找边缘、再拼形状、最后识别物体。本文讲清卷积、池化与层级…

深度学习 2026-05-27 1084 次阅读

反向传播算法到底在做什么

神经网络有上亿个参数,靠人工调整绝无可能。反向传播给出了一条高效算出每个参数该往哪调、调多少的路线。本文用“责任分摊”的比喻讲清它的思路,并说明它如何…

深度学习 2026-05-14 1047 次阅读

激活函数:让网络拥有非线性

如果没有激活函数,再深的神经网络也只是一根笔直的直线。本文解释为什么“非线性”是神经网络表达力的关键,并介绍几种常见激活函数的特点与取舍,包括曾经的主…

深度学习 2026-05-01 1010 次阅读

神经网络的基本结构:从神经元说起

神经网络常被说成模仿大脑,但对初学者来说,更贴切的比喻是一叠流水线上的计算卡片。本文从单个神经元讲起,说明输入、权重、偏置如何层层传递,以及“深度”到…

深度学习 2026-04-18 973 次阅读