翻译一句话时,人不会盯着整段原文平均用力,而是随时把目光落在最相关的词上。注意力机制就是把这种聚焦写成可计算的公式。本文讲清查询、键、值三者的配合,以及它为什么成了主流架构的核心。

核心要点

  • 注意力让每个位置直接查看所有位置,并按相关程度加权汇总。
  • 查询、键、值三套向量分别负责提问、匹配和提供内容。
  • 它避免了信息沿链条长距离传递造成的遗忘与稀释问题。

像人一样挑重点

把一句外文译成中文时,你不会把原文平均用力地扫一遍。翻译到某个词,目光自然落在原文中相关的那几个词上,其余暂时忽略。注意力机制就是把这种随手聚焦写成可计算的公式,让模型在生成每个位置时,自己决定该重点参考输入的哪些部分。

在它出现之前,处理序列的主流做法是循环网络:信息必须沿着链条一步步传递,从头走到尾,途中不断被压缩和稀释。注意力相当于给模型开了一条直达通道,任意两个位置之间都能直接交换信息,不管它们相隔多远。这一步改变看似简单,影响却极为深远。

查询、键与值

注意力机制里有三套向量,理解它们就理解了全部。查询代表我现在想找什么,键代表我这块内容是什么,值代表选中我之后我能提供什么。计算时,用当前位置的查询与所有位置的键逐一比对得到匹配分数,转成权重后对相应的值做加权求和。

分数怎么算、权重怎么归一化,都有成熟的做法,核心要求是让权重非负且加起来为一,这样加权求和才有按比例混合的意义。整个计算过程主要是矩阵乘法,非常契合图形处理器擅长的并行运算,这也是它后来能够支撑超大规模模型训练的一个现实原因。

它解决了什么问题

最直接的收益是长距离依赖不再困难。主语在句首、谓语在句尾,中间隔着长修饰语,循环网络要记住句首并不容易,注意力却让两处直接相连。此外权重本身提供了有限的可解释性:把注意力画成热力图,就能看到模型做决定时关注了哪些词。

如果序列内部自己对自己做注意力,就叫做自注意力,它是让模型理解一句话内部关系的关键。需要说明的是,注意力权重反映的是相关性,并不等于因果解释,把它当证据使用时要谨慎。但作为信息路由的手段,它已经被证明极其有效且通用。

常见问题

注意力权重能解释模型的判断吗?

只能部分解释,不能当成结论。权重显示的是模型在做预测时更关注哪些位置,但关注不等于依据,多层叠加之后单个权重更难单独解读。把它当作观察模型的线索之一,配合其他分析方法一起用,会比单独依赖它可靠得多。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。