GPT 这个名字背后是什么机制?本文解释“自回归”的含义:模型如何把已生成的内容不断喂回自己、一个词一个词地续写,以及为什么这种单向生成方式既擅长写作,又天然容易出错。

核心要点

  • 自回归就是把自己刚写出的内容,当作下一步的输入
  • GPT 只从左向右看,生成时无法回头修改已写出的词
  • 逐词生成的机制决定了它擅长续写,却不擅长精确计算

把自己写的东西再吃回去

自回归听起来吓人,意思其实很朴素:模型每生成一个词,就把这个词加到已有内容末尾,然后基于新的整体再生成下一个词。就像你写作文时,每写完一句都会回头默念一遍,再决定下一句怎么起头。整个过程是严格从左到右的,不能跳到后面先写结尾。

GPT 三个字母里,前两个代表生成式与预训练,最后一个代表它使用的网络结构。它先在海量文本上做预训练,学会通用的语言规律;之后再根据具体用途做进一步调整。这个先博学、后专用的两步走,如今已是主流做法。

为什么它写出来通顺,做题却会翻车

因为它的目标从来不是算对,而是接得顺。训练时它看到的是人类写下的大量句子,任务只有一个:让下一个词的预测尽量接近人类实际写下的那个词。于是它极其擅长模仿语气、结构和行文节奏,但对需要精确中间步骤的任务,比如多位数的乘法,缺少可靠的内部机制。

这也说明了一个常被误解的点:模型输出的流畅程度,和内容的正确性之间没有必然联系。一段读起来非常专业的回答,可能从头到尾都是编的。判断答案靠不靠谱,不能靠读着像不像,而要看能否被独立验证。

采样:同一个问题为什么答案不一样

模型每一步给出的其实是一张概率表:下一个词是“因为”的概率多少、是“不过”的概率多少。如果每次都机械地选概率最高的那个,回答会比较死板;实际使用时会引入随机采样,让模型偶尔选次优选项,从而产生更多样的表达。这也是同一个问题问两次会得到不同答案的原因。

随机性带来创造力,也带来不稳定。需要事实准确的场景,应当降低随机程度并配合外部资料核对;需要头脑风暴的场景,则可以放宽一些。理解这个旋钮,下次遇到回答不满意时,不妨先想想是不是随机程度没调对。

常见问题

为什么模型回答长问题时,感觉它一边想一边写?

因为它确实只能从左到右逐词生成,写出的内容无法回头修改。你看到的流畅回答,是每一步都基于前文做出的最佳猜测拼接而成,这也解释了它为何会在长推理中途跑偏。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。