大语言模型究竟是什么?本文把它比作一个读过海量文本、只做“预测下一个词”的接话高手,解释参数、预训练、上下文这些常见说法背后的真实含义,也说明它为什么并不真的理解世界。

核心要点

  • 大语言模型的核心任务只有一个:预测最可能出现的下一个词
  • 所谓“大”,指的是参数规模与训练数据量都达到惊人量级
  • 它学会了语言的统计规律,并不等于拥有对世界的真实理解

一个只会接话的“文字预言家”

想象你在玩成语接龙,无论前面的人说了什么,你都要立刻接出下一个最合适的字。大语言模型做的就是这件事,只不过它接的不是成语,而是词。你给它一段开头,它算出接下来最可能出现的词,把这个词接到后面,再继续算下一个,如此循环,直到生成一段完整的回答。这个看似简单的机制,就是所有大模型的起点。

之所以说它“大”,一是它内部用来做判断的可调节数字极多,这些数字被称为参数;二是它读过的人类文本规模极大,从网页、书籍到代码,几乎涵盖了公共领域能找到的大部分文字。训练的本质,就是不断调整这些参数,让它预测下一个词时越来越准。

知识从哪儿来:不是抄,是压缩

有人以为模型回答问题时是在数据库里翻答案,其实不是。训练结束后,它并没有保存原文的副本,而是把海量文本里的规律压进了参数之中:哪些词经常一起出现、什么语境下该用什么语气、常见的推理套路长什么样。你可以把它想成一份被极度压缩的笔记,能还原大意,却没法逐字还原原文。

这也解释了大模型的两个典型毛病。一是它会一本正经地编造细节,因为它是按“听起来合理”来生成,而不是按“确有其事”来检索;二是它对训练截止之后发生的事一无所知。理解这一点,比记住任何参数量都重要。

它真的理解自己在说什么吗

这个问题至今没有定论。可以确定的是,模型内部并没有一本字典或一套逻辑规则,它处理的是数学上的向量与概率。但在足够大的规模下,它表现出的语言组织能力、类比能力和简单推理能力,已经让许多研究人员重新思考“理解”的定义。

对普通读者来说,更实用的态度是:把它当成一位读过极多书、反应很快、但偶尔会记错的助理。它能帮你起草、归纳、激发灵感,但关键结论仍需要你自己核对。关于它如何做到这一点,站内关于注意力机制的文章会进一步展开。

常见问题

大语言模型和普通的搜索引擎有什么不一样?

搜索引擎是在已有网页里找匹配,把原文链接给你;大语言模型则是根据学到的语言规律现场写一段回答。前者擅长给出处,后者擅长组织与改写,也因此更容易出现没有出处的内容。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。