BERT 和 GPT 常常被一起提起,但训练目标完全不同。本文解释自编码与双向上下文的含义:为什么 BERT 靠做完形填空学会理解语义,为什么它不适合写长文,以及它今天在搜索与语义匹配中的实际位置。

核心要点

  • BERT 的训练任务是遮住部分词再猜回来,天然能看到左右两侧
  • 双向理解让语义判断更准,代价是不适合逐词生成
  • 它如今多是幕后组件,负责把文本变成可比较的向量

做完形填空出身的模型

如果说 GPT 练的是续写,那么 BERT 练的是完形填空。训练时,句子里的一部分词会被随机遮住,模型的任务是根据剩下的内容把它们猜回来。关键在于,猜的时候它既能看左边,也能看右边,两侧的信息可以同时用上,这就是所谓双向。

这个差别听起来不大,影响却很深。续写类模型为了预测下一个词,只能看已经写出的部分;填空类模型却能把整句话当作整体来读,对歧义的消解更从容。比如判断一个多音字在句中读什么,有了右侧信息才好确定。

为什么它不擅长写文章

填空式的训练目标,让 BERT 学到的是这句话整体是什么意思,而不是接下来该说什么。它输出的通常是对整段文字的表示,而不是一串新的词。硬要它写长文,就像让一位擅长做阅读理解的人即兴演讲,能做,但不是它的强项。

因此在实际系统中,两类模型常常分工合作:理解型模型负责把问题和文档变成向量、判断相关性;生成型模型负责把找到的材料组织成人话。分工的原因很简单:两类任务追求的目标不同,硬让一个模型兼顾,往往两头都不讨好。

它今天在哪里发挥作用

虽然话题热度被生成式模型抢走,理解型模型并没有退场。搜索结果的语义排序、客服系统里的意图识别、垃圾内容过滤、相似问题去重,这些需要判断两段文字像不像的任务,都是它的主场。这类任务对生成能力没有要求,却对语义准确度要求很高。

从工程角度看,它还有个实用优势:结构相对轻量,推理成本低,可以在普通服务器上大规模部署。对多数团队来说,把海量文档转成可检索的向量,往往比让模型从头写一份报告更有价值,这也是它至今活跃在生产环境里的主要原因。

常见问题

BERT 现在是不是已经被大模型淘汰了?

没有。生成式模型更抢眼,但判断两段文字是否相关、给搜索结果排序这类任务,理解型模型仍然高效且便宜。它常作为检索环节的一部分,与生成模型配合工作,而不是被取代。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。