模型大到某个程度,会突然学会原来不会的本领,这被称为涌现能力。本文解释这一现象的观察方式,介绍学术界对它是否真实存在突变的争论,讨论为什么评测方式会影响结论,并给出对使用者的启示。

核心要点

  • 涌现指某些能力在规模跨过阈值后突然从几乎为零变为可用
  • 部分涌现现象可能来自评测指标的放大效应而非能力突变
  • 涌现不可预测,这意味着新风险也可能随规模一同出现

量变引起质变的观察

研究者对比不同规模的模型时发现一种奇怪现象:某些任务上,小模型的表现几乎等于乱猜,而且规模慢慢变大时提升也不明显;但一旦跨过某个规模,正确率会陡然上升。这种突然开窍被命名为涌现能力,典型例子包括多步算术、按示例学习新格式等。

对使用者来说,这解释了为什么不能简单地用小模型的效果去推测大模型。它也可能意味着,某些今天还做不好的任务,未必需要新的算法,只要规模继续增长就有可能突然变得可用。当然反过来也成立:没人能保证它一定会出现。

一场关于真假突变的争论

也有研究者提出质疑:所谓突变,可能是评测方式造成的错觉。如果指标是完全答对才算对,那么每一步正确率的平滑提升,累积到整体后会呈现出陡峭的曲线。换成按部分得分计算,曲线就变得平滑,突变感消失。

这场争论并不是抬杠,它关系到一件实际的事:我们能否预测下一代模型会具备什么能力。如果突变只是指标假象,那么通过小规模实验外推就更有依据;如果是真实存在的,那么能力的出现将难以提前预知。

对普通人的启示

第一,不要用单一评测基准的分数判断模型强弱,指标的设计方式会显著影响结论。第二,保持对意外能力的敏感,新版本模型可能突然擅长某类任务,值得重新试一遍过去做不好的事,多试几次往往比读评测报告更贴近自己的实际情况。

第三,也要意识到硬币的另一面:既然能力可能不期而至,风险同样可能如此。这正是为什么能力评估与安全评估需要在模型发布前同步进行,而不是等上线后再补救。对使用者来说,这意味着新版本值得重新审视一遍自己的用法。

常见问题

涌现能力是不是意味着模型真的有了意识?

不能这样推断。涌现描述的是任务表现随规模发生的突变,属于行为层面的观察,与主观体验无关。目前没有任何证据表明模型具备意识,也缺乏可靠的判定方法。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。