模型性能与参数、数据、算力之间存在可预测的规律,这就是缩放定律。本文解释它的基本形式与实际用途,也说明为什么近年研究重心转向数据质量、推理效率与小模型多做一步。
核心要点
- 缩放定律描述性能随参数、数据与算力增长的可预测关系
- 它让研究者能在小实验上外推,降低大规模试错成本
- 单纯堆规模的收益在递减,数据与效率成为新焦点
一条可以被画出来的曲线
研究者发现,在对数坐标下,模型的损失值与参数规模、训练数据量、算力投入之间呈现出相当稳定的关系:投入每增加一个数量级,性能就沿直线改善一截。这条规律被称为缩放定律,它的价值在于可预测。
可预测意味着省钱。研究者可以先用小规模实验拟合曲线,再外推判断大规模训练大概能得到什么结果,而不必每次都豪赌一次完整训练。这也改变了研究的方式:从凭直觉试,变成按曲线算。
三者要一起长大
缩放定律里有个重要提醒:参数、数据、算力必须协调。只把参数变大而数据量不变,模型会很快把现有数据学完,继续增大收益锐减,这种现象被称为数据受限。反过来,数据很多而模型太小,则装不下学到的东西。
因此一个模型该多大、该喂多少数据,是可以按预算计算出来的,而不是拍脑袋决定。这也解释了为什么高质量数据的价值在上升:当公开文本逐渐被用尽,数据的清洗、去重与配比开始决定最终效果。理解这一点,就能看懂近年关于数据存量的诸多讨论。
更大不是唯一方向
近年来行业的注意力明显转向了另一面。一方面,研究者发现让模型在推理时多花几步思考,往往能以较小的模型达到接近的效果,这一思路常被描述为用推理时间换取模型规模;另一方面,量化、蒸馏、稀疏化等技术让大模型能在普通设备上运行。
这些进展共同说明:规模曾经是最快的路,但已不是唯一的路。对使用者而言,这意味着不必迷信越大越好,而应根据任务、预算与延迟要求,在模型规模、推理深度与部署成本之间做权衡,选择变多了其实是件好事。
常见问题
既然有缩放定律,是不是堆算力就能一直变强?
规律显示收益会随投入增长,但并非无限。高质量数据有限、训练成本与能耗高昂,都会形成现实约束。近年研究也更重视数据质量和推理效率,单纯扩大规模的边际收益正在受到审视。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。