同一个模型,为什么有的只会续写、有的却会回答问题?本文梳理预训练与指令微调两个阶段:前者让它吸收海量文本获得知识,后者教会它理解指令、按格式输出,并解释微调为何改变的是行为而非知识。
核心要点
- 预训练让模型学会语言规律,微调让它学会听懂人话
- 两个阶段的目标不同:前者求预测准,后者求回答有用
- 微调更多是调整表达风格与服从度,难以凭空注入知识
第一步:海量阅读
预训练阶段,模型面对的是规模极大的公开文本,任务单调到极点:预测下一个词。没有老师打分,没有题目分类,只有一遍又一遍的猜测与纠正。正是这个枯燥的过程,让它逐渐掌握了语法、常识、写作套路,以及大量事实性内容的统计印象。
这一步的代价极高,需要大量算力和漫长的训练时间,因此通常由少数有能力承担的研究机构完成。训练结束得到的模型常被称为基座模型,它博学但不好用。理解这一点,就能明白为什么后来者大多站在前人的成果上做二次开发。
第二步:学会听话
基座模型的问题在于,你问它一个问题,它可能给你续写出一串更长的提问,因为它只知道接着写,不知道该回答。指令微调就是补上这一课:用大量指令与理想回答的范例继续训练,让它明白面对提问应当直接作答,面对格式要求应当照做。
这些范例覆盖了摘要、翻译、改写、计算解释、代码编写等常见任务。经过这一步,模型的行为从续写文本变成了完成任务。这也是为什么同样规模的模型,有的用起来顺手,有的却总答非所问,选模型时不能只看规模,还要看它做过什么调整。
微调能做什么,不能做什么
微调擅长改变的是行为层面:语气是否礼貌、输出是否结构化、是否愿意承认不知道、是否遵循特定模板。它成本远低于预训练,普通团队也能做。因此很多垂直领域的模型,都是在一个通用基座上做轻度调整得到的。
但它不是万能药。想靠微调把一套新知识可靠地塞进模型,效果往往不稳定,模型可能记住了表述却记不准细节。遇到需要准确、可更新知识的场景,把资料在提问时提供给模型,通常比反复训练更稳妥。
常见问题
微调之后模型是不是就更懂我的行业了?
它会更熟悉你的表达习惯和输出格式,但专业知识未必可靠增加。如果知识需要准确且经常更新,更推荐把资料在提问时一并提供,让模型依据给定材料作答,而不是指望训练时记住。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。