为什么企业问答系统大多采用检索增强生成?本文解释 RAG 的工作流程:先把资料切块建索引,提问时检索相关片段,再让模型依据材料作答,并说明它相比直接微调的优势与局限。

核心要点

  • RAG 的核心是先检索相关资料,再让模型依据资料作答
  • 知识以文档形式维护,更新资料即可更新模型的回答
  • 效果瓶颈常在检索环节,找错段落模型再强也无用

开卷考试代替闭卷考试

直接向模型提问,相当于让它闭卷作答,答案来自训练时留下的模糊印象。检索增强生成(RAG)改成开卷:系统先在你的资料库里找出与问题最相关的几段文字,把它们和问题一起交给模型,并明确要求只依据这些材料回答。

这一改动带来三个直接好处:答案可以溯源到具体文档、知识可以随资料更新而更新、不需要为每个领域重新训练模型。对知识经常变动的领域,第三点几乎是决定性的,因为训练成本远高于维护一个文档库。

流程拆开看

离线阶段,把文档切成合适大小的片段,为每个片段计算向量并存入索引。在线阶段,把用户问题也转成向量,找出最相近的若干片段,拼进提示词,交给模型生成。整个过程通常在一两秒内完成,看起来不复杂,难的是每个环节都有取舍。

细节决定成败。分片太大容易混入无关内容,太小又会切断语义;检索数量太少会漏掉关键信息,太多则稀释注意力。这些参数没有通用最优解,需要按自己的资料特点反复调试,这也是为什么同样搭一套系统效果可能相差很远。

它解决不了什么

RAG 的最大风险在检索环节:如果相关段落没被找到,模型仍会硬着头皮回答,甚至比原来更自信,因为它看到了材料。因此评估一个 RAG 系统时,先看检索召回率,再谈生成质量,顺序不能颠倒。

此外,它不适合需要跨文档全局统计的问题,比如这些合同里一共提到多少次违约金,也不擅长需要长期多轮推理的任务。遇到这类需求,用传统的结构化查询往往更靠谱,认清边界才能把它用在真正合适的地方。

常见问题

有了 RAG 还需要微调吗?

两者解决不同问题。RAG 负责提供及时、可溯源的知识,微调负责调整语气、格式与任务习惯。多数场景先用 RAG 就能满足,只有在行为层面需要定制时,才考虑在此基础上做轻量微调。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。