什么是大模型微调?它与 Prompt、RAG 应该如何选择?
简化版
大模型微调是用任务数据继续训练预训练模型,使部分或全部参数发生更新,从而稳定改变模型的行为。Prompt 适合临时说明任务,RAG 适合注入可更新、可追溯的外部知识,微调更适合固化任务模式、表达风格和输出习惯,三者可以组合。
详细版
选择时先判断问题来自哪里:
- 模型会做,只是不清楚要求:先优化 Prompt;
- 缺少最新、私有或需要引用的事实:优先 RAG 或工具;
- 需要长期稳定的格式、语气、分类边界或领域行为:考虑微调;
- 需要学习大量领域文本的语言分布:评估继续预训练,而不只是 SFT;
- 需要精确计算、实时状态或外部动作:交给程序和工具。
微调会更新权重,但不等于可靠地写入一套可查询知识库。若事实经常变化、必须给出处或需要删除更新,RAG 通常更合适。生产系统常采用“微调负责行为,RAG 负责知识,工具负责确定性操作”的组合。
完整版教学
一、微调到底改变了什么
预训练模型已经学习了通用语言规律和大量模式。微调从这个参数起点继续优化,使模型在目标数据分布上的损失下降。与只存在于当前上下文的 Prompt 不同,微调结果会保存在新的权重或 Adapter 中。
这种改变是统计性的:模型更倾向于生成训练数据所示范的行为,并不意味着它建立了可精确增删改查的数据库。
二、Prompt 的优势与边界
Prompt 不改参数,开发快、回滚简单,适合任务说明、少量示例和输出约束。模型本来就具备能力时,Prompt 往往是成本最低的方案。
但复杂规则不断堆进 Prompt 会增加 token、延迟和维护成本,不同模型版本的遵循效果也可能变化。此时应通过评估判断微调能否稳定压缩这些行为要求。
三、RAG 的优势与边界
RAG 在推理时检索外部文档,把相关证据放入上下文。知识更新时只需更新索引,回答还能附引用,因此适合制度、产品、价格和企业内部资料。
RAG 的瓶颈在检索、切分、重排和证据利用。检索到正确文档也不保证模型一定忠实回答,所以仍需 Prompt、引用校验和评估。
四、微调适合解决什么
- 固定分类体系和判定边界;
- 稳定的领域表达、语气和回答结构;
- 特定任务的输入输出映射;
- 工具调用习惯和参数生成模式;
- 用较短 Prompt 达到稳定行为;
- 在目标分布上提升已有能力的可用性。
如果基础模型根本不具备所需能力或领域覆盖很弱,少量 SFT 未必足够,可能需要更强基座、继续预训练或外部工具。
五、常见组合
客服系统可以用微调统一沟通风格,用 RAG 检索产品政策,再由订单 API 查询实时状态。权重提供稳定模式,上下文提供当前证据,程序提供真实状态和权限控制;三层失败模式也不同。组合方案还要明确冲突优先级,例如检索到的最新退款期限应覆盖模型权重中的旧知识,而 API 的真实订单状态又应高于生成式推断。
六、选型流程
先建立 Prompt 基线,再拆分失败原因。缺知识就补知识,缺行为稳定性才评估微调,缺确定性就接工具。所有方案都用同一测试集比较质量、延迟、成本和维护难度。
不要因为“微调”听起来更高级就直接训练。没有明确失败样本和评估指标,训练结束也无法判断是否真的变好。
七、用“知识是否变化”做选型推演
假设客服系统的产品价格每天变化,而回复语气半年才调整一次。把价格写进权重意味着每次更新都要重训且无法可靠追溯,适合用 RAG;统一语气和输出 JSON 格式属于稳定行为,可先用 Prompt,若成功率长期卡在 85% 再考虑 SFT。两类需求通常需要组合,而非三选一。
| 需求 | 首选 | 原因 |
|---|---|---|
| 临时格式与少量规则 | Prompt | 修改快、无需训练 |
| 动态私有事实 | RAG | 可更新、可引用、可删除 |
| 稳定行为与风格 | SFT/LoRA | 固化输出分布 |
| 深层能力改变 | 全量微调或继续预训练 | 更新容量更大但成本高 |
用户问题 -> Prompt 编排 -> RAG 证据 -> 微调模型生成 -> 工具校验/执行
选型实验应保持基座与评测集一致,分别计算准确率、引用正确率、提示 token 成本、延迟和维护成本。若 Prompt+RAG 已达门槛,继续微调只是增加训练与版本治理负担。
八、常见误区与追问
- 误区:知识问答效果差就应立即微调。 先判断问题在检索、提示还是行为;动态事实写入权重难更新也难引用。
- 追问:Prompt 何时最合适? 规则少、变化快且上下文足够时,Prompt 成本最低、迭代最快。
- 追问:RAG 为什么不能解决所有问题? 它能提供证据但不保证模型正确遵循格式、推理或使用证据。
- 误区:用了微调就不需要 RAG。 微调可固化行为,RAG 仍负责新鲜、私有和可追溯知识,两者常组合。
- 追问:如何公平选型? 固定基座与评测集,比较质量、引用、延迟、token 成本和长期维护成本。
九、加强记忆
Prompt 是在当前上下文交代任务,RAG 把可更新且可引用的资料带入上下文,微调则改变模型长期的行为分布。动态事实优先 RAG,稳定格式与风格先试 Prompt、必要时 SFT,真实状态和高风险动作交给工具与权限层。选型要用同一评测集比较质量、延迟、token 与维护成本,而不是按技术热度决定。