← 返回题目列表

什么是大模型微调?它与 Prompt、RAG 应该如何选择?

高频 简单 第 2 / 26 题 更新于 2026/09/18
大模型微调PromptRAG技术选型

简化版

大模型微调是用任务数据继续训练预训练模型,使部分或全部参数发生更新,从而稳定改变模型的行为。Prompt 适合临时说明任务,RAG 适合注入可更新、可追溯的外部知识,微调更适合固化任务模式、表达风格和输出习惯,三者可以组合。

详细版

选择时先判断问题来自哪里:

  • 模型会做,只是不清楚要求:先优化 Prompt;
  • 缺少最新、私有或需要引用的事实:优先 RAG 或工具;
  • 需要长期稳定的格式、语气、分类边界或领域行为:考虑微调;
  • 需要学习大量领域文本的语言分布:评估继续预训练,而不只是 SFT;
  • 需要精确计算、实时状态或外部动作:交给程序和工具。

微调会更新权重,但不等于可靠地写入一套可查询知识库。若事实经常变化、必须给出处或需要删除更新,RAG 通常更合适。生产系统常采用“微调负责行为,RAG 负责知识,工具负责确定性操作”的组合。

完整版教学

一、微调到底改变了什么

预训练模型已经学习了通用语言规律和大量模式。微调从这个参数起点继续优化,使模型在目标数据分布上的损失下降。与只存在于当前上下文的 Prompt 不同,微调结果会保存在新的权重或 Adapter 中。

这种改变是统计性的:模型更倾向于生成训练数据所示范的行为,并不意味着它建立了可精确增删改查的数据库。

二、Prompt 的优势与边界

Prompt 不改参数,开发快、回滚简单,适合任务说明、少量示例和输出约束。模型本来就具备能力时,Prompt 往往是成本最低的方案。

但复杂规则不断堆进 Prompt 会增加 token、延迟和维护成本,不同模型版本的遵循效果也可能变化。此时应通过评估判断微调能否稳定压缩这些行为要求。

三、RAG 的优势与边界

RAG 在推理时检索外部文档,把相关证据放入上下文。知识更新时只需更新索引,回答还能附引用,因此适合制度、产品、价格和企业内部资料。

RAG 的瓶颈在检索、切分、重排和证据利用。检索到正确文档也不保证模型一定忠实回答,所以仍需 Prompt、引用校验和评估。

四、微调适合解决什么

  • 固定分类体系和判定边界;
  • 稳定的领域表达、语气和回答结构;
  • 特定任务的输入输出映射;
  • 工具调用习惯和参数生成模式;
  • 用较短 Prompt 达到稳定行为;
  • 在目标分布上提升已有能力的可用性。

如果基础模型根本不具备所需能力或领域覆盖很弱,少量 SFT 未必足够,可能需要更强基座、继续预训练或外部工具。

五、常见组合

客服系统可以用微调统一沟通风格,用 RAG 检索产品政策,再由订单 API 查询实时状态。权重提供稳定模式,上下文提供当前证据,程序提供真实状态和权限控制;三层失败模式也不同。组合方案还要明确冲突优先级,例如检索到的最新退款期限应覆盖模型权重中的旧知识,而 API 的真实订单状态又应高于生成式推断。

六、选型流程

先建立 Prompt 基线,再拆分失败原因。缺知识就补知识,缺行为稳定性才评估微调,缺确定性就接工具。所有方案都用同一测试集比较质量、延迟、成本和维护难度。

不要因为“微调”听起来更高级就直接训练。没有明确失败样本和评估指标,训练结束也无法判断是否真的变好。

七、用“知识是否变化”做选型推演

假设客服系统的产品价格每天变化,而回复语气半年才调整一次。把价格写进权重意味着每次更新都要重训且无法可靠追溯,适合用 RAG;统一语气和输出 JSON 格式属于稳定行为,可先用 Prompt,若成功率长期卡在 85% 再考虑 SFT。两类需求通常需要组合,而非三选一。

需求首选原因
临时格式与少量规则Prompt修改快、无需训练
动态私有事实RAG可更新、可引用、可删除
稳定行为与风格SFT/LoRA固化输出分布
深层能力改变全量微调或继续预训练更新容量更大但成本高
用户问题 -> Prompt 编排 -> RAG 证据 -> 微调模型生成 -> 工具校验/执行

选型实验应保持基座与评测集一致,分别计算准确率、引用正确率、提示 token 成本、延迟和维护成本。若 Prompt+RAG 已达门槛,继续微调只是增加训练与版本治理负担。

八、常见误区与追问

  • 误区:知识问答效果差就应立即微调。 先判断问题在检索、提示还是行为;动态事实写入权重难更新也难引用。
  • 追问:Prompt 何时最合适? 规则少、变化快且上下文足够时,Prompt 成本最低、迭代最快。
  • 追问:RAG 为什么不能解决所有问题? 它能提供证据但不保证模型正确遵循格式、推理或使用证据。
  • 误区:用了微调就不需要 RAG。 微调可固化行为,RAG 仍负责新鲜、私有和可追溯知识,两者常组合。
  • 追问:如何公平选型? 固定基座与评测集,比较质量、引用、延迟、token 成本和长期维护成本。

九、加强记忆

Prompt 是在当前上下文交代任务,RAG 把可更新且可引用的资料带入上下文,微调则改变模型长期的行为分布。动态事实优先 RAG,稳定格式与风格先试 Prompt、必要时 SFT,真实状态和高风险动作交给工具与权限层。选型要用同一评测集比较质量、延迟、token 与维护成本,而不是按技术热度决定。