← 返回题目列表

什么是大模型微调?它与 Prompt、RAG 应该如何选择?

高频 简单 第 2 / 25 题 更新于 2026/07/28
大模型微调PromptRAG技术选型

简化版

大模型微调是用任务数据继续训练预训练模型,使部分或全部参数发生更新,从而稳定改变模型的行为。Prompt 适合临时说明任务,RAG 适合注入可更新、可追溯的外部知识,微调更适合固化任务模式、表达风格和输出习惯,三者可以组合。

详细版

选择时先判断问题来自哪里:

  • 模型会做,只是不清楚要求:先优化 Prompt;
  • 缺少最新、私有或需要引用的事实:优先 RAG 或工具;
  • 需要长期稳定的格式、语气、分类边界或领域行为:考虑微调;
  • 需要学习大量领域文本的语言分布:评估继续预训练,而不只是 SFT;
  • 需要精确计算、实时状态或外部动作:交给程序和工具。

微调会更新权重,但不等于可靠地写入一套可查询知识库。若事实经常变化、必须给出处或需要删除更新,RAG 通常更合适。生产系统常采用“微调负责行为,RAG 负责知识,工具负责确定性操作”的组合。

完整版教学

一、微调到底改变了什么

预训练模型已经学习了通用语言规律和大量模式。微调从这个参数起点继续优化,使模型在目标数据分布上的损失下降。与只存在于当前上下文的 Prompt 不同,微调结果会保存在新的权重或 Adapter 中。

这种改变是统计性的:模型更倾向于生成训练数据所示范的行为,并不意味着它建立了可精确增删改查的数据库。

二、Prompt 的优势与边界

Prompt 不改参数,开发快、回滚简单,适合任务说明、少量示例和输出约束。模型本来就具备能力时,Prompt 往往是成本最低的方案。

但复杂规则不断堆进 Prompt 会增加 token、延迟和维护成本,不同模型版本的遵循效果也可能变化。此时应通过评估判断微调能否稳定压缩这些行为要求。

三、RAG 的优势与边界

RAG 在推理时检索外部文档,把相关证据放入上下文。知识更新时只需更新索引,回答还能附引用,因此适合制度、产品、价格和企业内部资料。

RAG 的瓶颈在检索、切分、重排和证据利用。检索到正确文档也不保证模型一定忠实回答,所以仍需 Prompt、引用校验和评估。

四、微调适合解决什么

  • 固定分类体系和判定边界;
  • 稳定的领域表达、语气和回答结构;
  • 特定任务的输入输出映射;
  • 工具调用习惯和参数生成模式;
  • 用较短 Prompt 达到稳定行为;
  • 在目标分布上提升已有能力的可用性。

如果基础模型根本不具备所需能力或领域覆盖很弱,少量 SFT 未必足够,可能需要更强基座、继续预训练或外部工具。

五、常见组合

客服系统可以用微调统一沟通风格,用 RAG 检索产品政策,再由订单 API 查询实时状态。三层职责不同:权重提供稳定模式,上下文提供当前证据,程序提供真实状态和权限控制。

六、选型流程

先建立 Prompt 基线,再拆分失败原因。缺知识就补知识,缺行为稳定性才评估微调,缺确定性就接工具。所有方案都用同一测试集比较质量、延迟、成本和维护难度。

不要因为“微调”听起来更高级就直接训练。没有明确失败样本和评估指标,训练结束也无法判断是否真的变好。

七、面试拆解算例

微调题可以用一个小项目来拆:基座模型 7B,业务只需要客服问答风格统一,训练集初筛 30,000 条,清洗后留下 8,000 条高质量样本。若全量微调,7B 参数按 BF16 仅权重就约 14GB,训练还要梯度和优化器状态;若用 LoRA,只训练低秩增量,显存压力会明显下降,但表达能力受 rank 和目标模块影响。

base_model: 7B
raw_samples: 30000
clean_samples: 8000
lora_rank: 8 or 16
learning_rate: 1e-5 ~ 2e-4
validation_split: 5% ~ 10%
方案适合目标主要风险验收重点
Prompt临时改格式、少量约束长提示不稳定单轮成功率
RAG接入动态知识检索召回不足引用与命中率
SFT/LoRA固化行为和领域表达遗忘与过拟合回归集与人工偏好
全量微调深度改模型能力成本高、风险大全面评测
数据清洗 -> 训练/验证切分 -> 小步试训 -> 回归评测 -> 灰度上线
   |              |             |             |
 去噪去重       防泄漏       看 loss       看坏例

因此回答「什么是大模型微调?它与 Prompt、RAG 应该如何选择?」时,不要直接说“用微调”。先问目标是什么、数据是否足够干净、是否有动态知识,再选择 Prompt、RAG、PEFT 或全量微调,最后用评估集证明它确实变好了。

八、常见误区与追问

  • 误区:微调就是把业务文档喂给模型让它记住。 微调更适合塑造行为格式、任务风格和领域表达,动态知识与事实更新通常更适合 RAG。
  • 追问:为什么这个问题不用 Prompt 或 RAG 解决? 面试里要先说明目标是改行为、补知识还是接外部数据,再选择微调方案。
  • 误区:训练集越大越好。 SFT 更怕低质、冲突、模板化和泄漏数据;少量高质量样本常常胜过大量脏样本。
  • 追问:上线前你会看哪些评估? 至少要覆盖基准集、人工偏好、回归用例、安全红线、延迟成本和灾难性遗忘检查。
  • 误区:LoRA/QLoRA 省显存就没有代价。 参数高效方法降低训练成本,但 rank、目标模块、量化误差和合并部署都会影响最终质量。

九、加强记忆

Prompt 是当场交代任务,RAG 是把资料带进考场,微调是改变模型长期的答题习惯,工具则负责查真值和执行动作;先定位问题,再选择对应手段。