← 返回题目列表

大模型微调数据质量应该如何评估?

中等 第 12 / 26 题 更新于 2026/09/17

简化版

微调数据质量不等于文本流畅。高质量样本应当输入真实、答案正确、符合目标行为,Chat Template 与角色边界一致,并覆盖线上任务、困难场景和安全边界。错误答案、冲突指令和重复模板会被模型直接学进去。

评估应结合规则检查、近重复检测、模型/工具核验和人工分层抽检;最终还要做小规模训练消融,验证清洗后的数据是否真正改善目标指标且没有损伤通用能力。数据来源、许可和敏感信息也属于质量红线。

微调数据不是“越多越好”,而是每个 Token 都在向模型示范未来应该怎样行为。

详细版

可以建立多维质量卡:

Q = w1·correctness + w2·relevance + w3·diversity
  + w4·format_validity + w5·safety - w6·duplication

分数用于排序而非代替硬规则。存在敏感数据、许可不明、答案事实错误等问题时,应直接淘汰,不应靠其他维度补偿。

维度典型检查常见缺陷
正确性专家、执行器、权威证据幻觉、旧政策、代码不可运行
任务一致性与目标产品 Rubric 对齐答非所问、风格冲突
多样性意图、长度、语言、难度分布模板化、头部过多
格式角色、特殊 Token、SchemaLoss Mask 错、工具格式错
安全合规来源、PII、版权、授权数据泄露和不当模仿

例如 100 万条数据不必全人工审查,可按来源和风险分层抽检 1000~5000 条;对高风险工具和政策样本提高抽样率,并给缺陷率报告置信区间。

完整版教学

1. 先从目标行为定义质量

客服 SFT 的优质答案需要政策准确、引用清楚和适当转人工;代码模型则重视可执行性、边界处理和安全。脱离目标任务谈“文笔好”没有意义。

应先写出目标 Rubric,再用它审核数据,而不是从已有数据反推标准。

2. 输入质量需要检查什么

用户请求应自然、完整并符合真实分布。合成输入常有统一句式、过度礼貌或直接暗示答案,模型会学到不真实模式。

检查空输入、乱码、语言错标、截断、角色混乱和上下文缺失,并按线上长度与任务切片比较分布。

3. 答案正确性如何验证

客观任务优先用代码执行、计算器、Schema、数据库或权威资料核验;开放任务由领域专家按事实清单和 Rubric 审查。

用另一个模型生成答案、再用同一个模型打分,会产生相关偏差,不能视为高置信真值。

自动评分器只做筛选,边界和高风险样本需人工复核。

4. 指令与答案是否一致

答案可能事实正确但没有完成任务,例如用户要求 JSON 却返回解释性文本,或要求拒绝外部操作却声称已执行。

检查必需字段、长度、语言、工具调用和引用约束,确保监督目标与期望产品行为一致。

可把需求转成可执行断言:格式类用 Schema,工具类核对调用 Trace,事实类核对证据 ID。这样“相关但未完成”的答案不会被流畅度评分误判为优质。

valid_sample = correct_answer
            AND follows_instruction
            AND valid_role_protocol
            AND licensed_and_safe

5. Chat Template 与角色边界

system、user、assistant 和 tool 消息必须使用统一模板。错误的角色顺序或特殊 Token 会让模型学习错误对话协议。

问题后果检查方式
user/assistant 反转学会复述问题角色状态机校验
EOS 缺失输出不停止Token 序列断言
工具结果伪造学会编造执行结果来源与 Trace 验证
Loss Mask 错学用户文本或不学答案Token 级可视化

6. 重复和模板化有什么危害

高频重复会放大某种措辞和事实,相当于隐式提高样本权重。近重复还会造成验证泄漏,让指标虚高。

同时使用精确哈希、MinHash 和 Embedding 聚类,并按模板簇切分训练/验证。去重前后要观察领域和少数类覆盖,避免误删合法高频模式。

7. 多样性应覆盖哪些轴

覆盖意图、领域、语言、难度、输入长度、答案风格、工具类型和安全边界。多样性不是同一个模板替换实体。

可用分布表比较训练数据与线上流量,并为低频高风险任务设置最小样本,而不是完全按流量比例采样。

8. 难度和信息增益如何判断

大量模型已能轻松完成的样本提供的梯度信息有限;过难且真值不可靠的样本则会注入噪声。可用基座模型损失、多个模型分歧和人工难度标注做候选信号。

难样本仍需验证正确性,不能因为模型答错就自动认为数据有价值。

9. 安全、隐私和许可属于质量红线

检查 PII、密钥、内部文档、版权许可和人物授权。脱敏要防止通过上下文重识别,且不能破坏任务语义。

记录来源、许可、采集时间和处理链路;无法说明来源的数据不应进入生产训练。

10. 人工抽检怎样设计

按来源、风险、语言和生成方式分层抽样,不只随机抽总体。对新供应商、低置信自动评分和高风险样本过采样。

双人独立标注与仲裁,统计缺陷类型和一致性。抽检结论要能追溯到数据批次,支持整批隔离。

11. 自动数据过滤如何校准

规则、分类器和 LLM Judge 可检查格式、毒性、事实和相关性,但阈值应在人工样本上校准。过滤太严会删除方言、少数群体或复杂样本。

报告每个切片的 Precision/Recall,并保留灰区供人工复核,而不是把单一分数当真值。

12. 为什么最终要做训练消融

离线“数据质量分”不一定转化为模型提升。固定训练预算,比较原始数据、清洗数据、不同来源或权重的模型结果。

同时跑目标任务、通用能力、安全与过拒回归。若目标分上涨但通用能力大幅下降,数据配比仍有问题。

13. 数据版本和反馈闭环

每批数据有版本、来源哈希、过滤规则和统计报告。线上失败进入候选池,经脱敏、去重和标注后再回流。

模型训练结果反向生成数据贡献报告,低价值或高缺陷来源逐步降权或淘汰。

14. 常见误区与追问

  • 误区:文本通顺就是高质量。 事实、任务行为、角色协议和安全可能仍然错误。
  • 误区:用强模型生成就无需人工检查。 合成数据会有系统性幻觉和风格偏差。
  • 误区:去重只需精确哈希。 模板改写和语义近重复同样会放大权重并污染验证集。
  • 误区:线上高频数据全部按比例训练。 低频高风险和关键能力需要最低覆盖。
  • 误区:过滤越严格质量越高。 可能删除困难样本和少数语言,造成覆盖偏差。
  • 追问:如何验证清洗真的有效? 固定训练预算做消融,并同时看目标、通用和安全回归。
  • 追问:百万级数据如何人工检查? 分层抽检、高风险过采样、批次级缺陷率和自动筛选灰区复核。

15. 加强记忆

  1. 六维质量:正确、相关、多样、格式、安全、低重复。
  2. 先定 Rubric:质量由目标行为定义,不由文风定义。
  3. 自动加人工:客观项执行验证,高风险专家复核。
  4. 数据可追溯:来源、许可、版本、过滤规则和批次缺陷率。
  5. 最终看训练:消融验证目标提升,并守住通用与安全能力。