预训练数据质量评分如何设计?
简化版
数据质量评分应把可读性、信息密度、完整性、来源可信度、重复度和安全/许可风险拆成可解释特征,而不是依赖一个黑盒总分。规则先过滤乱码、广告和解析失败,领域校准的分类器再排序;不同语言、代码和数学应采用不同标准,最终用小规模训练验证分数是否真的提升能力。
详细版
评分管线可分硬门槛和软权重:编码损坏、恶意脚本、隐私或许可证不合格直接隔离;长度、符号比例、困惑度、模板率、引用结构、来源与分类器概率形成多维特征。高困惑度既可能是噪声也可能是稀缺专业知识,不能单指标删除。
先构建跨语言、跨领域的人工标注集,明确 1~5 级 rubric 并测标注一致性;分类器输出需校准,在每个分数段抽样审查。使用时优先分桶采样或平滑加权,保留少量真实噪声维持鲁棒性。验收比较保留率、分布漂移、唯一 Token、下游分数、记忆与安全指标。
原文 -> 解析健康检查 -> 硬规则隔离 -> 多维特征/分类器 -> 分桶采样 -> 训练消融
完整版教学
一、“高质量”必须由目标定义
百科式文章对知识问答可能优质,却不一定适合学习口语;真实论坛语法不规范,但包含故障排查经验。质量不是脱离任务的美学分数,而是样本对目标能力的预期训练价值减去风险与成本。设计前要列出希望提升和不能伤害的能力。
单一全局标准容易把非标准语言、方言和代码日志当垃圾。更合理的是先判断内容类型,再在同类内部评价完整性、可信度与信息密度。最终 mixture 保留多样性,而不是只留下像教科书的一种文风。
二、硬过滤与软评分要分开
乱码、空页面、解析失败、恶意文件和明确敏感信息可进入硬规则,它们不适合靠概率排序。可读但价值不同的样本则用软分数决定采样权重。把两者混成阈值,会让风险样本漏过或让边界内容被不可逆删除。
| 信号 | 类型 | 注意事项 |
|---|---|---|
| Unicode/编码异常 | 硬规则 | 区分合法低资源文字 |
| 广告/导航占比 | 规则+评分 | 网页模板需先抽取 |
| 来源信誉 | 软特征 | 新站点不等于低质 |
| 小模型困惑度 | 软特征 | 高值可能是专业内容 |
| 重复簇大小 | 降权特征 | 真实常识也会高频 |
| 隐私/许可 | 风险门槛 | 需独立审计流程 |
记忆钩子:硬规则回答“能不能进”,软评分回答“应该抽多少”;删除权和排序权不要交给同一个模糊分数。
三、哪些特征真正有用
表面特征包括长度、字母数字比例、重复行、句子完整度、链接与广告密度。语义特征可由小模型判断是否连贯、是否包含解释与事实,来源特征表示域名和时间。重复、毒性、隐私与许可证最好保留独立维度,便于后续按政策重算。
一个示意总分可以是:
score = 0.30×coherence + 0.25×information
+ 0.20×source + 0.15×structure - 0.10×template
这些权重不是通用答案,只是便于实验的初始形式。模型应保存原始特征,避免未来改权重时重新扫描全部语料。
四、困惑度为什么会双向误导
小语言模型对乱码通常有很高 perplexity,因此 PPL 可帮助发现噪声;但新知识、公式、低资源语言也会高 PPL。极低 PPL 又可能意味着模板、重复或机器生成套话。质量往往落在按领域归一后的中间区间,而非越低越好。
例如英语模型给普通英文 PPL 20、医学缩写 PPL 80、乱码 PPL 200。若统一阈值 60,会错误删除医学语料。应先做语言/领域路由,再看同桶分位数,并结合字符异常和结构信号区分困难内容与损坏内容。
五、标注与分类器如何校准
Rubric 要给出具体正反例:内容是否完整、是否提供可验证信息、是否主要为模板、是否适合学习。每条由至少两人标注,计算一致性并讨论分歧;“我喜欢这篇文章”不是可复现标准。标注集需覆盖实际来源比例与长尾语言。
分类器的 AUC 高不代表概率可直接当采样权重。要画可靠性曲线,例如预测 0.8 的桶是否约 80% 被人工判为高质。模型升级后以 shadow 模式比较各来源保留率,防止静默分布漂移。
六、阈值过滤还是加权采样
硬阈值简单,却让 0.79 和 0.80 的样本待遇完全不同,也可能损失多样性。分桶采样可让高分样本多出现、低分样本少量保留,例如高/中/低按 60/35/5 消费;平滑权重则避免边界突变。严重风险仍应独立拒绝。
若高质量池只有 100B Token,却计划消费 500B,高权重会造成平均 5 次重复。此时应提高中等质量比例或扩充数据,而不是无限重复“最好”的小池。评分必须与去重和唯一 Token 容量一起设计。
七、怎样证明分数与训练价值相关
抽取高、中、低分桶,在相同 Token 和训练配置下训练代理模型;比较 validation loss、知识、代码、多语、安全和记忆指标。如果高分桶只提升分类器偏爱的文风,却伤害其他领域,评分目标存在偏差。还应与随机过滤和简单规则基线比较。
例如保留 70% 数据后,Token 吞吐提高 10%,通用分数 +1.5,但低资源语言 -6,不能直接上线。可调整该语言阈值或为各桶设最低配额。质量方案的验收对象是最终能力—成本曲线,不是分类器离线准确率。
八、常见误区与追问
- 误区:困惑度越低,数据质量越高。 极低可能是重复模板,高值也可能是专业或低资源内容。
- 误区:一个分类器可以跨所有语言与领域。 评分尺度会漂移,应路由或分桶校准。
- 误区:高质量数据越纯越好。 过度净化会损失文体、多样性和真实噪声鲁棒性。
- 追问:来源信誉能否直接决定质量? 只能作为特征,可靠站点也有模板,未知来源也可能有独特知识。
- 追问:如何处理边界样本? 用平滑权重、人工抽检和可逆隔离,不要立即永久删除。
- 追问:最重要的最终验证是什么? 在相同 Token/算力下训练模型,检查全维能力与风险,而非只看数据分数。
九、加强记忆
质量评分可记成“目标、分层、多维、校准、训练验证”:先由能力目标定义质量;硬风险与软价值分层;保留多维特征而非黑盒总分;按语言领域校准并抽检;最后用等预算训练证明价值。评分器是数据决策工具,不是真理裁判,必须可解释、可回滚、可审计。