← 返回题目列表

预训练数据配比如何影响模型能力?

中等 第 19 / 25 题 更新于 2026/09/18
大模型预训练数据配比SamplingScaling Law

简化版

数据配比决定每类语料在训练损失中的隐式权重,因此会直接塑造语言、代码、数学、知识和安全能力。不能简单按原始数据量采样:高资源网页会淹没高价值小领域,过度上采样又会造成重复和过拟合。通常先清洗分桶,再用温度采样设初始比例,通过小规模代理实验和在线 loss/梯度监控迭代。

详细版

若数据源 i 的原始占比为 p_i,温度采样可设 q_i ∝ p_i^αα<1 会压平分布、提升低资源源;例如占比 90% 与 10% 的两源在 α=0.5 后约变为 75% 与 25%。配比还应结合质量分、Token 唯一率、许可证和目标能力,而不是只看体量。

实验上用多个较小模型跑候选 mixture,保持总 Token、Tokenizer 和优化设置一致,追踪各域验证 loss、下游任务与重复曝光次数。正式训练中可采用阶段性配比:早期广覆盖,后期提高代码、数学或目标领域,但要用通用能力回归和 replay 防止能力偏移。配比、数据版本和每源实际消费 Token 都必须可审计。

原始数据量 -> 清洗后有效量 -> 质量/目标权重 -> 采样分布 -> 实际消费 Token -> 能力评测

完整版教学

一、配比为什么等于训练目标权重

预训练损失是所抽样 Token 损失的平均。某数据源被抽到的概率越高,它对梯度方向的贡献通常越大。因此 mixture 不是数据加载细节,而是在决定模型优先拟合什么分布。网页占绝对多数时,模型可能通用对话不错,却缺乏代码和数学能力。

同一来源内部质量也不均匀。大量低质 SEO 文本即使属于“中文”桶,也不应与专业书籍等权。合理设计先定义能力目标,再把语言、领域、质量和风险维度映射为可测的采样策略。

二、自然分布为何通常不可直接使用

互联网原始分布受爬取便利、站点重复和语言资源规模影响,不等于用户任务分布。高资源英语网页可能占 90%,而代码、数学证明和低资源语言总共只占很小比例。按原始量采样会让稀缺但高价值数据几乎不产生梯度。

反过来把小数据源硬提到很高比例,会让同一文档重复出现。若某领域只有 10 亿唯一 Token,却计划训练消费 100 亿 Token,相当于平均 10 个 epoch,记忆和过拟合风险上升。因此比例必须同时看“抽多少”和“有多少独特内容可抽”。

三、温度采样怎样压平分布

常用公式为:

q_i = p_i^α / Σ_j p_j^α

α=1 保持原占比,α=0 让各桶等概率,介于二者之间则温和上采样小桶。若 A/B/C 原比例为 0.81/0.16/0.03,取 α=0.5 后开方并归一化,约变为 0.61/0.27/0.12;C 提升四倍,但不会与 A 完全相同。

记忆钩子:温度指数小于 1 是“削峰填谷”,但它只重排数量,不会自动识别质量;垃圾小桶被上采样仍然是更多垃圾。

四、质量权重如何加入

可在温度权重之外乘以质量系数、目标重要度和安全系数,再归一化。质量来自规则、分类器或人工标注,但分类器偏差会让某些文风被系统性降权。最好保留每个分数的来源,并检查各语言和领域的保留率。

因素提高比例的理由需要防范
高质量教材知识密度高版权与风格单一
代码提升生成与推理重复仓库、许可证
数学强化结构推理格式解析错误
低资源语言改善公平覆盖过度重复
对话数据接近交互形式预训练阶段占比过高会变风格

低质数据不一定全部删除,真实噪声有时提高鲁棒性;关键是让它不主导梯度。

五、如何用代理实验选比例

直接用最终规模穷举配比太贵。可训练 100M~1B 参数代理模型,扫描若干候选比例,在相同 Token 预算下比较各域 validation loss 与任务分数。代理结论不保证完全外推,因此应关注稳定方向和 Pareto 前沿,而非小数点级排名。

例如三组实验把代码比例设为 5%、15%、30%。结果显示代码题从 38 升到 55 再到 58,但通用知识从 70 降到 69 再到 63,则 15% 可能是更平衡起点。还应测每源 Token 重复次数,避免 30% 的提升来自背训练集。

六、静态与阶段性配比

静态 mixture 简单且训练分布稳定。阶段性策略可在早期广泛学习语言和世界知识,后期提高高质量、代码或数学数据,类似 data annealing。后期数据对最终参数影响更直接,但切换过猛会引起 loss 跳变和通用能力遗忘。

课程变化应平滑,并保留一部分通用 replay。每次调整记录 step 和目标比例,同时观察分域 loss、梯度范数和下游能力。若某域 loss 下降却其他域快速恶化,应回退或降低变化速率。

七、训练中如何监控实际配比

配置比例不等于实际消费比例:坏文件重试、长度过滤、packing 和 worker 故障都会造成偏差。数据加载器应按源统计样本数、有效 Token、丢弃率、重复 epoch 和等待时间。监控以 Token 为主,因为一篇长文与一条短评论对训练贡献差异很大。

模型侧同时看分域验证 loss 和梯度冲突。若目标桶占比提高却 loss 不降,可能是数据质量、Tokenizer 效率或容量不足,而不是继续加量就能解决。线上仪表盘要把数据版本、预期比例和实际比例关联起来。

八、常见误区与追问

  • 误区:最大数据源应该占最大训练比例。 原始规模反映可获取性,不一定反映质量和目标价值。
  • 误区:低资源数据上采样没有代价。 唯一 Token 有限时会增加重复曝光和记忆。
  • 误区:配置文件写 20% 就实际训练了 20%。 过滤、packing 和读取失败会改变真实 Token 占比。
  • 追问:温度 α 怎么选? 用目标能力、重复率和代理实验扫描,而不是套固定常数。
  • 追问:配比能在训练后修复吗? 继续预训练可调整部分能力,但可能遗忘且成本高,早期设计仍重要。
  • 追问:如何避免领域增强伤通用能力? 混入通用 replay、平滑调度,并设通用回归门槛。

九、加强记忆

数据配比可记成“目标定桶、温度调量、质量加权、小模试验、全程记账”。先承认采样概率就是损失权重,再用 p^α 理解低资源上采样,结合唯一 Token 控制重复;通过代理模型找 Pareto 点,并在正式训练记录实际消费与分域能力。配比没有脱离业务目标的万能答案,只有可验证的权衡。