预训练与 Scaling Law 面试题25 题
- 01 大模型的预训练、指令微调和对齐分别解决什么问题?
- 02 大模型的预训练数据是怎么处理的?为什么去重和质量过滤这么重要?
- 03 大模型训练为什么要学习率预热(warmup)和余弦衰减?
- 04 大模型预训练的目标是什么?为什么是「预测下一个 token」?
- 05 大模型预训练如何做 Checkpoint 和断点恢复?
- 06 大模型预训练为什么要做数据去重?
- 07 混合精度训练是什么?为什么大模型偏爱 BF16 而不是 FP16?
- 08 什么是大模型的「涌现能力」?它真的存在吗?
- 09 什么是梯度检查点(激活重计算)?它如何用时间换显存?
- 10 分布式训练的数据并行、张量并行、流水线并行有什么区别?
- 11 如何估算大模型训练的算力和显存?6ND 法则是什么?
- 12 什么是 Scaling Law?Chinchilla 给出了什么结论?
- 13 预训练数据配比如何影响模型能力?
- 14 预训练中 Loss Spike 可能是什么原因?
- 15 ZeRO 和 FSDP 是什么?它们如何降低训练显存?
- 16 大模型预训练 Batch Size 如何影响收敛?
- 17 继续预训练和领域微调有什么区别?
- 18 预训练前为什么要训练 Tokenizer?
- 19 预训练数据质量评分如何设计?
- 20 Gradient Noise Scale 在预训练中有什么意义?
- 21 大模型预训练如何评估能耗和成本?
- 22 预训练过程中如何评估 checkpoint?
- 23 预训练集群故障后如何恢复?
- 24 预训练数据课程学习是否有用?
- 25 预训练数据污染如何检查?
没有符合条件的题目。