量化校准数据应该如何选择?为什么会影响模型精度?
简化版
量化校准数据用于估计权重或激活的数值范围、scale、zero point 和重要通道。如果校准数据和真实业务分布差异很大,量化参数会偏,模型在上线任务上的精度和稳定性就会下降。
详细版
- PTQ 通常依赖少量校准样本,不需要完整训练集。
- 校准样本要覆盖真实输入长度、语言、格式、领域和边界情况。
- 激活量化对校准分布更敏感,因为激活随输入变化。
- 校准集不是评测集,二者应该分离。
- 需要比较困惑度、任务指标和人工错误类型,而不是只看单一数字。
完整版教学
这道题考察候选人是否理解量化质量不是算法单独决定的,数据分布同样关键。
一、这题真正考什么
这道题考察候选人是否理解量化质量不是算法单独决定的,数据分布同样关键。
面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。
二、核心机制怎么工作
量化要把连续值映射到有限整数网格。校准数据决定系统观察到的最大值、分位数、通道重要性和 outlier 分布,从而影响 scale 的选择。若校准集只包含短英文,而线上是长中文表格问答,激活范围可能完全不同。
需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。
三、带数字的拆解
准备用 128 条样本校准一个客服模型。若 120 条都是闲聊,只有 8 条包含订单表格,那么量化后在表格问答上可能频繁丢字段。更合理的做法是按线上流量配比抽样,并额外加入高风险边界样本。
这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。
对称量化:scale = max(abs(x)) / (2^(b-1)-1)
非对称量化:scale = (x_max - x_min) / (2^b - 1)
校准误差来源 = 分布偏移 + outlier 处理 + 样本覆盖不足
四、流程图和工程落点
可以把它拆成下面这条链路来讲:
分析线上请求分布
|
抽取代表性样本
|
加入长尾和边界样本
|
运行校准
|
量化模型
|
独立评测集验收
工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。
五、和相近方案怎么区分
| 数据类型 | 用途 | 注意点 |
|---|---|---|
| 校准集 | 估计量化参数 | 小而代表性 |
| 评测集 | 衡量质量 | 不能参与校准调参过度 |
| 训练集 | 学习参数 | PTQ 通常不用完整训练 |
| 线上样本 | 分布参考 | 需脱敏和合规 |
面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。
六、上线或训练时最容易踩的坑
- 不要用评测集反复挑量化参数,否则会过拟合评测。
- 短 prompt 校准出的参数,不一定适合长上下文 decode。
- 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
- 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。
七、常见误区与追问
- 误区:校准数据越多越一定好。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:校准集可以随便选几段维基百科。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:只量化权重就完全不需要数据。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 追问:为什么激活量化比权重量化更依赖校准? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:校准样本数量通常如何权衡? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:如何发现校准集和线上分布不一致? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
八、加强记忆
记住“量化是在给数值尺子定刻度,校准数据决定尺子看过什么”。尺子没见过线上形态,刻度就可能不合适。
复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。