← 返回题目列表

量化校准数据应该如何选择?为什么会影响模型精度?

高频 中等 第 5 / 25 题 更新于 2026/07/28
模型压缩量化校准PTQ评测数据分布

简化版

量化校准数据用于估计权重或激活的数值范围、scale、zero point 和重要通道。如果校准数据和真实业务分布差异很大,量化参数会偏,模型在上线任务上的精度和稳定性就会下降。

详细版

  • PTQ 通常依赖少量校准样本,不需要完整训练集。
  • 校准样本要覆盖真实输入长度、语言、格式、领域和边界情况。
  • 激活量化对校准分布更敏感,因为激活随输入变化。
  • 校准集不是评测集,二者应该分离。
  • 需要比较困惑度、任务指标和人工错误类型,而不是只看单一数字。

完整版教学

这道题考察候选人是否理解量化质量不是算法单独决定的,数据分布同样关键。

一、这题真正考什么

这道题考察候选人是否理解量化质量不是算法单独决定的,数据分布同样关键。

面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。

二、核心机制怎么工作

量化要把连续值映射到有限整数网格。校准数据决定系统观察到的最大值、分位数、通道重要性和 outlier 分布,从而影响 scale 的选择。若校准集只包含短英文,而线上是长中文表格问答,激活范围可能完全不同。

需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。

三、带数字的拆解

准备用 128 条样本校准一个客服模型。若 120 条都是闲聊,只有 8 条包含订单表格,那么量化后在表格问答上可能频繁丢字段。更合理的做法是按线上流量配比抽样,并额外加入高风险边界样本。

这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。

对称量化:scale = max(abs(x)) / (2^(b-1)-1)
非对称量化:scale = (x_max - x_min) / (2^b - 1)
校准误差来源 = 分布偏移 + outlier 处理 + 样本覆盖不足

四、流程图和工程落点

可以把它拆成下面这条链路来讲:

分析线上请求分布
   |
抽取代表性样本
   |
加入长尾和边界样本
   |
运行校准
   |
量化模型
   |
独立评测集验收

工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。

五、和相近方案怎么区分

数据类型用途注意点
校准集估计量化参数小而代表性
评测集衡量质量不能参与校准调参过度
训练集学习参数PTQ 通常不用完整训练
线上样本分布参考需脱敏和合规

面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。

六、上线或训练时最容易踩的坑

  • 不要用评测集反复挑量化参数,否则会过拟合评测。
  • 短 prompt 校准出的参数,不一定适合长上下文 decode。
  • 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
  • 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。

七、常见误区与追问

  • 误区:校准数据越多越一定好。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:校准集可以随便选几段维基百科。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:只量化权重就完全不需要数据。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 追问:为什么激活量化比权重量化更依赖校准? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:校准样本数量通常如何权衡? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:如何发现校准集和线上分布不一致? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。

八、加强记忆

记住“量化是在给数值尺子定刻度,校准数据决定尺子看过什么”。尺子没见过线上形态,刻度就可能不合适。

复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。