量化模型应该如何评估?为什么只看困惑度不够?
简化版
量化评估要同时看通用指标、目标任务、长上下文、格式稳定性、人工偏好和线上延迟成本。困惑度能反映语言建模损失,但不能完整代表问答、代码、工具调用、安全边界和业务体验。
详细版
- PPL 适合快速发现严重退化,但和真实任务质量不完全一致。
- 要比较 FP16 基线、不同量化位宽和不同运行时配置。
- 评测集应覆盖业务高频输入、长尾难例和安全拒答。
- 量化可能改变格式遵循、数值推理和长上下文能力。
- 上线后还要监控延迟、显存、吞吐、错误类型和用户反馈。
完整版教学
这道题考察候选人是否能建立生产级模型压缩验收体系。
一、这题真正考什么
这道题考察候选人是否能建立生产级模型压缩验收体系。
面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。
二、核心机制怎么工作
量化是质量、成本和速度的交易。PPL 只衡量下一个 token 概率的平均变化,无法告诉你模型是否正确调用工具、是否漏掉表格字段、是否在医学问题上过度自信。因此评估要分层:离线基准、业务集、人工审查和线上 A/B。
需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。
三、带数字的拆解
某 4bit 模型 PPL 只比 FP16 差 3%,但在 200 条 JSON 输出任务中格式错误从 2 条升到 18 条。对于结构化业务,这种模型可能不能上线,哪怕 PPL 看起来很好。
这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。
相对退化 = (量化指标 - FP16 指标) / FP16 指标
上线价值 = 成本下降 + 延迟下降 - 质量损失 - 运维复杂度
验收集 = 通用能力 + 业务高频 + 边界安全 + 长上下文
四、流程图和工程落点
可以把它拆成下面这条链路来讲:
建立 FP16 基线
|
运行 PPL 和公开 benchmark
|
跑业务评测集
|
人工错误分析
|
压测延迟和吞吐
|
灰度上线监控
工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。
五、和相近方案怎么区分
| 指标 | 能看什么 | 看不到什么 |
|---|---|---|
| PPL | 语言建模退化 | 任务是否完成 |
| Benchmark | 通用能力 | 业务特殊格式 |
| 人工评审 | 可用性和风险 | 规模有限 |
| 线上 A/B | 真实体验 | 需要流量和回滚机制 |
面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。
六、上线或训练时最容易踩的坑
- 不要只在短文本上评估,KV、长上下文和多轮任务可能暴露新问题。
- 不同推理引擎的量化 kernel 可能让同一权重表现不同。
- 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
- 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。
七、常见误区与追问
- 误区:PPL 下降很小就一定可以上线。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:公开 benchmark 高就代表业务好。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:量化评估只需要离线跑一次。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 追问:如何设计量化模型的回归测试集? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:为什么格式遵循会被量化影响? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:上线后应该监控哪些质量信号? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
八、加强记忆
记住“PPL 是体检的一项,不是全部诊断”。量化验收要同时看质量、成本、延迟和业务风险。
复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。