← 返回题目列表

AWQ 的原理是什么?它和 GPTQ 有什么区别?

高频 困难 第 12 / 25 题 更新于 2026/07/28
模型压缩AWQ权重量化PTQ推理部署

简化版

AWQ 是 Activation-aware Weight Quantization,它发现少量对激活特别重要的权重通道对模型质量影响很大,于是通过缩放保护这些通道,再做低比特权重量化。相比 GPTQ 的二阶误差补偿,AWQ 更强调激活感知和部署效率。

详细版

  • AWQ 认为不是所有权重同等重要,关键通道需要被保护。
  • 它用校准激活寻找对输出敏感的权重通道。
  • 通过 scale 调整权重和激活分布,让重要权重量化误差更小。
  • AWQ 通常适合 4bit 权重量化和高效推理 kernel。
  • 和 GPTQ 一样属于训练后量化,但优化目标和实现路径不同。

完整版教学

这道题考察候选人是否能比较主流 LLM 低比特量化方案,而不是只背名词。

一、这题真正考什么

这道题考察候选人是否能比较主流 LLM 低比特量化方案,而不是只背名词。

面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。

二、核心机制怎么工作

AWQ 的核心观察是:保护少数显著通道,往往比平均照顾所有权重更有效。它基于校准数据统计激活大小,找到更影响输出的通道,然后用缩放因子把权重量化误差转移到模型更能承受的位置。

需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。

三、带数字的拆解

在一个线性层中,若 1% 的通道承担了主要激活贡献,把这些通道直接粗暴量化可能造成输出明显偏移。AWQ 会先调整 scale,使这些通道在 4bit 网格中保留更多有效信息。

这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。

线性层输出:Y = XW
缩放后等价形式:Y = (XS) (S^-1 W)
选择 S 的目标是在保持输出近似的同时降低重要权重量化误差

四、流程图和工程落点

可以把它拆成下面这条链路来讲:

校准样本前向
   |
统计激活通道重要性
   |
搜索缩放因子
   |
保护关键权重通道
   |
执行低比特量化
   |
使用匹配 kernel 推理

工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。

五、和相近方案怎么区分

维度AWQGPTQ
核心思想保护激活重要通道二阶误差补偿
校准数据需要需要
部署侧常强调高效 kernel格式生态较多
调参重点scale 搜索和 groupgroup、act-order、damp

面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。

六、上线或训练时最容易踩的坑

  • AWQ 的质量优势依赖校准样本能代表真实激活分布。
  • 只下载 AWQ 权重不代表一定快,推理框架和 kernel 支持同样关键。
  • 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
  • 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。

七、常见误区与追问

  • 误区:AWQ 和 GPTQ 只是文件格式不同。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:保护少数通道会让其他通道完全不重要。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 误区:AWQ 不需要校准数据。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
  • 追问:AWQ 为什么叫 activation-aware? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:AWQ 适合和 LoRA 合并后的模型一起用吗? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
  • 追问:如何在 AWQ 和 FP16 之间做质量验收? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。

八、加强记忆

记住“AWQ 先找关键通道,再保护它们量化”。GPTQ 像算误差账,AWQ 像给重要通道加保护垫。

复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。