模型压缩与量化面试题25 题
- 01 大模型推理中 Weight-only、W8A8 和 FP8 量化有什么区别?如何选型?
- 02 大模型知识蒸馏是什么?学生模型如何学到教师模型能力?
- 03 结构化剪枝和非结构化剪枝有什么区别?
- 04 量化模型应该如何评估?为什么只看困惑度不够?
- 05 量化校准数据应该如何选择?为什么会影响模型精度?
- 06 权重量化和激活量化有什么区别?
- 07 GGUF 和 llama.cpp 量化格式是什么?部署时如何选择?
- 08 QAT 和 PTQ 有什么区别?
- 09 大模型剪枝和稀疏化有什么区别?为什么结构化稀疏更容易加速?
- 10 什么是大模型量化?INT8、INT4 和 GPTQ、AWQ 有什么区别?
- 11 知识蒸馏的数据如何设计?
- 12 AWQ 的原理是什么?它和 GPTQ 有什么区别?
- 13 GPTQ 的原理是什么?为什么能做低比特权重量化?
- 14 KV Cache 量化有什么收益和风险?
- 15 SmoothQuant 如何解决激活量化难题?为什么适合 W8A8?
- 16 低比特量化为什么容易损伤长尾能力?
- 17 量化中的异常通道为什么难处理?
- 18 推测解码和模型蒸馏有什么区别?
- 19 知识蒸馏中的 temperature 有什么作用?
- 20 PTQ 校准集需要多大?如何选样本?
- 21 混合精度推理如何选择不同层的精度?
- 22 量化上线前回归测试应该覆盖什么?
- 23 模型压缩为什么要考虑硬件支持?
- 24 蒸馏中教师和学生差距过大会怎样?
- 25 Adapter 能否剪枝?适合什么场景?
没有符合条件的题目。