二十:模型压缩:GPTQ、AWQ、剪枝与蒸馏自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484171&idx=1&sn=6de0e520cc8f4de79dfbc77cbd1139c3&chksm=f01eb072c7693964bd11aa195a2dc849594dc9ee5dfdce8fe12433141b0f7537fb7a961edaec#rd
覆盖范围¶
-
4-bit weight-only PTQ
-
GPTQ 的二阶近似、Hessian、误差补偿
-
AWQ 的 activation-aware、salient weights、scaling
-
GPTQ/AWQ 与 LLM.int8()/SmoothQuant/NF4 的对比
-
剪枝、蒸馏、组合压缩
-
部署指标、kernel、校准和工程排错
一、Weight-only 4-bit PTQ¶
-
什么是 weight-only quantization?
-
4-bit weight-only PTQ 相比 INT8 量化主要优势是什么?
-
weight-only 量化中 activation 通常是什么精度?
-
weight-only 量化为什么能降低内存带宽压力?
-
4-bit 量化为什么比 8-bit 更容易损失精度?
-
什么是 packed int4 weight?
-
group-wise quantization 在 4-bit 中为什么常见?
-
group size 变小和变大分别有什么影响?
-
为什么 weight-only 量化不一定带来完整 INT4 计算加速?
-
GPTQ 和 AWQ 为什么都属于 PTQ?
二、GPTQ 基础¶
-
GPTQ 的全称是什么?它主要解决什么问题?
-
GPTQ 和 naive round-to-nearest 量化有什么区别?
-
GPTQ 与 OBQ 有什么关系?
-
GPTQ 的优化目标可以如何写成输出误差最小化?
-
为什么 GPTQ 需要校准数据?
-
GPTQ 中 Hessian 近似通常来自什么?
-
H ≈ X^T X的直觉含义是什么? -
为什么二阶信息能帮助判断权重量化敏感性?
-
GPTQ 中 damping 的作用是什么?
-
GPTQ 为什么通常逐层量化?
三、GPTQ 误差补偿与实现¶
-
GPTQ 中量化一个权重后为什么要补偿剩余权重?
-
什么是 quantization error compensation?
-
GPTQ 的基本量化流程是什么?
-
GPTQ 中 act-order 或 desc_act 的作用是什么?
-
GPTQ 中对称/非对称量化如何影响精度和实现?
-
GPTQ 中 group size 对 scale 元数据有什么影响?
-
GPTQ 量化过程为什么比 AWQ 更重?
-
GPTQ 对校准集大小和序列长度为什么敏感?
-
GPTQ 的主要优点是什么?
-
GPTQ 的主要局限是什么?
四、AWQ 基础¶
-
AWQ 的全称是什么?
-
AWQ 的核心观察是什么?
-
什么是 salient weights?
-
AWQ 为什么说“不是所有权重同等重要”?
-
AWQ 为什么使用 activation 统计来判断权重重要性?
-
AWQ 是否需要 Hessian?这带来什么优势?
-
AWQ 的 scaling 思想是什么?
-
请写出 AWQ 等价缩放的直觉公式。
-
AWQ 和 SmoothQuant 的 scaling 思路有什么相似点?
-
AWQ 和 SmoothQuant 的目标有什么不同?
五、AWQ 流程与优缺点¶
-
AWQ 的基本量化流程是什么?
-
AWQ 中 calibration data 起什么作用?
-
AWQ 为什么通常比 GPTQ 量化速度更快?
-
AWQ 对 instruction-tuned 或 multimodal 模型为什么可能更友好?
-
AWQ 的主要优点是什么?
-
AWQ 的主要局限是什么?
-
AWQ 中 scaling 搜索如果不合适会发生什么?
-
AWQ 和 GPTQ 在部署 kernel 上有什么共同依赖?
-
AWQ 和 GPTQ 在 4-bit 推理中的显存收益主要来自哪里?
-
AWQ 和 GPTQ 谁一定更好?为什么不能绝对判断?
六、方法对比与选型¶
-
GPTQ 和 AWQ 在核心思想上有什么区别?
-
GPTQ 和 AWQ 在校准信息使用上有什么区别?
-
GPTQ 和 AWQ 在量化成本上有什么区别?
-
GPTQ/AWQ 与 LLM.int8() 有什么区别?
-
GPTQ/AWQ 与 SmoothQuant 有什么区别?
-
GPTQ/AWQ 与 NF4/QLoRA 有什么区别?
-
如果目标是最低显存推理,你会优先考虑哪些方法?
-
如果目标是 INT8 GEMM 加速,你会优先考虑哪些方法?
-
如果目标是低显存微调,你会优先考虑哪些方法?
-
选择 GPTQ/AWQ 时应该评估哪些任务指标?
七、剪枝与蒸馏¶
-
什么是模型剪枝?
-
unstructured pruning 和 structured pruning 有什么区别?
-
semi-structured pruning 是什么?举例说明。
-
为什么 structured pruning 更容易获得真实推理加速?
-
剪枝重要性指标有哪些?
-
剪枝后为什么常需要 fine-tuning 或 distillation?
-
什么是知识蒸馏?
-
logits distillation 和 hidden states distillation 有什么区别?
-
sequence-level distillation 在 LLM 中如何使用?
-
请完整设计一个“量化 + 剪枝 + 蒸馏”的模型压缩方案,并说明评估指标。
预览时标签不可点<div class="