跳转至

二十:模型压缩:GPTQ、AWQ、剪枝与蒸馏自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484171&idx=1&sn=6de0e520cc8f4de79dfbc77cbd1139c3&chksm=f01eb072c7693964bd11aa195a2dc849594dc9ee5dfdce8fe12433141b0f7537fb7a961edaec#rd

覆盖范围

  • 4-bit weight-only PTQ

  • GPTQ 的二阶近似、Hessian、误差补偿

  • AWQ 的 activation-aware、salient weights、scaling

  • GPTQ/AWQ 与 LLM.int8()/SmoothQuant/NF4 的对比

  • 剪枝、蒸馏、组合压缩

  • 部署指标、kernel、校准和工程排错

一、Weight-only 4-bit PTQ

  • 什么是 weight-only quantization?

  • 4-bit weight-only PTQ 相比 INT8 量化主要优势是什么?

  • weight-only 量化中 activation 通常是什么精度?

  • weight-only 量化为什么能降低内存带宽压力?

  • 4-bit 量化为什么比 8-bit 更容易损失精度?

  • 什么是 packed int4 weight?

  • group-wise quantization 在 4-bit 中为什么常见?

  • group size 变小和变大分别有什么影响?

  • 为什么 weight-only 量化不一定带来完整 INT4 计算加速?

  • GPTQ 和 AWQ 为什么都属于 PTQ?

二、GPTQ 基础

  • GPTQ 的全称是什么?它主要解决什么问题?

  • GPTQ 和 naive round-to-nearest 量化有什么区别?

  • GPTQ 与 OBQ 有什么关系?

  • GPTQ 的优化目标可以如何写成输出误差最小化?

  • 为什么 GPTQ 需要校准数据?

  • GPTQ 中 Hessian 近似通常来自什么?

  • H ≈ X^T X 的直觉含义是什么?

  • 为什么二阶信息能帮助判断权重量化敏感性?

  • GPTQ 中 damping 的作用是什么?

  • GPTQ 为什么通常逐层量化?

三、GPTQ 误差补偿与实现

  • GPTQ 中量化一个权重后为什么要补偿剩余权重?

  • 什么是 quantization error compensation?

  • GPTQ 的基本量化流程是什么?

  • GPTQ 中 act-order 或 desc_act 的作用是什么?

  • GPTQ 中对称/非对称量化如何影响精度和实现?

  • GPTQ 中 group size 对 scale 元数据有什么影响?

  • GPTQ 量化过程为什么比 AWQ 更重?

  • GPTQ 对校准集大小和序列长度为什么敏感?

  • GPTQ 的主要优点是什么?

  • GPTQ 的主要局限是什么?

四、AWQ 基础

  • AWQ 的全称是什么?

  • AWQ 的核心观察是什么?

  • 什么是 salient weights?

  • AWQ 为什么说“不是所有权重同等重要”?

  • AWQ 为什么使用 activation 统计来判断权重重要性?

  • AWQ 是否需要 Hessian?这带来什么优势?

  • AWQ 的 scaling 思想是什么?

  • 请写出 AWQ 等价缩放的直觉公式。

  • AWQ 和 SmoothQuant 的 scaling 思路有什么相似点?

  • AWQ 和 SmoothQuant 的目标有什么不同?

五、AWQ 流程与优缺点

  • AWQ 的基本量化流程是什么?

  • AWQ 中 calibration data 起什么作用?

  • AWQ 为什么通常比 GPTQ 量化速度更快?

  • AWQ 对 instruction-tuned 或 multimodal 模型为什么可能更友好?

  • AWQ 的主要优点是什么?

  • AWQ 的主要局限是什么?

  • AWQ 中 scaling 搜索如果不合适会发生什么?

  • AWQ 和 GPTQ 在部署 kernel 上有什么共同依赖?

  • AWQ 和 GPTQ 在 4-bit 推理中的显存收益主要来自哪里?

  • AWQ 和 GPTQ 谁一定更好?为什么不能绝对判断?

六、方法对比与选型

  • GPTQ 和 AWQ 在核心思想上有什么区别?

  • GPTQ 和 AWQ 在校准信息使用上有什么区别?

  • GPTQ 和 AWQ 在量化成本上有什么区别?

  • GPTQ/AWQ 与 LLM.int8() 有什么区别?

  • GPTQ/AWQ 与 SmoothQuant 有什么区别?

  • GPTQ/AWQ 与 NF4/QLoRA 有什么区别?

  • 如果目标是最低显存推理,你会优先考虑哪些方法?

  • 如果目标是 INT8 GEMM 加速,你会优先考虑哪些方法?

  • 如果目标是低显存微调,你会优先考虑哪些方法?

  • 选择 GPTQ/AWQ 时应该评估哪些任务指标?

七、剪枝与蒸馏

  • 什么是模型剪枝?

  • unstructured pruning 和 structured pruning 有什么区别?

  • semi-structured pruning 是什么?举例说明。

  • 为什么 structured pruning 更容易获得真实推理加速?

  • 剪枝重要性指标有哪些?

  • 剪枝后为什么常需要 fine-tuning 或 distillation?

  • 什么是知识蒸馏?

  • logits distillation 和 hidden states distillation 有什么区别?

  • sequence-level distillation 在 LLM 中如何使用?

  • 请完整设计一个“量化 + 剪枝 + 蒸馏”的模型压缩方案,并说明评估指标。

            预览时标签不可点
    

    <div class="