十七:强化学习:DAPO、GSPO 与 SAPO自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484112&idx=1&sn=c01f41064bb5039cdc2f8e262fe3f87f&chksm=f01eb1a9c76938bf2a26cbfe0f6ae4e754004249f49d95d59ad69d0f74fd4458c7f33fb8b7ae#rd
覆盖范围¶
-
GRPO 的问题与改进动机
-
DAPO 的四个关键技术
-
Clip-Higher、Dynamic Sampling、Token-Level Policy Gradient Loss、Overlong Reward Shaping
-
GSPO 的 sequence-level ratio、sequence-level clipping 与 MoE 稳定性
-
SAPO 的 soft adaptive gate、sequence-coherent、token-adaptive
-
DAPO/GSPO/SAPO 与 GRPO、PPO 的系统对比
-
大模型推理 RL 的工程监控与排错
一、GRPO 改进背景¶
-
GRPO 的核心思想是什么?
-
GRPO 为什么能省掉 value model 或 critic?
-
GRPO 中 group-relative advantage 如何计算?
-
为什么同一 prompt 的一组回答全对或全错会导致学习信号弱?
-
GRPO 中 token-level importance ratio 可能带来什么不稳定?
-
大模型推理 RL 为什么特别关注 response length?
-
为什么可验证任务适合 GRPO/DAPO 这类方法?
-
DAPO、GSPO、SAPO 共同想解决什么问题?
二、DAPO 总体框架¶
-
DAPO 的全称是什么?
-
DAPO 相比 GRPO 主要增加了哪四个关键技术?
-
DAPO 为什么被看作大规模 LLM RL 系统,而不只是单个 loss?
-
DAPO 适合哪些任务场景?
-
DAPO 的 reward 通常可以来自哪些来源?
-
DAPO 为什么强调开源和可复现训练细节?
-
DAPO 的训练流程可以如何概括?
-
DAPO 与 RLHF-PPO 在是否需要 critic 上有什么区别?
三、Clip-Higher 与 Dynamic Sampling¶
-
传统 PPO/GRPO clipping 的基本形式是什么?
-
Clip-Higher 的核心思想是什么?
-
为什么提高上裁剪阈值可能缓解 entropy collapse?
-
Clip-Higher 是否意味着取消 clipping?为什么?
-
Dynamic Sampling 解决什么问题?
-
什么样的 prompt 在 GRPO/DAPO 中可能产生 zero advantage?
-
Dynamic Sampling 为什么能提高有效梯度密度?
-
Dynamic Sampling 是否可能引入数据分布偏差?
-
如果训练中 zero-advantage prompt 比例很高,应该如何处理?
-
Clip-Higher 和 Dynamic Sampling 分别作用在训练的哪个环节?
四、Token-Level Loss 与 Overlong Reward Shaping¶
-
DAPO 中 Token-Level Policy Gradient Loss 的直觉是什么?
-
token-level 聚合和 response-level 平均有什么区别?
-
Token-Level Policy Gradient Loss 为什么适合长链式推理?
-
如果每条 response 等权平均,可能带来什么长度相关问题?
-
Overlong Reward Shaping 解决什么问题?
-
为什么只对超长回答做硬惩罚可能不好?
-
Overlong Reward Shaping 可以如何设计?
-
过长惩罚如果太强,会有什么副作用?
-
过长惩罚如果太弱,会有什么副作用?
-
DAPO 中哪些指标可以帮助诊断长度问题?
五、GSPO 基础¶
-
GSPO 的全称是什么?
-
GSPO 相比 GRPO 的核心变化是什么?
-
什么是 token-level ratio?
-
什么是 sequence-level ratio?
-
为什么 sequence-level ratio 常需要长度归一化?
-
GSPO 为什么更符合文本生成的 sequence-level reward?
-
token-level clipping 在同一条回答中可能产生什么不一致?
-
GSPO 如何改善这种不一致?
-
GSPO 为什么被认为有助于 MoE 模型 RL 稳定?
-
GSPO 与 DAPO 的关注点有什么不同?
六、SAPO 基础¶
-
SAPO 的全称是什么?
-
SAPO 想解决 hard clipping 的什么问题?
-
SAPO 中 soft adaptive gate 的直觉是什么?
-
温度参数在 soft gate 中通常控制什么?
-
SAPO 为什么被称为 sequence-coherent?
-
SAPO 为什么被称为 token-adaptive?
-
当一条序列只有少数 token 高度 off-policy 时,GSPO 和 SAPO 可能如何不同?
-
SAPO 相比 GRPO 的改进点是什么?
-
SAPO 相比 GSPO 的改进点是什么?
-
SAPO 新增了哪些工程复杂度?
七、对比、指标与排错¶
-
请比较 GRPO、DAPO、GSPO、SAPO 的核心优化对象。
-
请比较 DAPO、GSPO、SAPO 分别主要解决什么训练问题。
-
什么是 ratio 分布?为什么要监控它?
-
什么是 clip fraction 或 gate weight distribution?它们说明什么?
-
为什么 policy entropy 是大模型 RL 的重要指标?
-
如果训练 reward 上升但 KL 也快速上升,说明什么?
-
如果 response length 快速变长,可能是什么原因?
-
如果 group reward std 长期接近 0,应该如何排查?
-
如果 DAPO 训练中有效 batch 数不足,可能是什么原因?
-
如果 GSPO 训练中过多序列被裁剪,可能如何处理?
八、综合设计与面试追问¶
-
请设计一个基于 DAPO 的数学推理 RL 训练流程。
-
请设计一个从 GRPO 改成 GSPO 的核心代码改动思路。
-
请设计一个从 GSPO 改成 SAPO 的核心改动思路。
-
请完整比较 PPO、GRPO、DAPO、GSPO、SAPO 在数据、优势估计、ratio 粒度、裁剪方式、优缺点和适用场景上的差异。
预览时标签不可点<div class="