十七:强化学习:DAPO、GSPO 与 SAPO自测题答案¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484117&idx=1&sn=947045b71d6d4402f8e12606b554127c&chksm=f01eb1acc76938badfce3ac403a3424b2a9edfea1bd01333310b8707d9a53974816c2b72d295#rd
参考资料¶
-
DAPO 原论文:https://arxiv.org/abs/2503.14476
-
DAPO 快速了解:https://yam.gift/2025/03/19/NLP/LLM-Training/2025-03-19-LLM-PostTrain-DAPO/
-
GSPO 原论文:https://arxiv.org/abs/2507.18071
-
通俗解释 GSPO 原理:https://blog.csdn.net/weixin_41544125/article/details/149977267
-
SAPO 原论文:https://arxiv.org/abs/2511.20347
-
从 PPO 到 SAPO 的演进:https://zhuanlan.zhihu.com/p/1978480903136245222
-
SkyRL DAPO 文档:https://skyrl.readthedocs.io/en/latest/algorithms/dapo.html
-
RLinf DAPO 文档:https://rlinf.readthedocs.io/en/latest/rst_source/tutorials/rlalg/dapo.html
评分标准¶
-
合格:能说清 GRPO、DAPO、GSPO、SAPO 的基本动机和核心差异。
-
良好:能解释 DAPO 四个关键技术、GSPO sequence-level ratio、SAPO soft adaptive gate。
-
优秀:能从 ratio 粒度、裁剪方式、样本有效性、长度控制、MoE 稳定性和工程监控角度完整分析。
一、GRPO 改进背景¶
1. GRPO 的核心思想是什么?¶
GRPO 对同一 prompt 采样多个回答,用组内 reward 均值和标准差构造相对 advantage,不训练 critic,然后用 PPO-style ratio clipping 更新 policy。
2. GRPO 为什么能省掉 value model 或 critic?¶
因为同组回答的平均 reward 可以作为 baseline。回答好坏通过组内相对分数衡量,不需要单独估计 V(s)。
3. GRPO 中 group-relative advantage 如何计算?¶
常见形式:
4. 为什么同一 prompt 的一组回答全对或全错会导致学习信号弱?¶
如果 reward 全相同,组内标准差为 0 或接近 0,所有回答没有相对优劣,advantage 无法提供有效方向。
5. GRPO 中 token-level importance ratio 可能带来什么不稳定?¶
单个 token 的 log probability 变化可能很大,ratio 高方差会导致 clipping 频繁、梯度不稳定,MoE 模型中还可能受路由变化放大。
6. 大模型推理 RL 为什么特别关注 response length?¶
推理任务需要足够长的思考,但过长会浪费算力、触发截断、造成长度投机。长度还会影响 logp 聚合和 reward。
7. 为什么可验证任务适合 GRPO/DAPO 这类方法?¶
数学、代码等任务能用规则或测试得到明确 reward,同一 prompt 多候选之间容易比较,适合组内相对优势。
8. DAPO、GSPO、SAPO 共同想解决什么问题?¶
共同目标是让 LLM 推理 RL 更稳定、更高效、更可扩展,减少无效样本、ratio 不稳定、裁剪粗糙和长度失控等问题。
二、DAPO 总体框架¶
9. DAPO 的全称是什么?¶
Decoupled Clip and Dynamic sAmpling Policy Optimization。
10. DAPO 相比 GRPO 主要增加了哪四个关键技术?¶
Clip-Higher、Dynamic Sampling、Token-Level Policy Gradient Loss、Overlong Reward Shaping。
11. DAPO 为什么被看作大规模 LLM RL 系统,而不只是单个 loss?¶
DAPO 论文不仅给出 loss 改动,还公开了训练系统和关键工程细节,包括采样、裁剪、长度控制和 token-level 聚合。
12. DAPO 适合哪些任务场景?¶
适合数学推理、代码生成、可验证问答等能对多候选回答打分的推理任务。
13. DAPO 的 reward 通常可以来自哪些来源?¶
规则判分、答案匹配、代码测试、格式检查、模型评分或人工偏好。
14. DAPO 为什么强调开源和可复现训练细节?¶
大规模推理 RL 对采样、裁剪、长度和 batch 细节极敏感。隐藏细节会导致社区难以复现强推理模型。
15. DAPO 的训练流程可以如何概括?¶
采样 prompts;每个 prompt 生成多个回答;计算奖励;动态筛选有效组;计算组内 advantage;用 decoupled clipping 和 token-level loss 更新 policy;处理过长回答奖励。
16. DAPO 与 RLHF-PPO 在是否需要 critic 上有什么区别?¶
DAPO 基于 GRPO,不需要 value head/critic。RLHF-PPO 通常需要 critic 估计 value 和 advantage。
三、Clip-Higher 与 Dynamic Sampling¶
17. 传统 PPO/GRPO clipping 的基本形式是什么?¶
用来限制新旧策略 probability ratio 的变化。18. Clip-Higher 的核心思想是什么?¶
解耦上下裁剪范围,尤其提高上裁剪阈值:
其中epsilon_high 可以大于 epsilon_low。
19. 为什么提高上裁剪阈值可能缓解 entropy collapse?¶
上界更宽允许正 advantage 的好 token 获得更充分的概率提升,减少过早抑制有效学习信号,有助于保持探索和多样性。
20. Clip-Higher 是否意味着取消 clipping?为什么?¶
不是。它仍然限制 ratio,只是上下界不再对称,给正向更新更宽的空间。
21. Dynamic Sampling 解决什么问题?¶
解决 batch 中大量 prompt 组内 reward 无差异、advantage 为 0、梯度无效的问题。
22. 什么样的 prompt 在 GRPO/DAPO 中可能产生 zero advantage?¶
一组回答全对、全错或 reward 完全相同的 prompt。
23. Dynamic Sampling 为什么能提高有效梯度密度?¶
它让 batch 保留有 reward 差异的 prompt,使更多样本提供非零 advantage。
24. Dynamic Sampling 是否可能引入数据分布偏差?¶
可能。它更关注中等难度或有区分度的样本,可能减少极易/极难样本占比,需要监控覆盖范围。
25. 如果训练中 zero-advantage prompt 比例很高,应该如何处理?¶
可以启用 dynamic sampling、调整题目难度、增加 group size、改进 reward 粒度或提高采样多样性。
26. Clip-Higher 和 Dynamic Sampling 分别作用在训练的哪个环节?¶
Clip-Higher 作用在 policy update 的 ratio clipping 环节。Dynamic Sampling 作用在 rollout/batch 构造环节。
四、Token-Level Loss 与 Overlong Reward Shaping¶
27. DAPO 中 Token-Level Policy Gradient Loss 的直觉是什么?¶
在所有有效 response tokens 上统一聚合 policy gradient,使每个 token 以一致权重进入优化。
28. token-level 聚合和 response-level 平均有什么区别?¶
token-level 聚合按有效 token 汇总;response-level 平均先对每条回答平均,再对回答平均,会让不同长度回答的 token 权重不同。
29. Token-Level Policy Gradient Loss 为什么适合长链式推理?¶
长推理包含大量有效 token。token-level 聚合能更自然地处理长输出中的每个决策位置。
30. 如果每条 response 等权平均,可能带来什么长度相关问题?¶
短回答每个 token 的权重更大,长回答每个 token 的权重更小,可能扭曲长推理学习信号。
31. Overlong Reward Shaping 解决什么问题?¶
解决回答过长、触发截断、无限延长推理以博取奖励的问题。
32. 为什么只对超长回答做硬惩罚可能不好?¶
硬惩罚信号突兀,接近上限的回答没有平滑反馈,可能导致训练不稳定或过度避免长推理。
33. Overlong Reward Shaping 可以如何设计?¶
正常长度不惩罚,接近上限时逐步增加惩罚,超过或被截断时给明确负奖励。
34. 过长惩罚如果太强,会有什么副作用?¶
模型可能过早停止推理,输出短但不充分的答案,推理能力下降。
35. 过长惩罚如果太弱,会有什么副作用?¶
模型可能生成冗长思考,浪费算力,甚至通过长度投机提高 reward。
36. DAPO 中哪些指标可以帮助诊断长度问题?¶
平均 response length、截断率、overlong 比例、reward 与长度相关性、pass@1 与长度关系。
五、GSPO 基础¶
37. GSPO 的全称是什么?¶
Group Sequence Policy Optimization。
38. GSPO 相比 GRPO 的核心变化是什么?¶
从 token-level importance ratio/clipping 转为 sequence-level importance ratio/clipping 和 sequence-level optimization。
39. 什么是 token-level ratio?¶
表示某个 token 动作的新旧策略概率比。40. 什么是 sequence-level ratio?¶
它衡量整条 response 在新旧策略下的概率变化。常见稳定写法是长度归一化 log ratio 后指数化:
41. 为什么 sequence-level ratio 常需要长度归一化?¶
完整序列概率是 token 概率乘积,长度越长数值越极端。长度归一化能让不同长度回答更可比较。
42. GSPO 为什么更符合文本生成的 sequence-level reward?¶
文本质量、答案正确性和推理成功通常由完整回答决定,sequence-level 更新更符合任务目标。
43. token-level clipping 在同一条回答中可能产生什么不一致?¶
同一条回答中部分 token 被裁剪,部分 token 未被裁剪,导致序列内部更新信号不一致。
44. GSPO 如何改善这种不一致?¶
用整条序列的 ratio 和 clipping 决定更新,让回答作为整体被优化或约束。
45. GSPO 为什么被认为有助于 MoE 模型 RL 稳定?¶
MoE 中 token 路由变化会放大 token-level ratio 波动。sequence-level ratio 能降低局部波动对更新的影响,保持序列一致性。
46. GSPO 与 DAPO 的关注点有什么不同?¶
DAPO 更关注有效采样、裁剪上界、token-level loss 和长度 shaping。GSPO 更关注 ratio 粒度从 token 到 sequence 的改变。
六、SAPO 基础¶
47. SAPO 的全称是什么?¶
Soft Adaptive Policy Optimization。
48. SAPO 想解决 hard clipping 的什么问题?¶
hard clipping 边界粗糙,超过范围后学习信号可能被过度抑制。SAPO 用平滑权重衰减保留有用信号。
49. SAPO 中 soft adaptive gate 的直觉是什么?¶
根据 ratio 偏离程度给 token 或更新分配 0 到 1 的连续权重,越 off-policy 权重越小。
50. 温度参数在 soft gate 中通常控制什么?¶
控制 gate 衰减曲线的平滑程度。温度越高越平滑,温度越低越接近硬门控。
51. SAPO 为什么被称为 sequence-coherent?¶
它保持类似 GSPO 的序列级一致性,不完全回到孤立 token 更新。
52. SAPO 为什么被称为 token-adaptive?¶
它能对序列中的不同 token 自适应下调权重,而不是整条序列一刀切。
53. 当一条序列只有少数 token 高度 off-policy 时,GSPO 和 SAPO 可能如何不同?¶
GSPO 可能因为序列级 hard clipping 抑制整条序列梯度。SAPO 可以降低异常 token 权重,同时保留其他 token 的学习信号。
54. SAPO 相比 GRPO 的改进点是什么?¶
它用平滑、温控的缩放机制替代 hard token clipping,降低高方差 ratio 带来的不稳定。
55. SAPO 相比 GSPO 的改进点是什么?¶
它避免 sequence-level hard clipping 过于粗糙,能在保持序列一致的同时进行 token-adaptive 调节。
56. SAPO 新增了哪些工程复杂度?¶
需要实现 soft gate、调节温度参数、监控 gate 权重分布,并处理和 KL、ratio、mask 的交互。
七、对比、指标与排错¶
57. 请比较 GRPO、DAPO、GSPO、SAPO 的核心优化对象。¶
GRPO 优化组内相对 advantage 下的 token-level clipped objective。DAPO 在 GRPO 上改进采样、裁剪、token 聚合和长度奖励。GSPO 优化 sequence-level ratio。SAPO 用 soft adaptive gate 调节 policy update。
58. 请比较 DAPO、GSPO、SAPO 分别主要解决什么训练问题。¶
DAPO 解决有效样本、熵坍塌、长度控制和 token 聚合。GSPO 解决 token ratio 高方差和序列不一致。SAPO 解决 hard clipping 粗糙导致的样本效率损失。
59. 什么是 ratio 分布?为什么要监控它?¶
ratio 分布是新旧策略概率比的统计。它反映 policy update 幅度,过大或过宽说明更新不稳定。
60. 什么是 clip fraction 或 gate weight distribution?它们说明什么?¶
clip fraction 表示被 hard clip 的比例。gate weight distribution 表示 SAPO 中软权重分布。它们说明有多少样本被抑制以及更新是否过猛。
61. 为什么 policy entropy 是大模型 RL 的重要指标?¶
entropy 反映策略多样性。过快下降可能说明探索不足或 entropy collapse。
62. 如果训练 reward 上升但 KL 也快速上升,说明什么?¶
模型可能快速偏离 reference,存在 reward hacking 或语言质量下降风险。需要加强 KL、降低学习率或调整 clipping。
63. 如果 response length 快速变长,可能是什么原因?¶
reward 偏好长推理、过长惩罚不足、长度归一化设置不当或模型学到长度投机。
64. 如果 group reward std 长期接近 0,应该如何排查?¶
检查任务难度、reward 是否过粗、group size 是否太小、采样温度是否太低、是否大量全对/全错。
65. 如果 DAPO 训练中有效 batch 数不足,可能是什么原因?¶
Dynamic Sampling 条件过严、题目难度不匹配、生成多样性不足、reward 过于稀疏或 group size 太小。
66. 如果 GSPO 训练中过多序列被裁剪,可能如何处理?¶
降低学习率、减少更新 epoch、调整 clipping 范围、检查 ratio 计算和长度归一化、加强 KL 控制。
八、综合设计与面试追问¶
67. 请设计一个基于 DAPO 的数学推理 RL 训练流程。¶
准备数学题 prompts;每题采样多条解答;用答案校验和格式规则打分;过滤全对/全错组;计算组内 advantage;使用 Clip-Higher 和 token-level loss 更新;对过长回答做 shaping;监控 pass@1、长度、KL、entropy 和 group std。
68. 请设计一个从 GRPO 改成 GSPO 的核心代码改动思路。¶
把 token-level ratio 聚合为 sequence-level ratio,例如长度归一化 log ratio;用 sequence ratio 做 clipping;将同一序列共享的 clipped 权重应用到 response token;调整监控指标为 sequence ratio 和 sequence clip fraction。
69. 请设计一个从 GSPO 改成 SAPO 的核心改动思路。¶
保留序列一致性指标,引入 soft adaptive gate;用 gate 权重替代硬裁剪或对硬裁剪做平滑化;按 token 或序列-token 混合方式衰减 off-policy 更新;新增温度和 gate 分布监控。
70. 请完整比较 PPO、GRPO、DAPO、GSPO、SAPO 在数据、优势估计、ratio 粒度、裁剪方式、优缺点和适用场景上的差异。¶
PPO 使用 rollout 和 critic/value 估计 advantage,token/action ratio clipping,通用但工程复杂。GRPO 对同 prompt 多回答做组内 advantage,无 critic,适合可验证 LLM RL,但有 zero-advantage 和 token ratio 方差问题。DAPO 在 GRPO 上加入 Clip-Higher、Dynamic Sampling、token-level loss 和过长 shaping,适合大规模推理 RL 复现。GSPO 把 ratio 和 clipping 提升到 sequence level,适合序列级奖励和 MoE 稳定训练。SAPO 用 soft adaptive gate 替代硬裁剪,在稳定性和样本效率之间更细粒度折中,适合 hard clipping 损失有效信号的场景。
预览时标签不可点
<div class="