跳转至

十七:强化学习:DAPO、GSPO 与 SAPO自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484112&idx=1&sn=c01f41064bb5039cdc2f8e262fe3f87f&chksm=f01eb1a9c76938bf2a26cbfe0f6ae4e754004249f49d95d59ad69d0f74fd4458c7f33fb8b7ae#rd

覆盖范围

  • GRPO 的问题与改进动机

  • DAPO 的四个关键技术

  • Clip-Higher、Dynamic Sampling、Token-Level Policy Gradient Loss、Overlong Reward Shaping

  • GSPO 的 sequence-level ratio、sequence-level clipping 与 MoE 稳定性

  • SAPO 的 soft adaptive gate、sequence-coherent、token-adaptive

  • DAPO/GSPO/SAPO 与 GRPO、PPO 的系统对比

  • 大模型推理 RL 的工程监控与排错

一、GRPO 改进背景

  • GRPO 的核心思想是什么?

  • GRPO 为什么能省掉 value model 或 critic?

  • GRPO 中 group-relative advantage 如何计算?

  • 为什么同一 prompt 的一组回答全对或全错会导致学习信号弱?

  • GRPO 中 token-level importance ratio 可能带来什么不稳定?

  • 大模型推理 RL 为什么特别关注 response length?

  • 为什么可验证任务适合 GRPO/DAPO 这类方法?

  • DAPO、GSPO、SAPO 共同想解决什么问题?

二、DAPO 总体框架

  • DAPO 的全称是什么?

  • DAPO 相比 GRPO 主要增加了哪四个关键技术?

  • DAPO 为什么被看作大规模 LLM RL 系统,而不只是单个 loss?

  • DAPO 适合哪些任务场景?

  • DAPO 的 reward 通常可以来自哪些来源?

  • DAPO 为什么强调开源和可复现训练细节?

  • DAPO 的训练流程可以如何概括?

  • DAPO 与 RLHF-PPO 在是否需要 critic 上有什么区别?

三、Clip-Higher 与 Dynamic Sampling

  • 传统 PPO/GRPO clipping 的基本形式是什么?

  • Clip-Higher 的核心思想是什么?

  • 为什么提高上裁剪阈值可能缓解 entropy collapse?

  • Clip-Higher 是否意味着取消 clipping?为什么?

  • Dynamic Sampling 解决什么问题?

  • 什么样的 prompt 在 GRPO/DAPO 中可能产生 zero advantage?

  • Dynamic Sampling 为什么能提高有效梯度密度?

  • Dynamic Sampling 是否可能引入数据分布偏差?

  • 如果训练中 zero-advantage prompt 比例很高,应该如何处理?

  • Clip-Higher 和 Dynamic Sampling 分别作用在训练的哪个环节?

四、Token-Level Loss 与 Overlong Reward Shaping

  • DAPO 中 Token-Level Policy Gradient Loss 的直觉是什么?

  • token-level 聚合和 response-level 平均有什么区别?

  • Token-Level Policy Gradient Loss 为什么适合长链式推理?

  • 如果每条 response 等权平均,可能带来什么长度相关问题?

  • Overlong Reward Shaping 解决什么问题?

  • 为什么只对超长回答做硬惩罚可能不好?

  • Overlong Reward Shaping 可以如何设计?

  • 过长惩罚如果太强,会有什么副作用?

  • 过长惩罚如果太弱,会有什么副作用?

  • DAPO 中哪些指标可以帮助诊断长度问题?

五、GSPO 基础

  • GSPO 的全称是什么?

  • GSPO 相比 GRPO 的核心变化是什么?

  • 什么是 token-level ratio?

  • 什么是 sequence-level ratio?

  • 为什么 sequence-level ratio 常需要长度归一化?

  • GSPO 为什么更符合文本生成的 sequence-level reward?

  • token-level clipping 在同一条回答中可能产生什么不一致?

  • GSPO 如何改善这种不一致?

  • GSPO 为什么被认为有助于 MoE 模型 RL 稳定?

  • GSPO 与 DAPO 的关注点有什么不同?

六、SAPO 基础

  • SAPO 的全称是什么?

  • SAPO 想解决 hard clipping 的什么问题?

  • SAPO 中 soft adaptive gate 的直觉是什么?

  • 温度参数在 soft gate 中通常控制什么?

  • SAPO 为什么被称为 sequence-coherent?

  • SAPO 为什么被称为 token-adaptive?

  • 当一条序列只有少数 token 高度 off-policy 时,GSPO 和 SAPO 可能如何不同?

  • SAPO 相比 GRPO 的改进点是什么?

  • SAPO 相比 GSPO 的改进点是什么?

  • SAPO 新增了哪些工程复杂度?

七、对比、指标与排错

  • 请比较 GRPO、DAPO、GSPO、SAPO 的核心优化对象。

  • 请比较 DAPO、GSPO、SAPO 分别主要解决什么训练问题。

  • 什么是 ratio 分布?为什么要监控它?

  • 什么是 clip fraction 或 gate weight distribution?它们说明什么?

  • 为什么 policy entropy 是大模型 RL 的重要指标?

  • 如果训练 reward 上升但 KL 也快速上升,说明什么?

  • 如果 response length 快速变长,可能是什么原因?

  • 如果 group reward std 长期接近 0,应该如何排查?

  • 如果 DAPO 训练中有效 batch 数不足,可能是什么原因?

  • 如果 GSPO 训练中过多序列被裁剪,可能如何处理?

八、综合设计与面试追问

  • 请设计一个基于 DAPO 的数学推理 RL 训练流程。

  • 请设计一个从 GRPO 改成 GSPO 的核心代码改动思路。

  • 请设计一个从 GSPO 改成 SAPO 的核心改动思路。

  • 请完整比较 PPO、GRPO、DAPO、GSPO、SAPO 在数据、优势估计、ratio 粒度、裁剪方式、优缺点和适用场景上的差异。

            预览时标签不可点
    

    <div class="