跳转至

十五:强化学习:RLHF-PPO 与 GRPO自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484054&idx=1&sn=fbf543adbf03ec0b34336cf720d7a6e8&chksm=f01eb1efc76938f9224907d3b02cc0665093281f7b44373107eb78e9b9b2ceca4579df0b34b8#rd

覆盖范围

  • RLHF-PPO 的组件和数据流

  • policy/reference/reward/value head 的作用

  • token-level PPO ratio、KL penalty、reward shaping

  • value head、advantage、mask、padding

  • RLHF-PPO 工程风险与排错

  • GRPO 的组内相对优势、目标函数和适用场景

  • GRPO 与 PPO/RLHF-PPO 的系统对比

一、RLHF-PPO 总体框架

  • RLHF-PPO 中通常包含哪些模型或模块?

  • Policy model 在 RLHF-PPO 中负责什么?

  • Reference model 在 RLHF-PPO 中负责什么?

  • Reward model 在 RLHF-PPO 中负责什么?

  • Value head 在 RLHF-PPO 中负责什么?

  • RLHF-PPO 为什么通常从 SFT 模型初始化?

  • 请描述 RLHF-PPO 从 prompt 到参数更新的完整数据流。

  • RLHF-PPO 和传统 PPO 的最大场景差异是什么?

二、奖励、KL 与 Token-level PPO

  • RLHF 中 reward model 通常对什么内容打分?

  • 如果 reward model 只输出 sequence-level score,如何用于 token-level PPO?

  • RLHF-PPO 的总奖励直觉上可以写成什么目标?

  • KL penalty 为什么重要?

  • sampled token 上的 KL 近似通常如何计算?

  • KL 系数 beta 太大或太小分别会怎样?

  • PPO ratio 在 LLM token 级别如何定义?

  • 为什么必须保存 old log probability?

  • 请写出 RLHF-PPO 的 token-level clipped policy objective。

  • 为什么 PPO loss 通常只计算 response tokens?

三、Value、Advantage 与 Mask

  • Value head 的输入和输出分别是什么?

  • Value head 和 reward model 有什么区别?

  • RLHF-PPO 中 advantage 可以如何计算?

  • GAE 在 LLM response 序列中如何处理终止位置?

  • Response mask 为什么重要?

  • Padding token 如果参与 loss 会造成什么问题?

  • Prompt token 如果参与 policy loss 会造成什么问题?

  • Attention mask、response mask、loss mask 分别有什么作用?

  • 为什么 advantage normalization 在 RLHF-PPO 中常见?

  • Value clipping 在 RLHF-PPO 中解决什么问题?

四、RLHF-PPO 工程风险

  • 什么是 reward hacking?在 RLHF-PPO 中如何出现?

  • 什么是 length bias?为什么 reward model 可能引入它?

  • KL 过大通常说明什么?

  • KL 过小但 reward 不升可能说明什么?

  • 如果 ratio 大量超出 clip range,可能是什么问题?

  • 如果 value loss 很大,应该排查什么?

  • old logp 和 new logp 不匹配会导致什么后果?

  • 为什么 RLHF-PPO 的 batch 构造比传统 PPO 更复杂?

  • RLHF-PPO 中生成温度会影响什么?

  • 为什么 RLHF-PPO 需要独立评估而不能只看 reward model 分数?

五、GRPO 基础

  • GRPO 的全称是什么?

  • GRPO 想解决 RLHF-PPO 中的什么问题?

  • GRPO 为什么可以不训练 value model 或 critic?

  • GRPO 对同一个 prompt 通常会采样什么?

  • 请写出 GRPO 组内相对 advantage 的常见形式。

  • GRPO 中组内均值起什么作用?

  • GRPO 中组内标准差归一化起什么作用?

  • 如果同一组回答 reward 方差接近 0,会有什么问题?

  • GRPO 是否仍然使用 PPO-style ratio clipping?

  • GRPO 是否仍然需要 KL 正则?为什么?

六、GRPO 与 PPO 对比

  • RLHF-PPO 和 GRPO 在 baseline 上有什么区别?

  • RLHF-PPO 和 GRPO 在模型组件上有什么区别?

  • RLHF-PPO 和 GRPO 在显存和计算成本上有什么差异?

  • GRPO 的 group size 会影响什么?

  • GRPO 为什么适合数学推理或代码任务?

  • GRPO 相比 PPO 的主要风险是什么?

  • GRPO 和 REINFORCE with baseline 有什么联系?

  • GRPO 中同一个回答的 advantage 是否一定逐 token 不同?

七、DeepSeek-R1 与 KL 估计

  • DeepSeek-R1/DeepSeekMath 场景中,GRPO 的奖励可以来自哪些信号?

  • 为什么可验证任务特别适合 GRPO?

  • 什么是 KL(pi || ref) 的基本定义?

  • 在 sampled action 上估计 KL 时,logp_policy - logp_ref 表示什么?

  • 为什么不同代码库的 KL 符号和方向必须仔细检查?

  • KL penalty 和 PPO clipping 分别限制什么?

  • GRPO 中如果 KL 系数太小,会有什么风险?

  • GRPO 中如果 KL 系数太大,会有什么风险?

八、综合设计与面试追问

  • 请画出或描述 RLHF-PPO 的完整训练流程图。

  • 请画出或描述 GRPO 的完整训练流程图。

  • 如果要把 RLHF-PPO 改成 GRPO,需要删除和新增哪些步骤?

  • 如果 reward model 偏好长答案,PPO 和 GRPO 分别可能学到什么坏行为?

  • 在大模型 RL 中,为什么“奖励上升”不一定代表真实能力上升?

  • 请完整比较 SFT、DPO、RLHF-PPO、GRPO 的数据形式、训练目标、优缺点和适用场景。

            预览时标签不可点
    

    <div class="