十五:强化学习:RLHF-PPO 与 GRPO自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484054&idx=1&sn=fbf543adbf03ec0b34336cf720d7a6e8&chksm=f01eb1efc76938f9224907d3b02cc0665093281f7b44373107eb78e9b9b2ceca4579df0b34b8#rd
覆盖范围¶
-
RLHF-PPO 的组件和数据流
-
policy/reference/reward/value head 的作用
-
token-level PPO ratio、KL penalty、reward shaping
-
value head、advantage、mask、padding
-
RLHF-PPO 工程风险与排错
-
GRPO 的组内相对优势、目标函数和适用场景
-
GRPO 与 PPO/RLHF-PPO 的系统对比
一、RLHF-PPO 总体框架¶
-
RLHF-PPO 中通常包含哪些模型或模块?
-
Policy model 在 RLHF-PPO 中负责什么?
-
Reference model 在 RLHF-PPO 中负责什么?
-
Reward model 在 RLHF-PPO 中负责什么?
-
Value head 在 RLHF-PPO 中负责什么?
-
RLHF-PPO 为什么通常从 SFT 模型初始化?
-
请描述 RLHF-PPO 从 prompt 到参数更新的完整数据流。
-
RLHF-PPO 和传统 PPO 的最大场景差异是什么?
二、奖励、KL 与 Token-level PPO¶
-
RLHF 中 reward model 通常对什么内容打分?
-
如果 reward model 只输出 sequence-level score,如何用于 token-level PPO?
-
RLHF-PPO 的总奖励直觉上可以写成什么目标?
-
KL penalty 为什么重要?
-
sampled token 上的 KL 近似通常如何计算?
-
KL 系数
beta太大或太小分别会怎样? -
PPO ratio 在 LLM token 级别如何定义?
-
为什么必须保存 old log probability?
-
请写出 RLHF-PPO 的 token-level clipped policy objective。
-
为什么 PPO loss 通常只计算 response tokens?
三、Value、Advantage 与 Mask¶
-
Value head 的输入和输出分别是什么?
-
Value head 和 reward model 有什么区别?
-
RLHF-PPO 中 advantage 可以如何计算?
-
GAE 在 LLM response 序列中如何处理终止位置?
-
Response mask 为什么重要?
-
Padding token 如果参与 loss 会造成什么问题?
-
Prompt token 如果参与 policy loss 会造成什么问题?
-
Attention mask、response mask、loss mask 分别有什么作用?
-
为什么 advantage normalization 在 RLHF-PPO 中常见?
-
Value clipping 在 RLHF-PPO 中解决什么问题?
四、RLHF-PPO 工程风险¶
-
什么是 reward hacking?在 RLHF-PPO 中如何出现?
-
什么是 length bias?为什么 reward model 可能引入它?
-
KL 过大通常说明什么?
-
KL 过小但 reward 不升可能说明什么?
-
如果 ratio 大量超出 clip range,可能是什么问题?
-
如果 value loss 很大,应该排查什么?
-
old logp 和 new logp 不匹配会导致什么后果?
-
为什么 RLHF-PPO 的 batch 构造比传统 PPO 更复杂?
-
RLHF-PPO 中生成温度会影响什么?
-
为什么 RLHF-PPO 需要独立评估而不能只看 reward model 分数?
五、GRPO 基础¶
-
GRPO 的全称是什么?
-
GRPO 想解决 RLHF-PPO 中的什么问题?
-
GRPO 为什么可以不训练 value model 或 critic?
-
GRPO 对同一个 prompt 通常会采样什么?
-
请写出 GRPO 组内相对 advantage 的常见形式。
-
GRPO 中组内均值起什么作用?
-
GRPO 中组内标准差归一化起什么作用?
-
如果同一组回答 reward 方差接近 0,会有什么问题?
-
GRPO 是否仍然使用 PPO-style ratio clipping?
-
GRPO 是否仍然需要 KL 正则?为什么?
六、GRPO 与 PPO 对比¶
-
RLHF-PPO 和 GRPO 在 baseline 上有什么区别?
-
RLHF-PPO 和 GRPO 在模型组件上有什么区别?
-
RLHF-PPO 和 GRPO 在显存和计算成本上有什么差异?
-
GRPO 的 group size 会影响什么?
-
GRPO 为什么适合数学推理或代码任务?
-
GRPO 相比 PPO 的主要风险是什么?
-
GRPO 和 REINFORCE with baseline 有什么联系?
-
GRPO 中同一个回答的 advantage 是否一定逐 token 不同?
七、DeepSeek-R1 与 KL 估计¶
-
DeepSeek-R1/DeepSeekMath 场景中,GRPO 的奖励可以来自哪些信号?
-
为什么可验证任务特别适合 GRPO?
-
什么是
KL(pi || ref)的基本定义? -
在 sampled action 上估计 KL 时,
logp_policy - logp_ref表示什么? -
为什么不同代码库的 KL 符号和方向必须仔细检查?
-
KL penalty 和 PPO clipping 分别限制什么?
-
GRPO 中如果 KL 系数太小,会有什么风险?
-
GRPO 中如果 KL 系数太大,会有什么风险?
八、综合设计与面试追问¶
-
请画出或描述 RLHF-PPO 的完整训练流程图。
-
请画出或描述 GRPO 的完整训练流程图。
-
如果要把 RLHF-PPO 改成 GRPO,需要删除和新增哪些步骤?
-
如果 reward model 偏好长答案,PPO 和 GRPO 分别可能学到什么坏行为?
-
在大模型 RL 中,为什么“奖励上升”不一定代表真实能力上升?
-
请完整比较 SFT、DPO、RLHF-PPO、GRPO 的数据形式、训练目标、优缺点和适用场景。
预览时标签不可点<div class="