十四:强化学习:传统 PPO、RLHF 定义与 NLP 场景强化学习自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484014&idx=1&sn=187e01065998762b96c8adf8e5030765&chksm=f01eb117c76938012ed2912e2c5a3f58de4272ac79e3a6bf23d2bb9c84810b1b6d5c7eb4e26a#rd
覆盖范围¶
-
PPO 的背景、TRPO 到 PPO 的动机
-
importance ratio、clipped surrogate objective
-
PPO-Clip、PPO-Penalty、KL 监控
-
Actor-Critic、value loss、entropy、GAE
-
rollout、on-policy、多 epoch minibatch update
-
PPO 指标、超参数、工程排错
-
RLHF 定义与 NLP 场景强化学习抽象
一、PPO 背景¶
-
PPO 的全称是什么?它解决什么问题?
-
为什么普通策略梯度更新过大可能导致策略崩坏?
-
TRPO 的核心思想是什么?
-
PPO 相比 TRPO 的主要工程优势是什么?
-
PPO 中 Proximal 的含义是什么?
-
PPO 为什么仍属于策略梯度方法?
-
PPO 为什么通常使用 Actor-Critic 结构?
-
PPO 是 on-policy 还是 off-policy?为什么?
二、Ratio 与 PPO-Clip¶
-
PPO 中 probability ratio
r_t(theta)如何定义? -
为什么工程上常用
exp(logp_new - logp_old)计算 ratio? -
r_t > 1和r_t < 1分别表示什么? -
未裁剪 surrogate objective 是什么?
-
请写出 PPO-Clip 的目标函数。
-
clip_epsilon控制什么? -
当
A_t > 0时,PPO clip 如何限制更新? -
当
A_t < 0时,PPO clip 如何限制更新? -
为什么 PPO 的 clip 不是严格 KL 约束?
-
PPO-Clip 和 PPO-Penalty 有什么区别?
三、Actor-Critic、GAE 与 Loss¶
-
PPO 中 Actor 的输入输出是什么?
-
PPO 中 Critic 的作用是什么?
-
PPO 的总 loss 通常由哪几部分组成?
-
Policy loss 为什么通常写成
-L_clip? -
Value loss 的 target 通常是什么?
-
Entropy bonus 的作用是什么?
-
请写出 GAE 的 TD error。
-
请写出 GAE advantage 的递推或求和形式。
-
GAE 中
gamma和lambda分别控制什么? -
为什么 PPO 中常做 advantage normalization?
-
Value function clipping 是什么思路?
-
Critic 训练不好会如何影响 PPO?
四、PPO 训练流程¶
-
请描述 PPO-Clip 的完整训练流程。
-
Rollout 中需要保存哪些字段?
-
为什么需要保存
logp_old? -
PPO 为什么可以对同一批 rollout 做多个 epoch 更新?
-
为什么 PPO 不能无限复用旧 rollout?
-
Minibatch update 对 PPO 有什么作用?
-
PPO 中 target KL 或 approx KL 用来做什么?
-
什么是 clip fraction?
-
Explained variance 在 PPO 中大致衡量什么?
-
PPO evaluation 时应该关注哪些指标?
五、超参数与排错¶
-
clip_epsilon太大或太小分别会怎样? -
学习率过大在 PPO 中会表现为什么?
-
PPO 的 epoch 数过多可能造成什么问题?
-
Entropy 系数太大或太小分别会怎样?
-
Value loss 系数不合适会有什么影响?
-
Gradient clipping 在 PPO 中有什么作用?
-
如果 approx KL 快速变大,应该怎么处理?
-
如果 entropy 迅速下降,说明什么问题?
-
如果 value loss 很低但 reward 不升,可能是什么原因?
-
如果 clip fraction 长期很高,说明什么问题?
六、RLHF 定义¶
-
RLHF 的全称是什么?
-
大模型 RLHF 的典型三阶段流程是什么?
-
SFT 在 RLHF 中起什么作用?
-
Reward model 在 RLHF 中起什么作用?
-
PPO 在 RLHF 中通常优化什么对象?
-
RLHF 和普通监督学习的核心区别是什么?
-
人类偏好数据通常是什么形式?
-
为什么 RLHF 需要防止 reward hacking?
七、NLP 场景下的强化学习¶
-
如何把文本生成建模为 MDP?
-
NLP 场景中的 state、action、reward 分别可以是什么?
-
为什么 NLP 中 reward 往往是 sequence-level?
-
Token-level action 会带来什么训练困难?
-
为什么 NLP/RLHF 中常需要 reference model?
-
NLP PPO 中 attention mask 和 response mask 为什么重要?
-
传统 PPO 迁移到 LLM 时,value head 的作用是什么?
-
为什么 PPO 在 LLM 上计算成本高?
八、综合比较¶
-
PPO 与 REINFORCE 相比主要改进在哪里?
-
PPO 与 TRPO 相比主要差异是什么?
-
PPO 与 DQN 的核心区别是什么?
-
请完整说明传统 PPO 到 RLHF-PPO 需要额外引入哪些组件和约束。
预览时标签不可点<div class="