跳转至

十四:强化学习:传统 PPO、RLHF 定义与 NLP 场景强化学习自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484014&idx=1&sn=187e01065998762b96c8adf8e5030765&chksm=f01eb117c76938012ed2912e2c5a3f58de4272ac79e3a6bf23d2bb9c84810b1b6d5c7eb4e26a#rd

覆盖范围

  • PPO 的背景、TRPO 到 PPO 的动机

  • importance ratio、clipped surrogate objective

  • PPO-Clip、PPO-Penalty、KL 监控

  • Actor-Critic、value loss、entropy、GAE

  • rollout、on-policy、多 epoch minibatch update

  • PPO 指标、超参数、工程排错

  • RLHF 定义与 NLP 场景强化学习抽象

一、PPO 背景

  • PPO 的全称是什么?它解决什么问题?

  • 为什么普通策略梯度更新过大可能导致策略崩坏?

  • TRPO 的核心思想是什么?

  • PPO 相比 TRPO 的主要工程优势是什么?

  • PPO 中 Proximal 的含义是什么?

  • PPO 为什么仍属于策略梯度方法?

  • PPO 为什么通常使用 Actor-Critic 结构?

  • PPO 是 on-policy 还是 off-policy?为什么?

二、Ratio 与 PPO-Clip

  • PPO 中 probability ratio r_t(theta) 如何定义?

  • 为什么工程上常用 exp(logp_new - logp_old) 计算 ratio?

  • r_t > 1r_t < 1 分别表示什么?

  • 未裁剪 surrogate objective 是什么?

  • 请写出 PPO-Clip 的目标函数。

  • clip_epsilon 控制什么?

  • A_t > 0 时,PPO clip 如何限制更新?

  • A_t < 0 时,PPO clip 如何限制更新?

  • 为什么 PPO 的 clip 不是严格 KL 约束?

  • PPO-Clip 和 PPO-Penalty 有什么区别?

三、Actor-Critic、GAE 与 Loss

  • PPO 中 Actor 的输入输出是什么?

  • PPO 中 Critic 的作用是什么?

  • PPO 的总 loss 通常由哪几部分组成?

  • Policy loss 为什么通常写成 -L_clip

  • Value loss 的 target 通常是什么?

  • Entropy bonus 的作用是什么?

  • 请写出 GAE 的 TD error。

  • 请写出 GAE advantage 的递推或求和形式。

  • GAE 中 gammalambda 分别控制什么?

  • 为什么 PPO 中常做 advantage normalization?

  • Value function clipping 是什么思路?

  • Critic 训练不好会如何影响 PPO?

四、PPO 训练流程

  • 请描述 PPO-Clip 的完整训练流程。

  • Rollout 中需要保存哪些字段?

  • 为什么需要保存 logp_old

  • PPO 为什么可以对同一批 rollout 做多个 epoch 更新?

  • 为什么 PPO 不能无限复用旧 rollout?

  • Minibatch update 对 PPO 有什么作用?

  • PPO 中 target KL 或 approx KL 用来做什么?

  • 什么是 clip fraction?

  • Explained variance 在 PPO 中大致衡量什么?

  • PPO evaluation 时应该关注哪些指标?

五、超参数与排错

  • clip_epsilon 太大或太小分别会怎样?

  • 学习率过大在 PPO 中会表现为什么?

  • PPO 的 epoch 数过多可能造成什么问题?

  • Entropy 系数太大或太小分别会怎样?

  • Value loss 系数不合适会有什么影响?

  • Gradient clipping 在 PPO 中有什么作用?

  • 如果 approx KL 快速变大,应该怎么处理?

  • 如果 entropy 迅速下降,说明什么问题?

  • 如果 value loss 很低但 reward 不升,可能是什么原因?

  • 如果 clip fraction 长期很高,说明什么问题?

六、RLHF 定义

  • RLHF 的全称是什么?

  • 大模型 RLHF 的典型三阶段流程是什么?

  • SFT 在 RLHF 中起什么作用?

  • Reward model 在 RLHF 中起什么作用?

  • PPO 在 RLHF 中通常优化什么对象?

  • RLHF 和普通监督学习的核心区别是什么?

  • 人类偏好数据通常是什么形式?

  • 为什么 RLHF 需要防止 reward hacking?

七、NLP 场景下的强化学习

  • 如何把文本生成建模为 MDP?

  • NLP 场景中的 state、action、reward 分别可以是什么?

  • 为什么 NLP 中 reward 往往是 sequence-level?

  • Token-level action 会带来什么训练困难?

  • 为什么 NLP/RLHF 中常需要 reference model?

  • NLP PPO 中 attention mask 和 response mask 为什么重要?

  • 传统 PPO 迁移到 LLM 时,value head 的作用是什么?

  • 为什么 PPO 在 LLM 上计算成本高?

八、综合比较

  • PPO 与 REINFORCE 相比主要改进在哪里?

  • PPO 与 TRPO 相比主要差异是什么?

  • PPO 与 DQN 的核心区别是什么?

  • 请完整说明传统 PPO 到 RLHF-PPO 需要额外引入哪些组件和约束。

            预览时标签不可点
    

    <div class="