跳转至

十三:强化学习:策略梯度、REINFORCE 与 Actor-Critic自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483983&idx=1&sn=f67af6e098fe8def6da278b0a3d81c83&chksm=f01eb136c76938206f89a026695a199cd5c229d20150ae5fc10b371a3a92bd84c7530d6b34a1#rd

覆盖范围

  • 策略方法与值函数方法对比

  • 随机策略、轨迹概率、策略目标

  • log-derivative trick 与 policy gradient theorem

  • REINFORCE、reward-to-go、baseline、advantage

  • Actor-Critic、A2C/A3C、GAE、entropy regularization

  • TRPO 信赖域思想

  • 策略梯度实现细节和 LLM/RLHF 联系

使用方式

先阅读 day13_policy_gradient_actor_critic_learning.md,再闭卷回答本文件中的题目。答题时尽量写出公式推导、算法流程、优缺点和工程注意点。完成后再看答案文件。

一、策略方法基础

  • 策略梯度方法和基于值函数的方法有什么核心区别?

  • 为什么策略方法适合连续动作空间?

  • 什么是随机策略 pi_theta(a|s)

  • 离散动作策略通常如何参数化?

  • 连续动作策略通常如何参数化?

  • 为什么 LLM 生成可以看作一个随机策略?

  • 策略方法相比 Q-learning/DQN 的优势是什么?

  • 策略方法的主要缺点是什么?

二、策略目标与轨迹概率

  • 策略优化目标 J(theta) 通常如何定义?

  • 一条轨迹 tau 的概率如何分解?

  • 为什么环境转移概率在策略梯度中不需要求导?

  • 什么是状态访问分布 d^pi

  • 策略梯度为什么通常做梯度上升?

  • 在深度学习框架中,为什么常把策略梯度目标写成 loss 的负号?

  • 策略分布变化为什么会导致训练数据分布变化?

  • 为什么策略梯度通常是 on-policy 的?

三、Log-derivative Trick 与策略梯度定理

  • 请写出 log-derivative trick。

  • log-derivative trick 如何用于对期望求梯度?

  • 请写出基于轨迹回报的 REINFORCE 梯度形式。

  • 请写出 policy gradient theorem 的常见形式。

  • grad log pi(a|s) 的直觉含义是什么?

  • Q^pi(s,a) 在策略梯度中扮演什么角色?

  • 为什么高回报动作的概率会被增加?

  • 策略梯度是否需要对 argmax 求导?这和 DQN 有什么不同?

四、REINFORCE

  • REINFORCE 是什么类型的算法?

  • 请写出 REINFORCE 的更新方向。

  • 请写出 REINFORCE 常见 loss 形式。

  • REINFORCE 为什么通常要等 episode 结束?

  • 什么是 reward-to-go?

  • reward-to-go 相比整条轨迹回报有什么好处?

  • REINFORCE 的主要方差来源是什么?

  • REINFORCE 在长 horizon 任务中为什么难训练?

五、Baseline 与 Advantage

  • 为什么要在策略梯度中引入 baseline?

  • baseline 为什么不能依赖当前动作?

  • 为什么减去不依赖动作的 baseline 不改变梯度期望?

  • 最常用的 baseline 是什么?

  • 什么是 advantage function?

  • A(s,a)>0A(s,a)<0 分别对策略更新意味着什么?

  • 为什么 advantage 比原始 return 更适合更新策略?

  • Advantage normalization 有什么作用?

六、Actor-Critic 与 GAE

  • Actor-Critic 中 Actor 和 Critic 分别是什么?

  • Critic 通常学习什么函数?

  • Actor 如何使用 Critic 的输出更新策略?

  • 请写出 TD error 作为 advantage 估计的公式。

  • Actor-Critic 相比 REINFORCE 的优势是什么?

  • Actor-Critic 的潜在风险是什么?

  • A2C 和 A3C 的区别是什么?

  • Actor-Critic 的常见 loss 由哪几部分组成?

  • 什么是 GAE?

  • GAE 中 lambda 控制什么?

  • lambda=0lambda=1 分别接近什么?

  • 为什么 PPO 中常用 GAE?

七、探索、TRPO 与实现细节

  • 熵正则在策略梯度中有什么作用?

  • 熵系数过大或过小分别会怎样?

  • 策略梯度中为什么要限制单次策略更新幅度?

  • TRPO 的核心约束是什么?

  • TRPO 为什么被称为信赖域方法?

  • TRPO 的主要工程缺点是什么?

  • 为什么 PPO 可以看作对 TRPO 思想的简化?

  • 采样动作时保存 log probability 有什么用?

  • 为什么 actor loss 中 advantage 通常要 detach?

  • 连续动作策略中 log probability 计算容易出什么错?

  • 策略梯度训练中 reward scale 会产生什么影响?

  • 如果策略 entropy 很快降到接近 0,说明什么问题?

八、LLM/RLHF 场景

  • 在 LLM 中,state、action、policy 可以分别对应什么?

  • LLM 序列生成中一条 trajectory 如何定义?

  • 为什么 RLHF 可以看成策略梯度问题?

  • 在 LLM 策略梯度中,token-level log probability 为什么重要?

  • KL 约束在后续 PPO/RLHF 中为什么重要?

  • 请完整比较 REINFORCE、Actor-Critic、TRPO、PPO 的核心目标、优缺点和稳定化手段。

            预览时标签不可点
    
    修改于
    

    <div class="