十三:强化学习:策略梯度、REINFORCE 与 Actor-Critic自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483983&idx=1&sn=f67af6e098fe8def6da278b0a3d81c83&chksm=f01eb136c76938206f89a026695a199cd5c229d20150ae5fc10b371a3a92bd84c7530d6b34a1#rd
覆盖范围¶
-
策略方法与值函数方法对比
-
随机策略、轨迹概率、策略目标
-
log-derivative trick 与 policy gradient theorem
-
REINFORCE、reward-to-go、baseline、advantage
-
Actor-Critic、A2C/A3C、GAE、entropy regularization
-
TRPO 信赖域思想
-
策略梯度实现细节和 LLM/RLHF 联系
使用方式¶
先阅读 day13_policy_gradient_actor_critic_learning.md,再闭卷回答本文件中的题目。答题时尽量写出公式推导、算法流程、优缺点和工程注意点。完成后再看答案文件。
一、策略方法基础¶
-
策略梯度方法和基于值函数的方法有什么核心区别?
-
为什么策略方法适合连续动作空间?
-
什么是随机策略
pi_theta(a|s)? -
离散动作策略通常如何参数化?
-
连续动作策略通常如何参数化?
-
为什么 LLM 生成可以看作一个随机策略?
-
策略方法相比 Q-learning/DQN 的优势是什么?
-
策略方法的主要缺点是什么?
二、策略目标与轨迹概率¶
-
策略优化目标
J(theta)通常如何定义? -
一条轨迹
tau的概率如何分解? -
为什么环境转移概率在策略梯度中不需要求导?
-
什么是状态访问分布
d^pi? -
策略梯度为什么通常做梯度上升?
-
在深度学习框架中,为什么常把策略梯度目标写成 loss 的负号?
-
策略分布变化为什么会导致训练数据分布变化?
-
为什么策略梯度通常是 on-policy 的?
三、Log-derivative Trick 与策略梯度定理¶
-
请写出 log-derivative trick。
-
log-derivative trick 如何用于对期望求梯度?
-
请写出基于轨迹回报的 REINFORCE 梯度形式。
-
请写出 policy gradient theorem 的常见形式。
-
grad log pi(a|s)的直觉含义是什么? -
Q^pi(s,a)在策略梯度中扮演什么角色? -
为什么高回报动作的概率会被增加?
-
策略梯度是否需要对
argmax求导?这和 DQN 有什么不同?
四、REINFORCE¶
-
REINFORCE 是什么类型的算法?
-
请写出 REINFORCE 的更新方向。
-
请写出 REINFORCE 常见 loss 形式。
-
REINFORCE 为什么通常要等 episode 结束?
-
什么是 reward-to-go?
-
reward-to-go 相比整条轨迹回报有什么好处?
-
REINFORCE 的主要方差来源是什么?
-
REINFORCE 在长 horizon 任务中为什么难训练?
五、Baseline 与 Advantage¶
-
为什么要在策略梯度中引入 baseline?
-
baseline 为什么不能依赖当前动作?
-
为什么减去不依赖动作的 baseline 不改变梯度期望?
-
最常用的 baseline 是什么?
-
什么是 advantage function?
-
A(s,a)>0和A(s,a)<0分别对策略更新意味着什么? -
为什么 advantage 比原始 return 更适合更新策略?
-
Advantage normalization 有什么作用?
六、Actor-Critic 与 GAE¶
-
Actor-Critic 中 Actor 和 Critic 分别是什么?
-
Critic 通常学习什么函数?
-
Actor 如何使用 Critic 的输出更新策略?
-
请写出 TD error 作为 advantage 估计的公式。
-
Actor-Critic 相比 REINFORCE 的优势是什么?
-
Actor-Critic 的潜在风险是什么?
-
A2C 和 A3C 的区别是什么?
-
Actor-Critic 的常见 loss 由哪几部分组成?
-
什么是 GAE?
-
GAE 中
lambda控制什么? -
lambda=0和lambda=1分别接近什么? -
为什么 PPO 中常用 GAE?
七、探索、TRPO 与实现细节¶
-
熵正则在策略梯度中有什么作用?
-
熵系数过大或过小分别会怎样?
-
策略梯度中为什么要限制单次策略更新幅度?
-
TRPO 的核心约束是什么?
-
TRPO 为什么被称为信赖域方法?
-
TRPO 的主要工程缺点是什么?
-
为什么 PPO 可以看作对 TRPO 思想的简化?
-
采样动作时保存 log probability 有什么用?
-
为什么 actor loss 中 advantage 通常要 detach?
-
连续动作策略中 log probability 计算容易出什么错?
-
策略梯度训练中 reward scale 会产生什么影响?
-
如果策略 entropy 很快降到接近 0,说明什么问题?
八、LLM/RLHF 场景¶
-
在 LLM 中,state、action、policy 可以分别对应什么?
-
LLM 序列生成中一条 trajectory 如何定义?
-
为什么 RLHF 可以看成策略梯度问题?
-
在 LLM 策略梯度中,token-level log probability 为什么重要?
-
KL 约束在后续 PPO/RLHF 中为什么重要?
-
请完整比较 REINFORCE、Actor-Critic、TRPO、PPO 的核心目标、优缺点和稳定化手段。
预览时标签不可点 修改于<div class="