十:强化学习:Bellman Equation 与策略迭代算法自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483889&idx=1&sn=666f30900756cb799a6563616b08bd0c&chksm=f01eb288c7693b9e7d7ffd35f76a276b4d5a7e51787eb18e1925a998aa758c12eeb6a3b1c921#rd
覆盖范围¶
-
Bellman equation 的来源、含义和递推结构
-
Bellman expectation equation 与 Bellman optimality equation
-
Bellman operator、不动点、压缩映射直觉
-
Dynamic Programming 的前提、优缺点和复杂度
-
Iterative Policy Evaluation、Policy Improvement、Policy Iteration
-
Value Iteration、Modified Policy Iteration、GPI
-
Cliff Walking、Frozen Lake 等网格环境建模
-
终止状态、随机转移、实现细节和常见错误
一、Bellman 方程基础¶
-
Bellman equation 的核心思想是什么?
-
为什么 MDP 的马尔可夫性可以推出 Bellman 递推结构?
-
即时奖励和下一状态价值在 Bellman 方程中分别扮演什么角色?
-
Bellman 方程和回报
G_t的定义有什么关系? -
Bellman equation 在强化学习中主要解决哪几类问题?
-
什么是 Bellman backup?
-
为什么 Bellman 方程可以把长期规划问题转化为局部递推问题?
-
Bellman 方程中的期望通常来自哪些随机性?
二、贝尔曼期望方程¶
-
请写出状态价值函数
V^pi(s)的定义。 -
请写出动作价值函数
Q^pi(s,a)的定义。 -
请写出状态价值的贝尔曼期望方程。
-
请写出动作价值的贝尔曼期望方程。
-
V^pi(s)和Q^pi(s,a)之间如何互相转换? -
固定策略
pi后,MDP 为什么可以看成 Markov Reward Process? -
请写出策略诱导的转移矩阵
P_pi。 -
请写出策略诱导的奖励向量
R_pi。 -
请写出贝尔曼期望方程的矩阵形式。
-
直接矩阵求逆求
V^pi有什么优点和缺点? -
在贝尔曼期望方程中,如果策略是确定性的,公式会如何简化?
-
如果环境转移是确定性的,公式会如何简化?
三、贝尔曼最优方程¶
-
V*(s)和Q*(s,a)分别表示什么? -
请写出状态价值的贝尔曼最优方程。
-
请写出动作价值的贝尔曼最优方程。
-
贝尔曼期望方程和贝尔曼最优方程的核心区别是什么?
-
为什么最优方程里会出现
max操作? -
如何从
V*导出最优策略? -
如何从
Q*导出最优策略? -
为什么说最优价值函数是不依赖具体策略的,但可以导出最优策略?
-
如果多个动作拥有相同最优 Q 值,最优策略是否唯一?
-
Bellman optimality equation 为什么通常是非线性的?
四、Bellman Operator 与动态规划¶
-
什么是 Bellman expectation operator
T_pi? -
什么是 Bellman optimality operator
T_*? -
什么是不动点?
V^pi = T_pi V^pi表示什么? -
当
gamma < 1时,Bellman operator 的压缩映射直觉是什么? -
动态规划算法用于强化学习时需要哪些前提?
-
为什么现实问题中通常拿不到完整的
P和R? -
表格型 DP 一轮更新的计算复杂度与哪些量有关?
-
同步 Bellman update 和异步 Bellman update 有什么区别?
-
DP 方法和后续 Monte Carlo、TD 方法的根本区别是什么?
-
为什么 DP 在高维 LLM/Agent 场景中不能直接使用?
五、策略评估与策略改进¶
-
什么是 policy evaluation?
-
请写出 iterative policy evaluation 的更新公式。
-
iterative policy evaluation 的停止条件通常如何设置?
-
终止状态在策略评估中应该如何处理?
-
什么是 policy improvement?
-
请写出基于
V^pi的贪心策略改进公式。 -
策略改进定理的直觉是什么?
-
为什么如果改进后的策略与原策略相同,通常说明已经达到最优?
-
随机策略和确定性策略在策略改进时有什么区别?
-
策略评估不精确时,策略改进还能不能进行?会带来什么问题?
六、策略迭代、价值迭代与 GPI¶
-
策略迭代的两个核心步骤是什么?
-
请写出策略迭代算法的基本流程。
-
为什么有限 MDP 中策略迭代通常可以收敛到最优策略?
-
完整策略评估的成本为什么可能很高?
-
什么是 modified policy iteration?
-
价值迭代的更新公式是什么?
-
价值迭代和策略迭代的主要区别是什么?
-
价值迭代收敛后如何得到策略?
-
什么是 Generalized Policy Iteration?
-
为什么说很多 RL 算法都可以看成 GPI 的变体?
七、示例、实现与排错¶
-
请用 Frozen Lake 说明
S、A、P、R、gamma如何定义。 -
Frozen Lake 中随机滑动会如何影响最优策略?
-
请用 Cliff Walking 说明奖励设计如何影响策略。
-
在代码中常见的
P[s][a] = [(prob, next_state, reward, done), ...]表示什么? -
为什么处理
done=True时不能继续加gamma * V(next_state)? -
如果价值迭代一直不收敛,可能有哪些原因?
-
如果策略迭代得到的策略很奇怪,应该从哪些地方排查?
-
Bellman 方程与 Actor-Critic 中 critic 的关系是什么?
-
在 LLM/RLHF 中,为什么很少直接用表格 DP,但仍需要理解 Bellman 方程?
-
请完整比较 policy iteration、value iteration、Monte Carlo control 和 TD control 的模型依赖、更新目标和适用场景。
预览时标签不可点<div class="