跳转至

十:强化学习:Bellman Equation 与策略迭代算法自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483889&idx=1&sn=666f30900756cb799a6563616b08bd0c&chksm=f01eb288c7693b9e7d7ffd35f76a276b4d5a7e51787eb18e1925a998aa758c12eeb6a3b1c921#rd

覆盖范围

  • Bellman equation 的来源、含义和递推结构

  • Bellman expectation equation 与 Bellman optimality equation

  • Bellman operator、不动点、压缩映射直觉

  • Dynamic Programming 的前提、优缺点和复杂度

  • Iterative Policy Evaluation、Policy Improvement、Policy Iteration

  • Value Iteration、Modified Policy Iteration、GPI

  • Cliff Walking、Frozen Lake 等网格环境建模

  • 终止状态、随机转移、实现细节和常见错误

一、Bellman 方程基础

  • Bellman equation 的核心思想是什么?

  • 为什么 MDP 的马尔可夫性可以推出 Bellman 递推结构?

  • 即时奖励和下一状态价值在 Bellman 方程中分别扮演什么角色?

  • Bellman 方程和回报 G_t 的定义有什么关系?

  • Bellman equation 在强化学习中主要解决哪几类问题?

  • 什么是 Bellman backup?

  • 为什么 Bellman 方程可以把长期规划问题转化为局部递推问题?

  • Bellman 方程中的期望通常来自哪些随机性?

二、贝尔曼期望方程

  • 请写出状态价值函数 V^pi(s) 的定义。

  • 请写出动作价值函数 Q^pi(s,a) 的定义。

  • 请写出状态价值的贝尔曼期望方程。

  • 请写出动作价值的贝尔曼期望方程。

  • V^pi(s)Q^pi(s,a) 之间如何互相转换?

  • 固定策略 pi 后,MDP 为什么可以看成 Markov Reward Process?

  • 请写出策略诱导的转移矩阵 P_pi

  • 请写出策略诱导的奖励向量 R_pi

  • 请写出贝尔曼期望方程的矩阵形式。

  • 直接矩阵求逆求 V^pi 有什么优点和缺点?

  • 在贝尔曼期望方程中,如果策略是确定性的,公式会如何简化?

  • 如果环境转移是确定性的,公式会如何简化?

三、贝尔曼最优方程

  • V*(s)Q*(s,a) 分别表示什么?

  • 请写出状态价值的贝尔曼最优方程。

  • 请写出动作价值的贝尔曼最优方程。

  • 贝尔曼期望方程和贝尔曼最优方程的核心区别是什么?

  • 为什么最优方程里会出现 max 操作?

  • 如何从 V* 导出最优策略?

  • 如何从 Q* 导出最优策略?

  • 为什么说最优价值函数是不依赖具体策略的,但可以导出最优策略?

  • 如果多个动作拥有相同最优 Q 值,最优策略是否唯一?

  • Bellman optimality equation 为什么通常是非线性的?

四、Bellman Operator 与动态规划

  • 什么是 Bellman expectation operator T_pi

  • 什么是 Bellman optimality operator T_*

  • 什么是不动点?V^pi = T_pi V^pi 表示什么?

  • gamma < 1 时,Bellman operator 的压缩映射直觉是什么?

  • 动态规划算法用于强化学习时需要哪些前提?

  • 为什么现实问题中通常拿不到完整的 PR

  • 表格型 DP 一轮更新的计算复杂度与哪些量有关?

  • 同步 Bellman update 和异步 Bellman update 有什么区别?

  • DP 方法和后续 Monte Carlo、TD 方法的根本区别是什么?

  • 为什么 DP 在高维 LLM/Agent 场景中不能直接使用?

五、策略评估与策略改进

  • 什么是 policy evaluation?

  • 请写出 iterative policy evaluation 的更新公式。

  • iterative policy evaluation 的停止条件通常如何设置?

  • 终止状态在策略评估中应该如何处理?

  • 什么是 policy improvement?

  • 请写出基于 V^pi 的贪心策略改进公式。

  • 策略改进定理的直觉是什么?

  • 为什么如果改进后的策略与原策略相同,通常说明已经达到最优?

  • 随机策略和确定性策略在策略改进时有什么区别?

  • 策略评估不精确时,策略改进还能不能进行?会带来什么问题?

六、策略迭代、价值迭代与 GPI

  • 策略迭代的两个核心步骤是什么?

  • 请写出策略迭代算法的基本流程。

  • 为什么有限 MDP 中策略迭代通常可以收敛到最优策略?

  • 完整策略评估的成本为什么可能很高?

  • 什么是 modified policy iteration?

  • 价值迭代的更新公式是什么?

  • 价值迭代和策略迭代的主要区别是什么?

  • 价值迭代收敛后如何得到策略?

  • 什么是 Generalized Policy Iteration?

  • 为什么说很多 RL 算法都可以看成 GPI 的变体?

七、示例、实现与排错

  • 请用 Frozen Lake 说明 S、A、P、R、gamma 如何定义。

  • Frozen Lake 中随机滑动会如何影响最优策略?

  • 请用 Cliff Walking 说明奖励设计如何影响策略。

  • 在代码中常见的 P[s][a] = [(prob, next_state, reward, done), ...] 表示什么?

  • 为什么处理 done=True 时不能继续加 gamma * V(next_state)

  • 如果价值迭代一直不收敛,可能有哪些原因?

  • 如果策略迭代得到的策略很奇怪,应该从哪些地方排查?

  • Bellman 方程与 Actor-Critic 中 critic 的关系是什么?

  • 在 LLM/RLHF 中,为什么很少直接用表格 DP,但仍需要理解 Bellman 方程?

  • 请完整比较 policy iteration、value iteration、Monte Carlo control 和 TD control 的模型依赖、更新目标和适用场景。

            预览时标签不可点
    

    <div class="