跳转至

十一:强化学习:蒙特卡洛方法、Sarsa 与多步 Sarsa自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483912&idx=1&sn=2e1e457f42af7fda0a9da0ed0c7f69cf&chksm=f01eb171c7693867b6c7026a9647e46210bfb7e289eb42831c8be6ac6facabde5c5ae19f0ac9#rd

覆盖范围

  • 从动态规划到 model-free 采样学习

  • Monte Carlo prediction 与 control

  • first-visit MC、every-visit MC、增量均值

  • Robbins-Monro 随机逼近与学习率条件

  • TD learning、TD target、TD error

  • Sarsa、n-step Sarsa、epsilon-greedy

  • Sarsa 与 Q-learning 的 on-policy/off-policy 差异

  • MC/TD/Sarsa 在长 episode、随机环境、Agent 场景中的适用性

一、从 DP 到 Model-free

  • 为什么动态规划方法通常需要完整环境模型?

  • Model-free 强化学习与基于模型的动态规划有什么核心区别?

  • 采样式学习中,一条 transition 通常包含哪些元素?

  • 一条 episode 通常包含哪些元素?

  • 为什么从采样数据估计价值可以看成估计期望?

  • 在没有 P(s'|s,a) 的情况下,为什么学习 Q(s,a) 对控制问题特别重要?

  • Monte Carlo、TD、Sarsa 都属于 model-free 吗?分别使用什么样的采样目标?

  • 采样式强化学习相比 DP 的优势和代价分别是什么?

二、蒙特卡洛预测

  • Monte Carlo 方法的核心思想是什么?

  • 为什么 MC 方法通常适合 episodic task?

  • 请写出状态价值 V^pi(s) 的 MC 估计思路。

  • 请写出动作价值 Q^pi(s,a) 的 MC 更新形式。

  • 什么是 first-visit MC?

  • 什么是 every-visit MC?

  • first-visit MC 和 every-visit MC 的区别和联系是什么?

  • MC prediction 为什么不需要知道状态转移概率?

  • MC 方法为什么必须等到 episode 结束才能做标准完整回报更新?

  • MC target 的方差为什么可能较高?

三、增量更新与 Robbins-Monro

  • 请写出样本均值的增量更新公式。

  • 为什么增量更新比保存所有历史 return 更实用?

  • 使用固定学习率 alpha 和使用 1/n 学习率有什么区别?

  • Robbins-Monro 随机逼近的基本更新形式是什么?

  • Robbins-Monro 收敛条件 sum alpha_t = infinity 表示什么直觉?

  • Robbins-Monro 收敛条件 sum alpha_t^2 < infinity 表示什么直觉?

  • 为什么随机梯度下降可以看成随机逼近的一种形式?

  • 在深度 RL 中,为什么实际学习率设置不一定严格满足 Robbins-Monro 理论条件?

四、蒙特卡洛控制与探索

  • Monte Carlo control 的目标是什么?

  • 为什么控制问题中通常学习 Q(s,a) 而不是只学习 V(s)

  • MC control 如何体现 GPI 思想?

  • 什么是 exploring starts?它解决什么问题?

  • 什么是 epsilon-greedy 策略?

  • 什么是 epsilon-soft policy?

  • 为什么完全贪心策略可能导致探索不足?

  • On-policy MC control 和 off-policy MC control 有什么区别?

  • Off-policy MC 为什么需要重要性采样?

  • 重要性采样在长 episode 中为什么可能高方差?

五、TD 学习

  • Temporal Difference 方法的核心思想是什么?

  • 请写出 TD(0) 状态价值更新公式。

  • 什么是 TD target?

  • 什么是 TD error?

  • TD 方法为什么可以在线更新?

  • TD 方法为什么说结合了 MC 和 DP 的思想?

  • MC target 和 TD target 分别是什么?

  • MC 和 TD 在 bias-variance 上有什么区别?

  • 什么是 bootstrapping?TD 中哪里体现了 bootstrapping?

  • 如果下一状态是终止状态,TD target 应该如何处理?

六、Sarsa 与多步 Sarsa

  • Sarsa 名字中的五个元素分别是什么?

  • 请写出 Sarsa 的 Q 值更新公式。

  • 为什么 Sarsa 是 on-policy 算法?

  • Sarsa 的典型训练流程是什么?

  • Sarsa 中 A_{t+1} 是如何得到的?

  • epsilon-greedy 对 Sarsa 学到的策略有什么影响?

  • 如果 Sarsa 训练时 epsilon 一直很大,会有什么结果?

  • 多步 Sarsa 的 n-step return 公式是什么?

  • n-step Sarsa 中 n=1n 到 episode 结束分别对应什么极端?

  • 多步 Sarsa 相比一步 Sarsa 的优势和风险是什么?

  • 实现 n-step Sarsa 时为什么容易出现 reward 索引错误?

  • 多步 Sarsa 如何处理 episode 结束时不足 n 步的情况?

七、Sarsa、Q-learning 与工程排错

  • Q-learning 的更新 target 是什么?

  • Sarsa 和 Q-learning 的 target 有什么核心区别?

  • 为什么 Q-learning 通常被称为 off-policy?

  • 在 Cliff Walking 中,Sarsa 和 Q-learning 学到的行为可能有什么差异?

  • alphagammaepsilon 分别控制什么?

  • 如果 Q 值震荡严重,可能有哪些原因?

  • 如果训练很久仍然学不到有效策略,应该排查哪些问题?

  • MC、TD、Sarsa、Q-learning 分别更适合什么场景?

八、LLM、RLHF 与 Agent 场景

  • 如何把一次完整对话看作 MC 方法中的 episode?

  • 为什么长任务 Agent 中纯 MC 反馈可能学习效率低?

  • TD/critic 思想如何帮助长 horizon 的 LLM Agent 学习?

  • 请设计一个工具调用 Agent 的 Sarsa 式学习抽象,包括状态、动作、奖励、Q 值更新和探索策略。

            预览时标签不可点
    

    <div class="