十一:强化学习:蒙特卡洛方法、Sarsa 与多步 Sarsa自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483912&idx=1&sn=2e1e457f42af7fda0a9da0ed0c7f69cf&chksm=f01eb171c7693867b6c7026a9647e46210bfb7e289eb42831c8be6ac6facabde5c5ae19f0ac9#rd
覆盖范围¶
-
从动态规划到 model-free 采样学习
-
Monte Carlo prediction 与 control
-
first-visit MC、every-visit MC、增量均值
-
Robbins-Monro 随机逼近与学习率条件
-
TD learning、TD target、TD error
-
Sarsa、n-step Sarsa、epsilon-greedy
-
Sarsa 与 Q-learning 的 on-policy/off-policy 差异
-
MC/TD/Sarsa 在长 episode、随机环境、Agent 场景中的适用性
一、从 DP 到 Model-free¶
-
为什么动态规划方法通常需要完整环境模型?
-
Model-free 强化学习与基于模型的动态规划有什么核心区别?
-
采样式学习中,一条 transition 通常包含哪些元素?
-
一条 episode 通常包含哪些元素?
-
为什么从采样数据估计价值可以看成估计期望?
-
在没有
P(s'|s,a)的情况下,为什么学习Q(s,a)对控制问题特别重要? -
Monte Carlo、TD、Sarsa 都属于 model-free 吗?分别使用什么样的采样目标?
-
采样式强化学习相比 DP 的优势和代价分别是什么?
二、蒙特卡洛预测¶
-
Monte Carlo 方法的核心思想是什么?
-
为什么 MC 方法通常适合 episodic task?
-
请写出状态价值
V^pi(s)的 MC 估计思路。 -
请写出动作价值
Q^pi(s,a)的 MC 更新形式。 -
什么是 first-visit MC?
-
什么是 every-visit MC?
-
first-visit MC 和 every-visit MC 的区别和联系是什么?
-
MC prediction 为什么不需要知道状态转移概率?
-
MC 方法为什么必须等到 episode 结束才能做标准完整回报更新?
-
MC target 的方差为什么可能较高?
三、增量更新与 Robbins-Monro¶
-
请写出样本均值的增量更新公式。
-
为什么增量更新比保存所有历史 return 更实用?
-
使用固定学习率
alpha和使用1/n学习率有什么区别? -
Robbins-Monro 随机逼近的基本更新形式是什么?
-
Robbins-Monro 收敛条件
sum alpha_t = infinity表示什么直觉? -
Robbins-Monro 收敛条件
sum alpha_t^2 < infinity表示什么直觉? -
为什么随机梯度下降可以看成随机逼近的一种形式?
-
在深度 RL 中,为什么实际学习率设置不一定严格满足 Robbins-Monro 理论条件?
四、蒙特卡洛控制与探索¶
-
Monte Carlo control 的目标是什么?
-
为什么控制问题中通常学习
Q(s,a)而不是只学习V(s)? -
MC control 如何体现 GPI 思想?
-
什么是 exploring starts?它解决什么问题?
-
什么是 epsilon-greedy 策略?
-
什么是 epsilon-soft policy?
-
为什么完全贪心策略可能导致探索不足?
-
On-policy MC control 和 off-policy MC control 有什么区别?
-
Off-policy MC 为什么需要重要性采样?
-
重要性采样在长 episode 中为什么可能高方差?
五、TD 学习¶
-
Temporal Difference 方法的核心思想是什么?
-
请写出 TD(0) 状态价值更新公式。
-
什么是 TD target?
-
什么是 TD error?
-
TD 方法为什么可以在线更新?
-
TD 方法为什么说结合了 MC 和 DP 的思想?
-
MC target 和 TD target 分别是什么?
-
MC 和 TD 在 bias-variance 上有什么区别?
-
什么是 bootstrapping?TD 中哪里体现了 bootstrapping?
-
如果下一状态是终止状态,TD target 应该如何处理?
六、Sarsa 与多步 Sarsa¶
-
Sarsa 名字中的五个元素分别是什么?
-
请写出 Sarsa 的 Q 值更新公式。
-
为什么 Sarsa 是 on-policy 算法?
-
Sarsa 的典型训练流程是什么?
-
Sarsa 中
A_{t+1}是如何得到的? -
epsilon-greedy 对 Sarsa 学到的策略有什么影响?
-
如果 Sarsa 训练时
epsilon一直很大,会有什么结果? -
多步 Sarsa 的 n-step return 公式是什么?
-
n-step Sarsa 中
n=1和n到 episode 结束分别对应什么极端? -
多步 Sarsa 相比一步 Sarsa 的优势和风险是什么?
-
实现 n-step Sarsa 时为什么容易出现 reward 索引错误?
-
多步 Sarsa 如何处理 episode 结束时不足 n 步的情况?
七、Sarsa、Q-learning 与工程排错¶
-
Q-learning 的更新 target 是什么?
-
Sarsa 和 Q-learning 的 target 有什么核心区别?
-
为什么 Q-learning 通常被称为 off-policy?
-
在 Cliff Walking 中,Sarsa 和 Q-learning 学到的行为可能有什么差异?
-
alpha、gamma、epsilon分别控制什么? -
如果 Q 值震荡严重,可能有哪些原因?
-
如果训练很久仍然学不到有效策略,应该排查哪些问题?
-
MC、TD、Sarsa、Q-learning 分别更适合什么场景?
八、LLM、RLHF 与 Agent 场景¶
-
如何把一次完整对话看作 MC 方法中的 episode?
-
为什么长任务 Agent 中纯 MC 反馈可能学习效率低?
-
TD/critic 思想如何帮助长 horizon 的 LLM Agent 学习?
-
请设计一个工具调用 Agent 的 Sarsa 式学习抽象,包括状态、动作、奖励、Q 值更新和探索策略。
预览时标签不可点<div class="