九:强化学习:强化学习基础与马尔可夫决策过程 MDP自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483860&idx=1&sn=3f111ceb8ffe2f8f8f484c9205f79c7e&chksm=f01eb2adc7693bbbfb315e7b8428500b9323c15459b6cfab798940e928b98582971f5b88ffd8#rd
覆盖范围¶
-
强化学习的基本交互框架
-
Agent、Environment、State、Observation、Action、Reward
-
RL 与监督学习、SFT 的区别
-
MDP 五元组、马尔可夫性质、状态转移、奖励函数
-
trajectory、episode、timestep、return、discount factor
-
policy、state value、action value、advantage
-
Bellman expectation equation 与 Bellman optimality equation
-
model-based/model-free、on-policy/off-policy、exploration/exploitation
-
MDP 在 LLM、RLHF、Agent 任务中的抽象方式
一、强化学习基本框架¶
-
什么是强化学习?它和一般的监督学习最核心的目标差异是什么?
-
强化学习中的 Agent 和 Environment 分别指什么?
-
请描述一个标准的强化学习交互循环。
-
为什么说强化学习解决的是序列决策问题,而不是单步分类或回归问题?
-
强化学习中的训练数据从哪里来?它和固定监督数据集有什么区别?
-
什么是 reward hypothesis?它在强化学习中承担什么建模作用?
-
State 和 Observation 有什么区别?
-
离散动作空间和连续动作空间有什么区别?各举一个例子。
-
即时奖励、累计奖励和长期目标之间是什么关系?
-
什么是探索与利用的矛盾?为什么只利用当前最优动作可能有问题?
二、RL 与 SFT、监督学习的区别¶
-
SFT 的训练目标通常是什么?RL 的训练目标通常是什么?
-
为什么 SFT 的 token-level loss 不一定能反映最终回答质量?
-
RL 中的反馈为什么可能是稀疏和延迟的?
-
在大模型训练中,为什么通常先做 SFT,再考虑 RLHF 或其他偏好优化?
-
如果一个任务只有静态输入和标准答案,是否一定需要强化学习?请说明判断标准。
-
强化学习为什么容易受到奖励设计质量的影响?
-
RL 数据分布为什么会随策略变化?这会带来什么训练问题?
-
请用“模型回答问题”这个场景解释 SFT 和 RLHF 的优化对象差异。
三、MDP 定义与五元组¶
-
MDP 的全称是什么?它在强化学习中解决什么建模问题?
-
MDP 的五元组通常怎么写?每个元素分别代表什么?
-
状态空间 S 应该满足什么要求?为什么状态定义不好会影响学习?
-
动作空间 A 的粒度会如何影响 MDP 建模?
-
状态转移概率 P(s'|s,a) 表示什么?
-
奖励函数 R(s,a) 和 R(s,a,s') 的区别是什么?
-
折扣因子 gamma 的取值范围是什么?它控制什么?
-
初始状态分布和终止状态是否属于经典五元组?它们在实际建模中为什么仍然重要?
-
确定性环境和随机环境在 P(s'|s,a) 上有什么区别?
-
请用一个网格世界例子说明 S、A、P、R、gamma 如何定义。
四、马尔可夫性质与状态建模¶
-
请写出 MDP 中马尔可夫性质的数学表达。
-
“当前状态是历史的充分统计量”是什么意思?
-
马尔可夫性是否意味着历史完全没有影响?为什么?
-
什么是 POMDP?它和 MDP 的主要区别是什么?
-
如果观测不满足马尔可夫性,工程上可以怎样补救?
-
在多轮对话 Agent 中,状态可以包含哪些信息?
-
如果状态缺少关键隐藏变量,会对价值估计和策略学习造成什么影响?
-
马尔可夫过程、马尔可夫奖励过程和马尔可夫决策过程有什么递进关系?
五、轨迹、回报与价值函数¶
-
什么是 trajectory?请写出一条轨迹的典型形式。
-
timestep 和 episode 分别是什么?
-
在给定策略和环境时,一条轨迹的概率由哪些因素决定?
-
请写出折扣回报 G_t 的公式。
-
gamma 接近 0 和接近 1 分别代表什么偏好?
-
有限时域任务中 gamma 是否一定要小于 1?为什么?
-
状态价值函数 V^pi(s) 的定义是什么?
-
动作价值函数 Q^pi(s,a) 的定义是什么?
-
V^pi(s) 和 Q^pi(s,a) 之间有什么关系?
-
Advantage function A^pi(s,a) 表示什么?为什么有用?
-
即时奖励、回报、状态价值和动作价值这四个概念如何区分?
-
策略目标 J(pi) 通常如何用期望回报表示?
六、贝尔曼方程与最优性¶
-
贝尔曼方程的核心思想是什么?
-
请写出状态价值函数的贝尔曼期望方程。
-
请写出动作价值函数的贝尔曼期望方程。
-
贝尔曼期望方程中的“期望”来自哪些随机性?
-
请写出 V*(s) 的贝尔曼最优方程。
-
请写出 Q*(s,a) 的贝尔曼最优方程。
-
贝尔曼期望方程和贝尔曼最优方程的核心区别是什么?
-
什么是 policy evaluation?它和贝尔曼期望方程有什么关系?
-
什么是 policy improvement?它和 Q 值有什么关系?
-
Value Iteration 和 Policy Iteration 在思路上有什么区别?
-
什么是 Bellman backup?为什么它是很多 RL 算法的基础操作?
-
为什么说 Q-learning 与贝尔曼最优方程关系紧密?
七、方法分类与工程视角¶
-
Model-based RL 和 model-free RL 有什么区别?
-
On-policy 和 off-policy 有什么区别?各有什么优缺点?
-
Monte Carlo、Temporal Difference 和 Dynamic Programming 在信息来源上有什么区别?
-
奖励尺度过大或过小会带来什么问题?
-
什么是 reward hacking?请给一个大模型场景例子。
-
为什么强化学习通常比 SFT 更难训练和评估?
八、LLM、RLHF 与 Agent 场景¶
-
如何把 LLM token 生成过程抽象成一个 MDP?
-
如何把工具调用型 Agent 抽象成一个 MDP?
-
RLHF 中的奖励模型、参考模型和 KL 约束分别解决什么问题?
-
请完整设计一个“客服 Agent 完成退款任务”的 MDP 抽象,包括状态、动作、转移、奖励和终止条件。
预览时标签不可点<div class="