跳转至

九:强化学习:强化学习基础与马尔可夫决策过程 MDP自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483860&idx=1&sn=3f111ceb8ffe2f8f8f484c9205f79c7e&chksm=f01eb2adc7693bbbfb315e7b8428500b9323c15459b6cfab798940e928b98582971f5b88ffd8#rd

覆盖范围

  • 强化学习的基本交互框架

  • Agent、Environment、State、Observation、Action、Reward

  • RL 与监督学习、SFT 的区别

  • MDP 五元组、马尔可夫性质、状态转移、奖励函数

  • trajectory、episode、timestep、return、discount factor

  • policy、state value、action value、advantage

  • Bellman expectation equation 与 Bellman optimality equation

  • model-based/model-free、on-policy/off-policy、exploration/exploitation

  • MDP 在 LLM、RLHF、Agent 任务中的抽象方式

一、强化学习基本框架

  • 什么是强化学习?它和一般的监督学习最核心的目标差异是什么?

  • 强化学习中的 Agent 和 Environment 分别指什么?

  • 请描述一个标准的强化学习交互循环。

  • 为什么说强化学习解决的是序列决策问题,而不是单步分类或回归问题?

  • 强化学习中的训练数据从哪里来?它和固定监督数据集有什么区别?

  • 什么是 reward hypothesis?它在强化学习中承担什么建模作用?

  • State 和 Observation 有什么区别?

  • 离散动作空间和连续动作空间有什么区别?各举一个例子。

  • 即时奖励、累计奖励和长期目标之间是什么关系?

  • 什么是探索与利用的矛盾?为什么只利用当前最优动作可能有问题?

二、RL 与 SFT、监督学习的区别

  • SFT 的训练目标通常是什么?RL 的训练目标通常是什么?

  • 为什么 SFT 的 token-level loss 不一定能反映最终回答质量?

  • RL 中的反馈为什么可能是稀疏和延迟的?

  • 在大模型训练中,为什么通常先做 SFT,再考虑 RLHF 或其他偏好优化?

  • 如果一个任务只有静态输入和标准答案,是否一定需要强化学习?请说明判断标准。

  • 强化学习为什么容易受到奖励设计质量的影响?

  • RL 数据分布为什么会随策略变化?这会带来什么训练问题?

  • 请用“模型回答问题”这个场景解释 SFT 和 RLHF 的优化对象差异。

三、MDP 定义与五元组

  • MDP 的全称是什么?它在强化学习中解决什么建模问题?

  • MDP 的五元组通常怎么写?每个元素分别代表什么?

  • 状态空间 S 应该满足什么要求?为什么状态定义不好会影响学习?

  • 动作空间 A 的粒度会如何影响 MDP 建模?

  • 状态转移概率 P(s'|s,a) 表示什么?

  • 奖励函数 R(s,a) 和 R(s,a,s') 的区别是什么?

  • 折扣因子 gamma 的取值范围是什么?它控制什么?

  • 初始状态分布和终止状态是否属于经典五元组?它们在实际建模中为什么仍然重要?

  • 确定性环境和随机环境在 P(s'|s,a) 上有什么区别?

  • 请用一个网格世界例子说明 S、A、P、R、gamma 如何定义。

四、马尔可夫性质与状态建模

  • 请写出 MDP 中马尔可夫性质的数学表达。

  • “当前状态是历史的充分统计量”是什么意思?

  • 马尔可夫性是否意味着历史完全没有影响?为什么?

  • 什么是 POMDP?它和 MDP 的主要区别是什么?

  • 如果观测不满足马尔可夫性,工程上可以怎样补救?

  • 在多轮对话 Agent 中,状态可以包含哪些信息?

  • 如果状态缺少关键隐藏变量,会对价值估计和策略学习造成什么影响?

  • 马尔可夫过程、马尔可夫奖励过程和马尔可夫决策过程有什么递进关系?

五、轨迹、回报与价值函数

  • 什么是 trajectory?请写出一条轨迹的典型形式。

  • timestep 和 episode 分别是什么?

  • 在给定策略和环境时,一条轨迹的概率由哪些因素决定?

  • 请写出折扣回报 G_t 的公式。

  • gamma 接近 0 和接近 1 分别代表什么偏好?

  • 有限时域任务中 gamma 是否一定要小于 1?为什么?

  • 状态价值函数 V^pi(s) 的定义是什么?

  • 动作价值函数 Q^pi(s,a) 的定义是什么?

  • V^pi(s) 和 Q^pi(s,a) 之间有什么关系?

  • Advantage function A^pi(s,a) 表示什么?为什么有用?

  • 即时奖励、回报、状态价值和动作价值这四个概念如何区分?

  • 策略目标 J(pi) 通常如何用期望回报表示?

六、贝尔曼方程与最优性

  • 贝尔曼方程的核心思想是什么?

  • 请写出状态价值函数的贝尔曼期望方程。

  • 请写出动作价值函数的贝尔曼期望方程。

  • 贝尔曼期望方程中的“期望”来自哪些随机性?

  • 请写出 V*(s) 的贝尔曼最优方程。

  • 请写出 Q*(s,a) 的贝尔曼最优方程。

  • 贝尔曼期望方程和贝尔曼最优方程的核心区别是什么?

  • 什么是 policy evaluation?它和贝尔曼期望方程有什么关系?

  • 什么是 policy improvement?它和 Q 值有什么关系?

  • Value Iteration 和 Policy Iteration 在思路上有什么区别?

  • 什么是 Bellman backup?为什么它是很多 RL 算法的基础操作?

  • 为什么说 Q-learning 与贝尔曼最优方程关系紧密?

七、方法分类与工程视角

  • Model-based RL 和 model-free RL 有什么区别?

  • On-policy 和 off-policy 有什么区别?各有什么优缺点?

  • Monte Carlo、Temporal Difference 和 Dynamic Programming 在信息来源上有什么区别?

  • 奖励尺度过大或过小会带来什么问题?

  • 什么是 reward hacking?请给一个大模型场景例子。

  • 为什么强化学习通常比 SFT 更难训练和评估?

八、LLM、RLHF 与 Agent 场景

  • 如何把 LLM token 生成过程抽象成一个 MDP?

  • 如何把工具调用型 Agent 抽象成一个 MDP?

  • RLHF 中的奖励模型、参考模型和 KL 约束分别解决什么问题?

  • 请完整设计一个“客服 Agent 完成退款任务”的 MDP 抽象,包括状态、动作、转移、奖励和终止条件。

            预览时标签不可点
    

    <div class="