跳转至

九:强化学习:强化学习基础与马尔可夫决策过程 MDP自测题答案

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483865&idx=1&sn=4fa5c40849f80c45053d2eccc42c4232&chksm=f01eb2a0c7693bb6c2b21d62663e262aa04e80bee6d3fe6e17ddee741cd7f7b9251e1abfaf67#rd

参考资料

  • 动手学强化学习:初探强化学习:http://hrl.boyuai.com/chapter/1/%E5%88%9D%E6%8E%A2%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/

  • 动手学强化学习:马尔可夫决策过程:http://hrl.boyuai.com/chapter/1/%E9%A9%AC%E5%B0%94%E5%8F%AF%E5%A4%AB%E5%86%B3%E7%AD%96%E8%BF%87%E7%A8%8B/

  • CSDN 课程笔记:强化学习的数学原理基本概念:https://blog.csdn.net/qq_64671439/article/details/135299345

  • Sutton and Barto, Reinforcement Learning: An Introduction, 2nd Edition:http://incompleteideas.net/book/RLbook2020.pdf

  • OpenAI Spinning Up: Key Concepts in RL:https://spinningup.openai.com/en/latest/spinningup/rl_intro.html

  • Hugging Face Deep RL Course: The Reinforcement Learning Framework:https://huggingface.co/learn/deep-rl-course/unit1/rl-framework?fw=pt

评分标准

  • 合格:能说清 RL 交互循环、MDP 五元组、马尔可夫性质、return、V/Q 和 Bellman 的基本定义。

  • 良好:能写出核心公式,并能区分 SFT/RL、V/Q、期望方程/最优方程、model-based/model-free、on-policy/off-policy。

  • 优秀:能把 MDP 抽象迁移到 LLM、RLHF、Agent 场景,能指出奖励设计、状态不充分、分布偏移、reward hacking 等工程风险。

一、强化学习基本框架

1. 什么是强化学习?它和一般的监督学习最核心的目标差异是什么?

强化学习研究智能体如何通过和环境交互学习策略,使期望累计奖励最大化。监督学习通常学习固定样本上的输入到标签映射,目标是拟合标签;强化学习优化的是一串动作在未来产生的长期效果。 评分点:说出交互、策略、累计奖励、长期目标;能对比监督学习的固定标签。

2. 强化学习中的 Agent 和 Environment 分别指什么?

Agent 是做决策的主体,根据状态或观测选择动作。Environment 是外部系统,接收动作后更新状态,并返回奖励和下一状态。Agent 学习策略,Environment 定义任务动态和反馈。

3. 请描述一个标准的强化学习交互循环。

在时刻 t,Agent 观察到 S_tO_t,根据策略选择动作 A_t。Environment 接收动作后转移到 S_{t+1},并返回奖励 R_{t+1}。循环继续,形成轨迹:

S_t -> A_t -> R_{t+1}, S_{t+1}

4. 为什么说强化学习解决的是序列决策问题,而不是单步分类或回归问题?

因为当前动作会影响后续状态、后续可选动作和未来奖励。一个动作短期看可能收益低,但长期有价值;也可能短期奖励高但导致坏状态。分类或回归通常只评价当前样本预测,而 RL 要评价整条轨迹的长期回报。

5. 强化学习中的训练数据从哪里来?它和固定监督数据集有什么区别?

RL 数据来自策略与环境交互,形式通常是 (s, a, r, s') 或完整轨迹。监督学习数据通常预先固定,形式是 (x, y)。RL 的数据分布会随策略变化,策略变了,访问到的状态和动作分布也会变。

6. 什么是 reward hypothesis?它在强化学习中承担什么建模作用?

Reward hypothesis 认为目标可以被表述为期望累计奖励最大化。它把复杂任务目标压缩成奖励信号,使策略优化可以围绕回报展开。局限是奖励设计必须足够代表真实目标,否则会引入偏差。

7. State 和 Observation 有什么区别?

State 是环境的完整状态,理论上包含预测未来所需的信息。Observation 是智能体实际看到的信息,可能只是 state 的一部分。完全可观测时 observation 可以等同于 state;部分可观测时需要记忆或状态估计。

8. 离散动作空间和连续动作空间有什么区别?各举一个例子。

离散动作空间中动作数量有限,例如网格世界里的上、下、左、右。连续动作空间中动作是连续变量,例如机器人关节力矩、自动驾驶方向盘角度。动作空间类型会影响算法选择和策略参数化方式。

9. 即时奖励、累计奖励和长期目标之间是什么关系?

即时奖励是单步反馈,累计奖励是多个时刻奖励的折扣和,长期目标是最大化累计奖励的期望。RL 不只追求当前一步奖励,而是通过策略让未来整体回报最大。

10. 什么是探索与利用的矛盾?为什么只利用当前最优动作可能有问题?

探索是尝试不确定动作以发现潜在更好策略,利用是选择当前估计最优动作获取收益。只利用会依赖已有估计,可能错过高回报区域并陷入局部最优。只探索则样本效率低、短期表现差。

二、RL 与 SFT、监督学习的区别

11. SFT 的训练目标通常是什么?RL 的训练目标通常是什么?

SFT 通常用交叉熵让模型输出接近标注答案或示范数据。RL 通常最大化策略产生轨迹的期望累计奖励:

maximize J(pi) = E_{tau ~ pi}[G_0]

12. 为什么 SFT 的 token-level loss 不一定能反映最终回答质量?

Token-level loss 衡量模型是否复现参考答案的每个 token,但最终质量可能取决于事实性、帮助性、安全性、格式、用户满意度和整体任务成功。多个不同答案都可能正确,单一参考答案无法覆盖所有高质量输出。

13. RL 中的反馈为什么可能是稀疏和延迟的?

很多任务只有结束时才知道成败,例如一局游戏胜负、一次工具链是否完成任务、一个回答是否被用户接受。中间动作没有明确标签,最终奖励需要反向归因到前面的决策。

14. 在大模型训练中,为什么通常先做 SFT,再考虑 RLHF 或其他偏好优化?

SFT 先让模型学会基本指令遵循、格式和任务能力,提供稳定初始策略。直接 RL 搜索空间太大、奖励稀疏、训练不稳定。RLHF 通常在 SFT 基础上微调行为偏好和整体质量。

15. 如果一个任务只有静态输入和标准答案,是否一定需要强化学习?请说明判断标准。

不一定。若任务可以用固定数据和明确标签充分描述,监督学习更简单稳定。需要 RL 的典型条件是:动作影响后续状态、目标是长期回报、反馈来自环境交互、没有明确逐步标签或需要探索。

16. 强化学习为什么容易受到奖励设计质量的影响?

策略直接优化奖励。如果奖励与真实目标不一致,模型会利用奖励漏洞,学到高奖励但低真实价值的行为。奖励过稀疏会难学,奖励过密但错误会引导偏差。

17. RL 数据分布为什么会随策略变化?这会带来什么训练问题?

数据由策略采样产生,策略改变后访问的状态、动作和轨迹都会改变。问题包括分布偏移、旧数据失效、训练不稳定、过度利用奖励模型漏洞、评估数据不覆盖新行为。

18. 请用“模型回答问题”这个场景解释 SFT 和 RLHF 的优化对象差异。

SFT 让模型在给定问题下模仿人工答案,主要优化 token 级似然。RLHF 让模型生成答案后由奖励模型或偏好信号评分,优化整体回答的帮助性、真实性、安全性和用户偏好。SFT 学“怎么像示范”,RLHF 学“整体上什么回答更被偏好”。

三、MDP 定义与五元组

19. MDP 的全称是什么?它在强化学习中解决什么建模问题?

MDP 是 Markov Decision Process,马尔可夫决策过程。它把序列决策问题抽象为状态、动作、状态转移、奖励和折扣因子,使 RL 问题可以被数学定义和算法求解。

20. MDP 的五元组通常怎么写?每个元素分别代表什么?

通常写成:

M = (S, A, P, R, gamma)
S 是状态空间,A 是动作空间,P(s'|s,a) 是状态转移概率,R 是奖励函数,gamma 是折扣因子。

21. 状态空间 S 应该满足什么要求?为什么状态定义不好会影响学习?

状态应尽量包含预测下一状态和奖励所需的信息,也就是尽量满足马尔可夫性。如果状态缺少关键信息,相同状态下未来分布会不稳定,价值估计噪声变大,策略可能学到错误动作。

22. 动作空间 A 的粒度会如何影响 MDP 建模?

动作粒度决定每一步的决策范围和 horizon。粒度太细,例如 token 级动作,episode 很长、奖励更延迟。粒度太粗,例如一次生成完整方案,动作空间巨大、探索困难。合适粒度需要平衡可控性和学习难度。

23. 状态转移概率 P(s'|s,a) 表示什么?

它表示在当前状态 s 执行动作 a 后,环境转移到下一个状态 s' 的概率:

P(s'|s,a) = Pr(S_{t+1}=s' | S_t=s, A_t=a)
它描述环境动态。

24. 奖励函数 R(s,a) 和 R(s,a,s') 的区别是什么?

R(s,a) 表示奖励只依赖当前状态和动作,通常是期望奖励。R(s,a,s') 表示奖励还依赖实际转移到的下一个状态。后者建模更细,适合奖励由转移结果决定的场景。

25. 折扣因子 gamma 的取值范围是什么?它控制什么?

通常 0 <= gamma <= 1gamma 控制未来奖励的权重。越接近 0 越重视短期奖励,越接近 1 越重视长期奖励。在无限时域中,gamma < 1 也有助于回报收敛。

26. 初始状态分布和终止状态是否属于经典五元组?它们在实际建模中为什么仍然重要?

经典五元组常不包含它们,但实际任务通常需要定义初始状态分布 rho_0 和终止条件。它们决定训练和评估从哪里开始、episode 何时结束、回报如何累计。

27. 确定性环境和随机环境在 P(s'|s,a) 上有什么区别?

确定性环境中,给定 s,a 后下一个状态唯一,某个 s' 的概率为 1。随机环境中,给定 s,a 后可能转移到多个状态,每个状态有不同概率。

28. 请用一个网格世界例子说明 S、A、P、R、gamma 如何定义。

S 是所有格子位置,A 是上、下、左、右。P 表示执行动作后的移动概率,例如 0.8 按预期移动、0.2 滑到旁边。R 可以设为到达目标 +10,撞墙或每步 -1。gamma 设为 0.9 表示重视较长期到达目标的收益。

四、马尔可夫性质与状态建模

29. 请写出 MDP 中马尔可夫性质的数学表达。

Pr(S_{t+1}=s' | S_0,A_0,...,S_t=s,A_t=a)
= Pr(S_{t+1}=s' | S_t=s,A_t=a)
也可以扩展到奖励分布。核心是未来只依赖当前状态和动作。

30. “当前状态是历史的充分统计量”是什么意思?

意思是当前状态已经压缩了所有对预测未来有用的历史信息。只要知道当前状态和动作,就不需要完整历史来预测下一状态和奖励分布。

31. 马尔可夫性是否意味着历史完全没有影响?为什么?

不是。历史可以通过当前状态影响未来。马尔可夫性只是说在条件化当前状态后,额外历史不再提供新的预测信息。例如棋盘状态由历史走子形成,但做下一步时通常只需要当前棋盘。

32. 什么是 POMDP?它和 MDP 的主要区别是什么?

POMDP 是部分可观测马尔可夫决策过程。MDP 假设智能体能获得满足马尔可夫性的状态,POMDP 中智能体只能看到部分观测,隐藏状态不能完全获得,因此需要记忆或 belief state。

33. 如果观测不满足马尔可夫性,工程上可以怎样补救?

可以拼接历史窗口、引入 RNN/Transformer 记忆、维护 belief state、检索历史信息、记录工具执行状态、增加传感器或特征。目标是让决策输入更接近充分状态。

34. 在多轮对话 Agent 中,状态可以包含哪些信息?

可以包含系统提示词、用户目标、对话历史、已生成回复、工具调用结果、外部检索内容、任务进度、用户约束、安全策略、成本和时延信息。状态设计要服务于后续动作和奖励预测。

35. 如果状态缺少关键隐藏变量,会对价值估计和策略学习造成什么影响?

同一个观测可能对应多个真实状态,导致转移和奖励分布混合。价值函数会高方差或有偏,策略可能在看似相同的输入下需要不同动作,最终表现为不稳定和泛化差。

36. 马尔可夫过程、马尔可夫奖励过程和马尔可夫决策过程有什么递进关系?

马尔可夫过程只有状态和状态转移。马尔可夫奖励过程在此基础上加入奖励和折扣。马尔可夫决策过程再加入动作,使状态转移和奖励依赖智能体动作。

五、轨迹、回报与价值函数

37. 什么是 trajectory?请写出一条轨迹的典型形式。

Trajectory 是一次交互产生的序列,典型形式为:

tau = (S_0, A_0, R_1, S_1, A_1, R_2, ..., S_T)
它记录状态、动作和奖励随时间的演化。

38. timestep 和 episode 分别是什么?

Timestep 是交互序列中的一个时间步。Episode 是从初始状态到终止状态的一整段轨迹,例如一局游戏、一次任务执行、一次对话流程。

39. 在给定策略和环境时,一条轨迹的概率由哪些因素决定?

由初始状态分布、策略动作概率和环境转移概率共同决定:

Pr(tau) = rho_0(S_0) * product_t pi(A_t|S_t) * P(S_{t+1}|S_t,A_t)
如果奖励也随机,还要包含奖励分布。

40. 请写出折扣回报 G_t 的公式。

G_t = R_{t+1} + gamma R_{t+2} + gamma^2 R_{t+3} + ...
&nbsp; &nbsp; = sum_{k=0}^{infty} gamma^k R_{t+k+1}
有限 episode 中求和到终止时刻即可。

41. gamma 接近 0 和接近 1 分别代表什么偏好?

gamma 接近 0 时更重视短期奖励,远期奖励几乎不影响决策。gamma 接近 1 时更重视长期累计收益,更适合需要长规划的任务,但也可能带来更高方差和更难的信用分配。

42. 有限时域任务中 gamma 是否一定要小于 1?为什么?

不一定。有限时域回报项数有限,只要奖励有界,gamma=1 也可定义。无限时域中常用 gamma<1 让回报收敛并控制远期影响。

43. 状态价值函数 V^pi(s) 的定义是什么?

V^pi(s) 是从状态 s 出发,并遵循策略 pi 后能获得的期望回报:

V^pi(s) = E_pi[G_t | S_t=s]

44. 动作价值函数 Q^pi(s,a) 的定义是什么?

Q^pi(s,a) 是在状态 s 先执行动作 a,之后遵循策略 pi 能获得的期望回报:

Q^pi(s,a) = E_pi[G_t | S_t=s, A_t=a]

45. V^pi(s) 和 Q^pi(s,a) 之间有什么关系?

状态价值是按策略对动作价值求期望:

V^pi(s) = sum_a pi(a|s) Q^pi(s,a)
连续动作时求和换成积分。

46. Advantage function A^pi(s,a) 表示什么?为什么有用?

优势函数:

A^pi(s,a) = Q^pi(s,a) - V^pi(s)
它表示动作 a 比当前状态下策略平均水平好多少。策略梯度和 PPO 中常用 advantage 判断应该增加还是降低某个动作概率,并降低估计方差。

47. 即时奖励、回报、状态价值和动作价值这四个概念如何区分?

即时奖励是一步反馈。回报是一串未来奖励的折扣和。状态价值是从某状态开始的期望回报。动作价值是从某状态先执行某动作后的期望回报。它们从单步反馈逐步上升到长期期望评价。

48. 策略目标 J(pi) 通常如何用期望回报表示?

常见写法:

J(pi) = E_{tau ~ pi}[G_0]
也可以写成从初始状态分布出发的期望:

J(pi) = E_{S_0 ~ rho_0}[V^pi(S_0)]

六、贝尔曼方程与最优性

49. 贝尔曼方程的核心思想是什么?

贝尔曼方程把长期价值递归分解为即时奖励加下一状态价值:

value = immediate reward + discounted future value
这让价值估计可以通过局部备份和动态规划思想求解。

50. 请写出状态价值函数的贝尔曼期望方程。

V^pi(s)
= sum_a pi(a|s) [ R(s,a) + gamma sum_{s'} P(s'|s,a) V^pi(s') ]
它表示固定策略下,状态价值等于所有动作及后续状态的期望。

51. 请写出动作价值函数的贝尔曼期望方程。

Q^pi(s,a)
= R(s,a) + gamma sum_{s'} P(s'|s,a) sum_{a'} pi(a'|s') Q^pi(s',a')
先固定当前动作 a,再对下一状态和下一动作求期望。

52. 贝尔曼期望方程中的“期望”来自哪些随机性?

主要来自策略的动作采样、环境的状态转移随机性、奖励随机性和初始状态随机性。在方程中通常体现为对 pi(a|s)P(s'|s,a) 求和或积分。

53. 请写出 V*(s) 的贝尔曼最优方程。

V*(s) = max_a [ R(s,a) + gamma sum_{s'} P(s'|s,a) V*(s') ]
它表示最优价值来自选择能最大化即时奖励和未来最优价值的动作。

54. 请写出 Q*(s,a) 的贝尔曼最优方程。

Q*(s,a)
= R(s,a) + gamma sum_{s'} P(s'|s,a) max_{a'} Q*(s',a')
当前先执行 a,到达下一状态后选择最优动作。

55. 贝尔曼期望方程和贝尔曼最优方程的核心区别是什么?

期望方程评估给定策略,对动作按 pi 求期望。最优方程寻找最优策略,对动作取 max。前者回答“这个策略有多好”,后者回答“最优能做到多好”。

56. 什么是 policy evaluation?它和贝尔曼期望方程有什么关系?

Policy evaluation 是在固定策略 pi 下估计 V^piQ^pi。贝尔曼期望方程给出了这些价值函数必须满足的递归关系,因此是策略评估的理论基础。

57. 什么是 policy improvement?它和 Q 值有什么关系?

Policy improvement 是基于当前价值估计构造更好的策略。若已知 Q^pi(s,a),可以在每个状态选择 Q 值更高的动作,例如贪心策略:

pi_new(s) = argmax_a Q^pi(s,a)

58. Value Iteration 和 Policy Iteration 在思路上有什么区别?

Policy Iteration 交替做 policy evaluation 和 policy improvement。Value Iteration 把评估和改进合在一起,反复用贝尔曼最优备份更新价值。前者每轮评估更充分,后者单轮更轻量。

59. 什么是 Bellman backup?为什么它是很多 RL 算法的基础操作?

Bellman backup 是用“即时奖励 + 折扣后的下一状态价值”更新当前状态或动作价值。许多算法都在构造不同形式的 backup target,例如 TD target、Q-learning target、value iteration target。

60. 为什么说 Q-learning 与贝尔曼最优方程关系紧密?

Q-learning 的目标是逼近 Q*,更新目标使用:

r + gamma max_{a'} Q(s',a')
这正是 Q 的贝尔曼最优方程右侧的采样形式,因此 Q-learning 是基于最优 Bellman backup 的 model-free 方法。

七、方法分类与工程视角

61. Model-based RL 和 model-free RL 有什么区别?

Model-based RL 显式学习或使用环境模型 PR,可以通过模型规划。Model-free RL 不显式建模环境动态,而是直接从经验中学习价值函数或策略。前者样本效率可能更高但受模型误差影响,后者更直接但通常需要更多交互数据。

62. On-policy 和 off-policy 有什么区别?各有什么优缺点?

On-policy 用当前策略采样的数据更新当前策略,分布匹配好但样本效率较低。Off-policy 可以用旧策略或其他策略的数据学习目标策略,样本效率高但要处理分布偏移和重要性修正问题。

63. Monte Carlo、Temporal Difference 和 Dynamic Programming 在信息来源上有什么区别?

Dynamic Programming 需要已知环境模型,用 Bellman 方程全量或期望更新。Monte Carlo 不需要模型,但要等 episode 结束后用真实回报更新。Temporal Difference 不需要模型,也不必等 episode 结束,用一步或多步 bootstrap target 更新。

64. 奖励尺度过大或过小会带来什么问题?

奖励过大可能导致价值估计数值不稳定、梯度过大、策略更新过猛。奖励过小可能导致学习信号弱、优势估计噪声占主导。工程上常做 reward normalization、clipping 或调节 loss 系数。

65. 什么是 reward hacking?请给一个大模型场景例子。

Reward hacking 是策略利用奖励函数漏洞获得高分,但行为不符合真实目标。大模型例子:奖励模型偏好长答案,模型学会输出冗长但空洞的内容;或奖励模型偏好自信语气,模型学会编造看似可信的事实。

66. 为什么强化学习通常比 SFT 更难训练和评估?

RL 有探索、延迟奖励、信用分配、非平稳数据分布、奖励设计、策略崩塌和高方差估计等问题。评估也不能只看静态 loss,而要看交互结果、长期回报、安全性和泛化。

八、LLM、RLHF 与 Agent 场景

67. 如何把 LLM token 生成过程抽象成一个 MDP?

可以把 state 定义为 prompt 加已生成 token,action 定义为下一个 token,transition 是把 token 追加到上下文,reward 可以在结束时由奖励模型、规则或任务结果给出,终止条件是生成 EOS 或达到最大长度。 评分点:说明 token-level action、上下文状态、append transition、sequence-level reward 和奖励延迟。

68. 如何把工具调用型 Agent 抽象成一个 MDP?

State 可以包含用户目标、对话历史、已知事实、工具结果和任务进度。Action 可以是回复用户、调用工具、检索、追问、规划下一步。Transition 由工具返回、用户反馈和外部系统变化决定。Reward 可以由任务成功、成本、时延、安全和用户满意度组成。

69. RLHF 中的奖励模型、参考模型和 KL 约束分别解决什么问题?

奖励模型把人类偏好转成可优化的标量奖励。参考模型通常是 SFT 模型,用来提供行为锚点。KL 约束限制新策略偏离参考模型过远,降低语言质量崩坏、过度优化奖励模型和分布漂移风险。

70. 请完整设计一个“客服 Agent 完成退款任务”的 MDP 抽象,包括状态、动作、转移、奖励和终止条件。

一种设计:

S:
&nbsp; 用户诉求、订单信息、退款政策、对话历史、身份验证状态、工具结果、当前流程阶段

A:
&nbsp; 询问补充信息、调用订单查询、调用退款接口、解释政策、升级人工、拒绝不合规请求、结束对话

P:
&nbsp; 工具调用返回结果、用户补充信息或追问、订单状态变化、退款接口成功或失败

R:
&nbsp; 成功完成合规退款 +高分
&nbsp; 解决用户问题 +分
&nbsp; 错误退款、违反政策、泄露隐私 -大分
&nbsp; 过多轮次、无效工具调用、用户不满意 -分

gamma:
&nbsp; 例如 0.95,兼顾尽快解决和长期任务成功

termination:
&nbsp; 退款完成、确认无法退款并解释清楚、升级人工、用户离开、达到最大轮次
优秀答案还应指出:状态要包含政策和验证信息以满足马尔可夫性;奖励要防止 Agent 为了快速结束而损害合规;评估要看成功率、合规率、用户满意度、成本和安全事件。

            预览时标签不可点




































<div class="