跳转至

十八:训推不一致自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484132&idx=1&sn=8fc1a24daebf00b70546a2f1b608e7dc&chksm=f01eb19dc769388b494fe0b6ef7580c394c42d8d4b4b80b1f3a8c1e5967fb817ee9d6c92ff9f#rd

覆盖范围

  • 训推不一致定义与典型来源

  • exposure bias、数据分布、解码策略、模板/mask 不一致

  • LLM RL 中 rollout/training logprob mismatch

  • PPO/GRPO/GSPO 中 ratio、KL、advantage 的失真

  • BF16/FP16、kernel、KV cache、MoE router 导致的不一致

  • R3、GSPO、TIS/MIS、true on-policy 等缓解思路

  • 度量、监控、排错和工程实践

一、基本概念

  • 什么是训推不一致?

  • 为什么训推不一致在大模型中很常见?

  • 训推不一致和普通分布偏移有什么关系?

  • 请给出三个非 RL 场景中的训推不一致例子。

  • 请给出三个 LLM RL 场景中的训推不一致例子。

  • 为什么训推不一致不一定会立刻体现在训练 loss 上?

  • 训推不一致和线上效果差之间是什么关系?

  • 面试中如何用一句话概括训推不一致?

二、传统序列建模与 Exposure Bias

  • 什么是 exposure bias?

  • 训练时 teacher forcing 和推理时自回归生成有什么区别?

  • 为什么生成模型推理时错误会累积?

  • exposure bias 和 RLHF 中的训推不一致有什么相同点?

  • exposure bias 和 rollout/training logprob mismatch 有什么不同点?

  • scheduled sampling 试图缓解什么问题?

  • 为什么只解决 exposure bias 不等于解决 LLM RL 的训推不一致?

  • 多轮对话中历史上下文变化如何导致训推不一致?

三、LLM RL 中的 Logprob Mismatch

  • LLM RL 中 rollout 阶段通常做什么?

  • LLM RL 中 training 阶段通常做什么?

  • 什么是 logprob mismatch?

  • 为什么同一 prompt/response 在 rollout engine 和 training engine 中 logprob 可能不同?

  • 请写出 token-level logprob difference 的公式。

  • PPO ratio 为什么对 old logprob 的正确性敏感?

  • 如果 old logp 来自 rollout engine,new logp 来自 training engine,会有什么风险?

  • 为什么 logprob mismatch 会被 exp 放大到 ratio mismatch?

  • sequence-level logprob mismatch 如何计算?

  • 为什么长序列会放大 token-level 小误差?

四、数值精度、Kernel 与系统栈

  • FP16 和 BF16 的主要格式差异是什么?

  • 为什么 BF16 在大模型训练中通常更稳定?

  • FP16 在什么情况下可能出现 overflow/underflow 问题?

  • BF16/FP16 不一致如何影响 logits 和 logprob?

  • 为什么 softmax/logsumexp 对数值差异敏感?

  • 不同 attention kernel 为什么可能导致训推不一致?

  • KV cache 精度为什么会影响 rollout logprob?

  • tensor parallel 或 pipeline parallel 切分不同会带来什么风险?

  • fused RMSNorm 或 fused logits processor 可能如何造成差异?

  • 为什么“权重完全一样”仍然可能出现 logprob mismatch?

五、模板、Mask、Position 与解码

  • chat template 不一致会导致什么问题?

  • prompt token 被计入 RL loss 会造成什么后果?

  • padding token 参与 logprob/KL 计算会造成什么后果?

  • left padding 和 right padding 为什么可能影响 position id?

  • EOS 和 stop words 处理不一致会造成什么问题?

  • response 被截断后 reward 和 mask 没对齐会造成什么问题?

  • temperature、top-k、top-p 与训推不一致有什么关系?

  • top-p 截断采样下 old logp 的语义为什么需要明确?

  • repetition penalty 如果 rollout 用了而 training 没用,会发生什么?

  • 为什么部署评估必须使用真实 inference stack?

六、MoE、R3 与 GSPO

  • MoE 模型中的 router 起什么作用?

  • 为什么 MoE router 对数值扰动敏感?

  • router 行为不一致如何放大 logprob mismatch?

  • R3 相关工作主要关注什么问题?

  • MoE 中 auxiliary load balancing loss 和 RL objective 可能有什么张力?

  • GSPO 的 sequence-level ratio 如何定义?

  • GSPO 为什么能缓解 token-level ratio 高方差?

  • GSPO 能否彻底消除训推不一致?为什么?

  • GSPO 为什么特别适合讨论 MoE/长序列 RL 稳定性?

  • R3、GSPO 和 dtype 对齐分别从哪些层面缓解不一致?

七、度量、监控与缓解

  • 如何度量 token-level logprob mismatch?

  • 如何度量 sequence-level logprob mismatch?

  • 训练中应该监控哪些 ratio 相关指标?

  • clip fraction 异常升高可能说明什么?

  • approx KL 异常和训推不一致有什么关系?

  • 什么是 true on-policy?它为什么重要?

  • 为什么常建议在 training engine 中 recompute old logp?

  • TIS 的基本思想是什么?

  • MIS 的基本思想是什么?

  • importance sampling 能完全解决训推不一致吗?为什么?

八、综合排错与设计

  • 请设计一个排查 rollout/training logprob mismatch 的步骤清单。

  • 如果训练 reward 上升但线上推理效果下降,你会如何排查训推不一致?

  • 如果同一 checkpoint 在 vLLM 和 PyTorch 中输出不同 logprob,你会检查哪些因素?

  • 请完整说明 PPO、GRPO、GSPO、DAPO、SAPO 中训推不一致分别会如何影响训练,以及各自有什么缓解思路。

            预览时标签不可点
    

    <div class="