跳转至

三十四:Long Context~YaRN 与 LongRoPE自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484420&idx=1&sn=74bee2ae34b76b9ae5c1ac717d078d40&chksm=f01eb77dc7693e6b9e2453524c2221aafe8593d6251d2b09c42840ac828bf0330297181cbcd0#rd

一、从 PI/NTK 到分段插值

  • 线性 Position Interpolation 的主要问题是什么?

  • NTK-aware scaling 相比线性插值有什么改进?

  • 为什么统一的 base scaling 仍然可能不是最优?

  • RoPE 频率维度的波长如何理解?

  • 高频短波长维度和低频长波长维度在位置建模中分别承担什么角色?

二、NTK-by-parts 与动态插值

  • 什么是 NTK-by-parts?

  • 为什么要把 RoPE 维度分成短波长、中间波长、长波长区域?

  • 请解释“外推频率”和“插值频率”的区别。

  • ramp mask 在分段插值中起什么作用?

  • 动态插值和固定插值有什么区别?

  • 动态插值为什么适合线上长度分布变化大的场景?

  • 动态插值和 KV cache 之间有什么潜在冲突?

三、YaRN

  • YaRN 主要解决什么问题?

  • YaRN 的核心机制可以拆成哪几部分?

  • beta_fastbeta_slow 的直觉是什么?

  • YaRN 为什么要在不同频率维度上使用不同插值强度?

  • YaRN 中的平滑过渡为什么重要?

  • YaRN 为什么还需要 attention scaling?

  • attention scaling 遗漏可能导致什么问题?

  • 请比较 YaRN 和普通 NTK-aware scaling。

  • 请比较 YaRN 和线性 Position Interpolation。

  • YaRN 是否一定不需要长上下文微调?为什么?

四、LongRoPE 与工程实践

  • LongRoPE 的核心直觉是什么?

  • LongRoPE 和 YaRN 的区别是什么?

  • 什么是非均匀位置插值?

  • 为什么极长上下文扩展通常需要渐进式扩展?

  • 在模型配置中看到 rope_type: yarn 时,需要检查哪些字段?

  • 为什么 original_max_position_embeddings 填错会导致严重问题?

  • 如果推理框架不支持某种 RoPE scaling,会出现什么现象?

  • 如何验证 YaRN/LongRoPE 扩展是否真的有效?

  • 为什么必须同时评估短上下文和长上下文?

  • 请用一段面试表达完整解释 YaRN。

  • 请写出一个抽象流程:如何根据维度生成 YaRN 的混合 inv_freq。

  • 如果 32k needle 测试正常,但长文档问答效果差,可能是什么原因?

            预览时标签不可点
    

    <div class="