三十四:Long Context~YaRN 与 LongRoPE自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484420&idx=1&sn=74bee2ae34b76b9ae5c1ac717d078d40&chksm=f01eb77dc7693e6b9e2453524c2221aafe8593d6251d2b09c42840ac828bf0330297181cbcd0#rd
一、从 PI/NTK 到分段插值¶
-
线性 Position Interpolation 的主要问题是什么?
-
NTK-aware scaling 相比线性插值有什么改进?
-
为什么统一的 base scaling 仍然可能不是最优?
-
RoPE 频率维度的波长如何理解?
-
高频短波长维度和低频长波长维度在位置建模中分别承担什么角色?
二、NTK-by-parts 与动态插值¶
-
什么是 NTK-by-parts?
-
为什么要把 RoPE 维度分成短波长、中间波长、长波长区域?
-
请解释“外推频率”和“插值频率”的区别。
-
ramp mask 在分段插值中起什么作用?
-
动态插值和固定插值有什么区别?
-
动态插值为什么适合线上长度分布变化大的场景?
-
动态插值和 KV cache 之间有什么潜在冲突?
三、YaRN¶
-
YaRN 主要解决什么问题?
-
YaRN 的核心机制可以拆成哪几部分?
-
beta_fast和beta_slow的直觉是什么? -
YaRN 为什么要在不同频率维度上使用不同插值强度?
-
YaRN 中的平滑过渡为什么重要?
-
YaRN 为什么还需要 attention scaling?
-
attention scaling 遗漏可能导致什么问题?
-
请比较 YaRN 和普通 NTK-aware scaling。
-
请比较 YaRN 和线性 Position Interpolation。
-
YaRN 是否一定不需要长上下文微调?为什么?
四、LongRoPE 与工程实践¶
-
LongRoPE 的核心直觉是什么?
-
LongRoPE 和 YaRN 的区别是什么?
-
什么是非均匀位置插值?
-
为什么极长上下文扩展通常需要渐进式扩展?
-
在模型配置中看到
rope_type: yarn时,需要检查哪些字段? -
为什么
original_max_position_embeddings填错会导致严重问题? -
如果推理框架不支持某种 RoPE scaling,会出现什么现象?
-
如何验证 YaRN/LongRoPE 扩展是否真的有效?
-
为什么必须同时评估短上下文和长上下文?
-
请用一段面试表达完整解释 YaRN。
-
请写出一个抽象流程:如何根据维度生成 YaRN 的混合 inv_freq。
-
如果 32k needle 测试正常,但长文档问答效果差,可能是什么原因?
预览时标签不可点<div class="