跳转至

三十五:长上下文窗口分割自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484440&idx=1&sn=e9d3d552091719f40b81b6321ed5312b&chksm=f01eb761c7693e771cff430daa4fe7ad0214ddc0087d9d39d66b73dff277e6635ece65fa0dd0#rd

一、基础概念

  • 上下文窗口分割解决的是什么问题?

  • 它和 RoPE scaling 的区别是什么?

  • 固定 chunking、滑动窗口、并行窗口、流式窗口分别是什么?

  • 上下文窗口分割为什么不能天然解决全局长文档推理?

  • 在真实系统中,窗口分割通常会和哪些技术组合?

二、PCW

  • PCW 的全称和核心目标是什么?

  • PCW 如何让有限上下文模型利用多个窗口?

  • PCW 中 position id 为什么可能会重置或复用?

  • PCW 中 attention mask 的作用是什么?

  • PCW 适合什么类型的任务?

  • PCW 不适合什么类型的任务?

  • PCW 和普通 sliding window 有什么区别?

三、NBCE

  • NBCE 的核心思想是什么?

  • 请写出 NBCE 的 log 概率融合直觉公式。

  • NBCE 中为什么要减去先验项 log P(y)

  • NBCE 的条件独立假设意味着什么?

  • NBCE 的优点是什么?

  • NBCE 的局限是什么?

  • NBCE 和 PCW 的主要区别是什么?

四、StreamingLLM

  • StreamingLLM 想解决什么推理问题?

  • 为什么普通 KV cache 不适合无限长输入流?

  • 为什么简单 sliding window cache 会让模型退化?

  • 什么是 attention sink?

  • 为什么开头 token 即使语义不重要,也可能必须保留?

  • StreamingLLM 的 cache 由哪两部分组成?

  • StreamingLLM 如何把 KV cache 控制在固定大小?

  • StreamingLLM 能否回答被丢弃中间历史中的细节?为什么?

  • StreamingLLM 适合哪些场景?

  • StreamingLLM 不适合哪些场景?

  • StreamingLLM 与 RoPE scaling 是替代关系还是互补关系?

五、工程与排错

  • 实现流式窗口时,position_ids 应该注意什么?

  • 如果模型在长时间生成后突然质量崩掉,你会如何从 cache 策略排查?

  • 如果只保留最近窗口,模型输出重复或乱码,可能是什么原因?

  • 如何评估 StreamingLLM 是否有效?

  • 请用一段面试表达完整解释 StreamingLLM。

  • 请画出 PCW、NBCE、StreamingLLM 三者的计算流程差异。

            预览时标签不可点
    

    <div class="