跳转至

六:Embedding 与常用编码方法自测题

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483813&idx=1&sn=b5cc5e86b8de1cf7461967133e719cee&chksm=f01eb2dcc7693bca9b14045a00e39a4f00d9370233bc1b642b2279e481881d176abf12df41d0#rd

覆盖范围

  • embedding 的基本定义和作用

  • one-hot、embedding table、token embedding

  • 静态 embedding 与上下文 embedding

  • Word2Vec、CBOW、Skip-gram、negative sampling、hierarchical softmax

  • GloVe、FastText

  • sentence embedding、pooling、SBERT、SimCSE

  • bi-encoder、cross-encoder、dense retrieval、reranking

  • contrastive learning、in-batch negatives、hard negatives

  • BGE、BGE-M3、CONAN

  • 相似度计算、评测指标、RAG 工程问题

一、Embedding 基础

  • 请用 1 分钟解释什么是 embedding。

  • embedding 和 one-hot 编码有什么区别?

  • 为什么 embedding 可以表达语义相似,而 one-hot 很难表达?

  • token embedding、word embedding、sentence embedding、document embedding 有什么区别?

  • Transformer 中 embedding table 的 shape 通常是什么?如何从 token id 得到向量?

  • embedding table 和 LM head 之间可能有什么关系?

  • embedding 维度越大一定越好吗?为什么?

  • embedding 和 tokenizer 是同一个概念吗?请区分。

二、静态词向量与上下文表示

  • 什么是静态 embedding?它有什么优点和局限?

  • 多义词为什么是静态词向量的典型难点?

  • 什么是上下文 embedding?它如何解决多义词问题?

  • BERT 或 Transformer hidden states 为什么可以看作上下文 embedding?

  • 为什么直接取 BERT [CLS] 不一定得到高质量句向量?

  • token-level embedding 和 sentence-level embedding 的训练目标有什么差异?

三、Word2Vec

  • Word2Vec 的核心分布式假设是什么?

  • CBOW 的训练目标是什么?

  • Skip-gram 的训练目标是什么?

  • CBOW 和 Skip-gram 在训练速度、低频词表现上有什么差异?

  • Word2Vec 为什么能学习出语义相近词向量?

  • Word2Vec 原始 softmax 为什么计算代价高?

  • Negative sampling 的核心思想是什么?

  • 请写出 Skip-gram with negative sampling 的目标形式。

  • negative sampling 中负样本如何影响训练质量?

  • hierarchical softmax 的核心思想是什么?

  • Word2Vec 中窗口大小会影响什么语义特征?

四、GloVe 与 FastText

  • GloVe 的核心思想是什么?

  • GloVe 和 Word2Vec 的主要区别是什么?

  • GloVe 的共现矩阵 X_ij 表示什么?

  • GloVe 损失中为什么要使用 log X_ij 和权重函数?

  • FastText 相比 Word2Vec 引入了什么关键改进?

  • FastText 如何处理 OOV 或罕见词?

  • FastText 为什么对形态丰富语言更友好?

  • Word2Vec、GloVe、FastText 共同的局限是什么?

五、句向量与 Pooling

  • sentence embedding 的目标是什么?

  • 从 token hidden states 得到句向量有哪些常见 pooling 方法?

  • mean pooling 时为什么必须使用 attention mask?

  • [CLS] pooling、mean pooling、last token pooling 分别适合哪些场景?

  • 为什么句向量模型通常需要专门训练,而不是直接拿语言模型 hidden state 平均?

  • embedding 向量是否通常需要 L2 normalization?为什么?

六、SBERT、SimCSE 与对比学习

  • SBERT 相比普通 BERT 解决了什么问题?

  • Siamese encoder 在 SBERT 中起什么作用?

  • bi-encoder 和 cross-encoder 有什么区别?

  • 为什么 bi-encoder 适合大规模检索?

  • cross-encoder 为什么通常更准但更慢?

  • SimCSE 的无监督训练思路是什么?

  • SimCSE 的监督训练中 entailment 和 contradiction 样本分别如何使用?

  • contrastive learning 的目标是什么?

  • 请写出 InfoNCE/softmax contrastive loss 的基本形式。

  • temperature 在 contrastive loss 中起什么作用?

七、检索 Embedding、BGE 与 CONAN

  • dense retrieval 的基本流程是什么?

  • query embedding 和 document embedding 为什么需要在同一向量空间?

  • BGE 是什么?它通常用于什么场景?

  • BGE 中 query instruction 有什么作用?

  • BGE-M3 中 M3 分别指什么?

  • dense retrieval、sparse retrieval、multi-vector retrieval 各有什么特点?

  • embedding retrieval 和 reranker 在 RAG 中如何配合?

  • CONAN embedding 的核心关注点是什么?

  • dynamic hard negative mining 想解决什么问题?

  • cross-GPU balancing loss 或跨 GPU negatives 为什么有价值?

  • prompt-response pairs 为什么可以用于 embedding 训练?

八、相似度、评测与工程问题

  • dot product、cosine similarity、L2 distance 有什么区别?

  • 向量 L2 normalize 后,dot product 和 cosine similarity 有什么关系?

  • embedding 检索常用哪些评测指标?

  • MTEB 是什么?为什么不能只看 MTEB 排名选择 embedding 模型?

  • hard negatives 有什么好处和风险?

  • 什么是假负样本?它会怎样影响 embedding 训练?

  • chunk size 会如何影响 RAG 中的 embedding 检索?

  • 如果检索结果语义相关但关键词不匹配,或关键词匹配但语义不相关,可以如何改进?

  • 如果业务领域效果差,如何评估是否需要微调 embedding 模型?

  • 请总结第六天从经典 embedding 到现代检索 embedding 的完整知识链路。

            预览时标签不可点
    

    <div class="