六:Embedding 与常用编码方法自测题¶
来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247483813&idx=1&sn=b5cc5e86b8de1cf7461967133e719cee&chksm=f01eb2dcc7693bca9b14045a00e39a4f00d9370233bc1b642b2279e481881d176abf12df41d0#rd
覆盖范围¶
-
embedding 的基本定义和作用
-
one-hot、embedding table、token embedding
-
静态 embedding 与上下文 embedding
-
Word2Vec、CBOW、Skip-gram、negative sampling、hierarchical softmax
-
GloVe、FastText
-
sentence embedding、pooling、SBERT、SimCSE
-
bi-encoder、cross-encoder、dense retrieval、reranking
-
contrastive learning、in-batch negatives、hard negatives
-
BGE、BGE-M3、CONAN
-
相似度计算、评测指标、RAG 工程问题
一、Embedding 基础¶
-
请用 1 分钟解释什么是 embedding。
-
embedding 和 one-hot 编码有什么区别?
-
为什么 embedding 可以表达语义相似,而 one-hot 很难表达?
-
token embedding、word embedding、sentence embedding、document embedding 有什么区别?
-
Transformer 中 embedding table 的 shape 通常是什么?如何从 token id 得到向量?
-
embedding table 和 LM head 之间可能有什么关系?
-
embedding 维度越大一定越好吗?为什么?
-
embedding 和 tokenizer 是同一个概念吗?请区分。
二、静态词向量与上下文表示¶
-
什么是静态 embedding?它有什么优点和局限?
-
多义词为什么是静态词向量的典型难点?
-
什么是上下文 embedding?它如何解决多义词问题?
-
BERT 或 Transformer hidden states 为什么可以看作上下文 embedding?
-
为什么直接取 BERT
[CLS]不一定得到高质量句向量? -
token-level embedding 和 sentence-level embedding 的训练目标有什么差异?
三、Word2Vec¶
-
Word2Vec 的核心分布式假设是什么?
-
CBOW 的训练目标是什么?
-
Skip-gram 的训练目标是什么?
-
CBOW 和 Skip-gram 在训练速度、低频词表现上有什么差异?
-
Word2Vec 为什么能学习出语义相近词向量?
-
Word2Vec 原始 softmax 为什么计算代价高?
-
Negative sampling 的核心思想是什么?
-
请写出 Skip-gram with negative sampling 的目标形式。
-
negative sampling 中负样本如何影响训练质量?
-
hierarchical softmax 的核心思想是什么?
-
Word2Vec 中窗口大小会影响什么语义特征?
四、GloVe 与 FastText¶
-
GloVe 的核心思想是什么?
-
GloVe 和 Word2Vec 的主要区别是什么?
-
GloVe 的共现矩阵
X_ij表示什么? -
GloVe 损失中为什么要使用
log X_ij和权重函数? -
FastText 相比 Word2Vec 引入了什么关键改进?
-
FastText 如何处理 OOV 或罕见词?
-
FastText 为什么对形态丰富语言更友好?
-
Word2Vec、GloVe、FastText 共同的局限是什么?
五、句向量与 Pooling¶
-
sentence embedding 的目标是什么?
-
从 token hidden states 得到句向量有哪些常见 pooling 方法?
-
mean pooling 时为什么必须使用 attention mask?
-
[CLS]pooling、mean pooling、last token pooling 分别适合哪些场景? -
为什么句向量模型通常需要专门训练,而不是直接拿语言模型 hidden state 平均?
-
embedding 向量是否通常需要 L2 normalization?为什么?
六、SBERT、SimCSE 与对比学习¶
-
SBERT 相比普通 BERT 解决了什么问题?
-
Siamese encoder 在 SBERT 中起什么作用?
-
bi-encoder 和 cross-encoder 有什么区别?
-
为什么 bi-encoder 适合大规模检索?
-
cross-encoder 为什么通常更准但更慢?
-
SimCSE 的无监督训练思路是什么?
-
SimCSE 的监督训练中 entailment 和 contradiction 样本分别如何使用?
-
contrastive learning 的目标是什么?
-
请写出 InfoNCE/softmax contrastive loss 的基本形式。
-
temperature 在 contrastive loss 中起什么作用?
七、检索 Embedding、BGE 与 CONAN¶
-
dense retrieval 的基本流程是什么?
-
query embedding 和 document embedding 为什么需要在同一向量空间?
-
BGE 是什么?它通常用于什么场景?
-
BGE 中 query instruction 有什么作用?
-
BGE-M3 中 M3 分别指什么?
-
dense retrieval、sparse retrieval、multi-vector retrieval 各有什么特点?
-
embedding retrieval 和 reranker 在 RAG 中如何配合?
-
CONAN embedding 的核心关注点是什么?
-
dynamic hard negative mining 想解决什么问题?
-
cross-GPU balancing loss 或跨 GPU negatives 为什么有价值?
-
prompt-response pairs 为什么可以用于 embedding 训练?
八、相似度、评测与工程问题¶
-
dot product、cosine similarity、L2 distance 有什么区别?
-
向量 L2 normalize 后,dot product 和 cosine similarity 有什么关系?
-
embedding 检索常用哪些评测指标?
-
MTEB 是什么?为什么不能只看 MTEB 排名选择 embedding 模型?
-
hard negatives 有什么好处和风险?
-
什么是假负样本?它会怎样影响 embedding 训练?
-
chunk size 会如何影响 RAG 中的 embedding 检索?
-
如果检索结果语义相关但关键词不匹配,或关键词匹配但语义不相关,可以如何改进?
-
如果业务领域效果差,如何评估是否需要微调 embedding 模型?
-
请总结第六天从经典 embedding 到现代检索 embedding 的完整知识链路。
预览时标签不可点<div class="