📚 LLM 教程 · 总目录
共 66 章,每章含正文、自测题、答案解析。点击进入阅读:
L01 · _自注意力Self-Attention
L03 · _Tokenizer
L04 · _位置编码与 RoPE
L05 · _Normalization 与 Pre-Norm_Post-Norm
L06 · _Embedding 与常用编码方法
L07 · _模型微调:LoRA 与 AdaLoRA
L08 · _模型微调:QLoRA与 PEFT 方法对比
L09 · _强化学习:强化学习基础与马尔可夫决策过程 MDP
L10 · _强化学习:Bellman Equation 与策略迭代算法
L11 · _强化学习:蒙特卡洛方法、Sarsa 与多步 Sarsa
L12 · _强化学习:Q-learning、Dyna-Q 与 DQN
L13 · _强化学习:策略梯度、REINFORCE 与 Actor-Critic
L14 · _强化学习:传统 PPO、RLHF 定义与 NLP 场景强化学习
L15 · _强化学习:RLHF-PPO 与 GRPO
L16 · _强化学习:DPO 与 ORPO
L17 · _强化学习:DAPO、GSPO 与 SAPO
L18 · _训推不一致
L19 · _模型压缩:量化、ZeroQuant、LLM.int8() 与 SmoothQuant
L20 · _模型压缩:GPTQ、AWQ、剪枝与蒸馏
L21 · _分布式训练:DDP、DP 与 FSDP
L22 · _分布式训练:DeepSpeed 与 ZeRO
L23 · _调参技巧
L24 · _Flash Attention
L25 · _提示工程
L26 · _RAG
L27 · _RAG 优化
L28 · _Chunking-free RAG
L29 · _向量索引
L30 · _Rerank
L31 · _Rerank模型
L32 · _Long Context
L33 · _Long Context~NTK-aware 插值
L34 · _Long Context~YaRN 与 LongRoPE
L35 · _长上下文窗口分割
L36 · _长上下文提示压缩
L37 · _更多提示压缩方法
L38 · _GraphRAG
L39 · _Agentic RAG
L40 · _Agent 概述
L41 · _CoT与ReAct
L42 · _Plan-and-Solve 规划方法
L43 · _反思 Reflexion
L44 · _Agent记忆
L46 · _多智能体为什么失败?
L47 · _MCP
L48 · _Skills与OpenClaw
L49 · _Harness Engineering
L50 · _LLM推理两阶段:Prefill 和 Decode
L51 · _KV cache
L52 · _推理评估方式
L53 · _vLLM-PagedAttention
L54 · _DistServe-PD分离
L55 · _Sarathi-Chunked Prefill
L56 · _Speculative Decoding-投机解码
L57 · _大模型推理链压缩
L58 · _大模型预训练定义与预训练数据集
L59 · _预训练过程、评估与继续预训练
L60 · _DeepSeek-R1
L61 · _DeepSeek-V3:MLA、DeepSeekMoE 与多 Token 预测
L62 · _DeepSeek 后续工作:NSA 与 DSA
L63 · _Qwen 2.5
L64 · _MiniMax-01
L65 · _Qwen 3 后训练
L99 · _独立文章_Qwen3-VL系列是如何理解视频时序的?