跳转至

📚 LLM 教程 · 总目录

共 66 章 · 156 篇文件,每章含正文、自测题、答案解析。点击卡片进入阅读:

66章节
156篇文件
3格式 / 章
L01

自注意力Self-Attention

L02

Transformer 与 Decoding

L04

位置编码与 RoPE

L05

Normalization 与 Pre-Norm_Post-Norm

L06

Embedding 与常用编码方法

L07

模型微调:LoRA 与 AdaLoRA

L08

模型微调:QLoRA与 PEFT 方法对比

L09

强化学习:强化学习基础与马尔可夫决策过程 MDP

L10

强化学习:Bellman Equation 与策略迭代算法

L11

强化学习:蒙特卡洛方法、Sarsa 与多步 Sarsa

L12

强化学习:Q-learning、Dyna-Q 与 DQN

L13

强化学习:策略梯度、REINFORCE 与 Actor-Critic

L14

强化学习:传统 PPO、RLHF 定义与 NLP 场景强化学习

L15

强化学习:RLHF-PPO 与 GRPO

L16

强化学习:DPO 与 ORPO

L17

强化学习:DAPO、GSPO 与 SAPO

L18

训推不一致

L19

模型压缩:量化、ZeroQuant、LLM.int8() 与 SmoothQuant

L20

模型压缩:GPTQ、AWQ、剪枝与蒸馏

L21

分布式训练:DDP、DP 与 FSDP

L22

分布式训练:DeepSpeed 与 ZeRO

L24

Flash Attention

L28

Chunking-free RAG

L33

Long Context~NTK-aware 插值

L34

Long Context~YaRN 与 LongRoPE

L35

长上下文窗口分割

L36

长上下文提示压缩

L37

更多提示压缩方法

L42

Plan-and-Solve 规划方法

L43

反思 Reflexion

L44

Agent记忆

L46

多智能体为什么失败?

L47

MCP

L48

Skills与OpenClaw

L49

Harness Engineering

L50

LLM推理两阶段:Prefill 和 Decode

L52

推理评估方式

L53

vLLM-PagedAttention

L54

DistServe-PD分离

L55

Sarathi-Chunked Prefill

L56

Speculative Decoding-投机解码

L57

大模型推理链压缩

L58

大模型预训练定义与预训练数据集

L59

预训练过程、评估与继续预训练

L60

DeepSeek-R1

L61

DeepSeek-V3:MLA、DeepSeekMoE 与多 Token 预测

L62

DeepSeek 后续工作:NSA 与 DSA

L63

Qwen 2.5

L64

MiniMax-01

L65

Qwen 3 后训练

L99

独立文章_Qwen3-VL系列是如何理解视频时序的?