跳转至

📚 LLM 教程 · 总目录

共 66 章,每章含正文、自测题、答案解析。点击进入阅读:

L01 · _自注意力Self-Attention

L02 · _Transformer 与 Decoding

L03 · _Tokenizer

L04 · _位置编码与 RoPE

L05 · _Normalization 与 Pre-Norm_Post-Norm

L06 · _Embedding 与常用编码方法

L07 · _模型微调:LoRA 与 AdaLoRA

L08 · _模型微调:QLoRA与 PEFT 方法对比

L09 · _强化学习:强化学习基础与马尔可夫决策过程 MDP

L10 · _强化学习:Bellman Equation 与策略迭代算法

L11 · _强化学习:蒙特卡洛方法、Sarsa 与多步 Sarsa

L12 · _强化学习:Q-learning、Dyna-Q 与 DQN

L13 · _强化学习:策略梯度、REINFORCE 与 Actor-Critic

L14 · _强化学习:传统 PPO、RLHF 定义与 NLP 场景强化学习

L15 · _强化学习:RLHF-PPO 与 GRPO

L16 · _强化学习:DPO 与 ORPO

L17 · _强化学习:DAPO、GSPO 与 SAPO

L18 · _训推不一致

L19 · _模型压缩:量化、ZeroQuant、LLM.int8() 与 SmoothQuant

L20 · _模型压缩:GPTQ、AWQ、剪枝与蒸馏

L21 · _分布式训练:DDP、DP 与 FSDP

L22 · _分布式训练:DeepSpeed 与 ZeRO

L23 · _调参技巧

L24 · _Flash Attention

L25 · _提示工程

L26 · _RAG

L27 · _RAG 优化

L28 · _Chunking-free RAG

L29 · _向量索引

L30 · _Rerank

L31 · _Rerank模型

L32 · _Long Context

L33 · _Long Context~NTK-aware 插值

L34 · _Long Context~YaRN 与 LongRoPE

L35 · _长上下文窗口分割

L36 · _长上下文提示压缩

L37 · _更多提示压缩方法

L38 · _GraphRAG

L39 · _Agentic RAG

L40 · _Agent 概述

L41 · _CoT与ReAct

L42 · _Plan-and-Solve 规划方法

L43 · _反思 Reflexion

L44 · _Agent记忆

L45 · _工具 Tool

L46 · _多智能体为什么失败?

L47 · _MCP

L48 · _Skills与OpenClaw

L49 · _Harness Engineering

L50 · _LLM推理两阶段:Prefill 和 Decode

L51 · _KV cache

L52 · _推理评估方式

L53 · _vLLM-PagedAttention

L54 · _DistServe-PD分离

L55 · _Sarathi-Chunked Prefill

L56 · _Speculative Decoding-投机解码

L57 · _大模型推理链压缩

L58 · _大模型预训练定义与预训练数据集

L59 · _预训练过程、评估与继续预训练

L60 · _DeepSeek-R1

L61 · _DeepSeek-V3:MLA、DeepSeekMoE 与多 Token 预测

L62 · _DeepSeek 后续工作:NSA 与 DSA

L63 · _Qwen 2.5

L64 · _MiniMax-01

L65 · _Qwen 3 后训练

L99 · _独立文章_Qwen3-VL系列是如何理解视频时序的?