跳转至

六十四:MiniMax-01

来源:http://mp.weixin.qq.com/s?__biz=MzYyNTk3Njg1NA==&mid=2247484980&idx=1&sn=96dbdcab81989f908ca41ace408e275d&chksm=f01eb54dc7693c5b076129d514d16c4d20a08eafeeb8c09eedd20a9cceeb24b63e6db141bcf7#rd

1. 学习范围

本日重点是MiniMax-01:

img

  • Lightning Attention:面向超长上下文的线性注意力变体与 I/O-aware 实现。

  • Hybrid attention:多数 block 使用 lightning attention,每若干层插入 softmax attention。

  • MoE:32 experts,总参数 456B,每 token 激活 45.9B。

  • 超长上下文:MiniMax-Text-01 训练可到 1M tokens,推理可外推到 4M tokens。

  • 多模态扩展:MiniMax-VL-01 通过 512B vision-language tokens 继续训练得到。

推荐阅读资料: - MiniMax-01: Scaling Foundation Models with Lightning Attention: https://arxiv.org/pdf/2501.08313

img

2. 问题背景:为什么需要 MiniMax-01

传统 Transformer softmax attention 的训练和 prefill 复杂度近似为:

O(T^2 * d)
当上下文从 128K 扩展到 1M 甚至 4M 时,二次复杂度会迅速压垮计算和显存。FlashAttention 等 I/O-aware softmax kernel 能显著改善常数和显存访问,但不能改变二次复杂度。 MiniMax-01 的目标不是单纯“把窗口调大”,而是在保持强模型能力的同时,把长上下文成本压到可训练、可推理、可服务的范围。它选择了线性注意力方向,并结合 MoE 提升模型容量。

img

3. Lightning Attention 的定位

论文将 MiniMax-01 的核心归结为 lightning attention 及其高效扩展。Lightning Attention 可以理解为一种线性注意力实现路线:通过把 softmax attention 中对所有 pair 的显式计算,改写为可累积的状态更新,从而把长上下文 attention 的复杂度从二次级别推向线性级别。 概念上,softmax attention 是:

Attn(Q, K, V) = softmax(QK^T / sqrt(d)) V

img

线性注意力通常把 kernel 写成特征映射形式:

sim(q, k) ~= phi(q)^T phi(k)

output_t =
  phi(q_t)^T * sum_{i<=t}(phi(k_i) v_i^T)
  / phi(q_t)^T * sum_{i<=t} phi(k_i)

img

img

这样历史信息可被压缩到累积状态:

S_t = S_{t-1} + phi(k_t) v_t^T
z_t = z_{t-1} + phi(k_t)
代入简化:

img

新 token 的输出只需查询状态,而不是读取全部历史 token。真正的工程挑战在于:这个数学形式必须配合稳定的归一化、数值范围、GPU/互联访问模式和训练 kernel。

机制直观理解

  • 不需要保存所有历史 K、V不需要缓存完整 K,V 序列;只持续维护两个小规模张量 S,z,历史信息被压缩进状态。

  • 逐 token 增量计算每新来一个 token,仅更新状态 S,z;生成当前 token 输出只需要:phi(q_t) 和全局累积状态 S_t,z_t,不遍历全部前文 token。

  • 分母项是归一化因子,对应原版 softmax 归一化作用,避免数值发散。

img

4. Hybrid 架构:线性注意力与 softmax 注意力混合

MiniMax-01 没有把所有层都替换成线性注意力。论文描述的架构是:主要使用 lightning attention 的 transnormer blocks,并且每 7 个 transnormer blocks 后插入 1 个 softmax attention transformer block。

img

直觉是: - Lightning attention 负责可扩展的长程状态传递。

  • 少量 softmax attention 保留精细 pairwise token interaction。

  • Hybrid 结构在效率和表达能力之间折中。

可以把它记成:

[LA block] x 7 -> [Softmax Attn block] -> repeat
面试中要避免说“MiniMax 完全不用 softmax attention”。更准确的说法是:MiniMax-01 采用以 lightning attention 为主、周期性插入 softmax attention 的混合架构。

5. MoE:用稀疏激活提高容量

img

MiniMax-01 使用 MoE 扩大模型容量。论文摘要给出的关键参数是:

experts: 32
total parameters: 456B
activated parameters per token: 45.9B
MoE 的基本结构:

router_logits = x W_r
topk_experts = TopK(router_logits, k)
output = sum_i gate_i * Expert_i(x)
MoE 的收益是:总参数容量可以很大,但每个 token 只激活一部分专家,因此每 token 计算量低于同等总参数的 dense 模型。长上下文场景中,这一点尤其重要,因为 token 数本身已经巨大。

6. Lightning Attention 与 MoE 的组合难点

MiniMax-01 的难点不只是“有线性注意力”和“有 MoE”,而是二者叠加后的系统工程。 主要挑战包括: - 序列并行超长序列无法简单放入单卡,需要按序列维拆分和通信。

  • 专家并行MoE expert 分布在不同设备,需要 token dispatch 和 combine。

  • 通信重叠attention、MoE、all-to-all 和矩阵乘法需要重叠,否则通信吞噬收益。

  • 长上下文状态管理线性注意力状态、KV cache、softmax 层缓存需要分别管理。

  • 负载均衡router 如果偏向少数专家,会造成吞吐下降和训练不稳定。

在面试中,回答 MiniMax-01 时要把算法和系统一起讲。仅说复杂度从 O(T^2) 变成 O(T) 不够,因为实际速度取决于内存访问、通信、kernel 和并行策略。

7. 超长上下文能力

img

img

img

MiniMax-Text-01 的上下文能力是该报告的核心卖点:

training context: up to 1M tokens
inference extrapolation: up to 4M tokens

img

需要区分三个层次: - 架构可扩展attention 复杂度允许百万级上下文。

  • 训练见过长上下文模型在训练或继续训练中实际处理过长序列。

  • 任务上有效在 RULER、needle retrieval、多文档问答、代码仓库等任务中保持检索和推理质量。

如果一个模型只是通过 RoPE 外推或位置插值声称支持 1M,并不等于它具备稳定百万上下文能力。MiniMax-01 的特点是把 attention 架构、训练上下文、推理外推和评测一起做。

8. MiniMax-VL-01

MiniMax-VL-01 是 MiniMax-01 的视觉语言扩展。论文摘要提到它通过 512B vision-language tokens 继续训练得到。 多模态模型的关键不只是把图片 encoder 接到 LLM 上,还要处理: - 视觉 token 数量与长上下文预算。

  • 文本和视觉 token 的位置关系。

  • OCR、图表、文档理解中跨页和跨区域引用。

  • 多模态指令数据与安全对齐。

MiniMax-01 的长上下文能力对多模态很重要,因为高分辨率图像、长文档截图、视频帧和多页 PDF 都会迅速消耗上下文窗口。

9. 与标准 Transformer 的对比

Standard dense Transformer:
  softmax attention everywhere
  dense FFN everywhere
  high pairwise expressiveness
  quadratic attention cost

MiniMax-01:
  mostly lightning attention
  periodic softmax attention
  sparse MoE FFN
  long-context friendly
  heavier distributed systems complexity
这种设计的核心取舍是:为了超长上下文,牺牲部分全 pairwise attention 的直接表达,换取可训练可推理的长度扩展;再用 MoE 提供模型容量,弥补长上下文模型可能遇到的能力压力。

10. 常见评估角度

长上下文模型不能只看 MMLU、MATH、HumanEval 等普通短上下文 benchmark,还要看: - Needle-in-a-haystack:是否能在长上下文中找到目标信息。

  • RULER:更系统的长上下文检索、聚合和推理任务。

  • 多文档问答:是否能跨文档整合。

  • 长代码仓库理解:是否能跨文件定位定义、调用和 bug。

  • 长上下文稳定性:是否存在位置偏置、开头/结尾偏好、lost-in-the-middle。

  • 成本曲线:随着 T 增长,latency、memory、throughput 如何变化。

11. 面试速记

可以用下面这段口述总结 MiniMax-01:

MiniMax-01 是为百万级上下文设计的基础模型系列,核心是以 Lightning Attention 为主的线性注意力架构,并周期性插入 softmax attention 保留精细交互;同时结合 32 experts 的 MoE,把总参数扩到 456B、每 token 激活 45.9B。它的价值不只在算法复杂度,还在于序列并行、专家并行、通信计算重叠和长上下文训练/推理工程,使 MiniMax-Text-01 能训练到 1M 上下文并推理外推到 4M。

12. 常见误区

  • 把 Lightning Attention 简化成“FlashAttention”。FlashAttention 是高效 softmax attention kernel;Lightning Attention 是线性注意力路线。

  • 认为线性注意力一定全面优于 softmax attention。线性注意力提高长度扩展性,但 pairwise 表达和稳定训练需要额外设计。

  • 忽略 hybrid 中的 softmax attention block。

  • 只看 456B 总参数,不看每 token 激活参数和 MoE 通信成本。

  • 把 4M inference extrapolation 理解为所有任务都能可靠处理 4M token。有效长上下文仍需任务评测。

            预览时标签不可点
    

    <div class="