FlashAttention 没有近似注意力,也没有消除二次计算;它通过分块、在线 softmax 与重计算避免物化巨大的注意力矩阵。本文从 GPU 内存层级解释它为何更快,以及 FA2、FA3 如何继续榨出硬件效率。
Mamba 不保存完整 KV cache,而是用选择性状态空间把历史压进固定状态。本文从选择性、扫描算法与实证边界解释它为何成为 Transformer 之外的重要路线。
DeepSeek-V2/V3 同时压缩 KV cache 与稀疏激活专家。本文从推理时真正搬运的数据出发,拆解 MLA、解耦 RoPE、DeepSeekMoE 与 V3 的无辅助损失负载均衡。
LLaMA 没有发明全新的 Transformer,却用更充分的训练、RoPE 等成熟组件和可部署的模型尺寸改变了开放模型生态。本文拆解它的配方,并澄清 GQA 到底从哪一代开始。
Chinchilla 用同等训练算力证明:70B 参数、1.4T token 的模型可以胜过 280B 的 Gopher。本文拆解计算最优缩放律、三种拟合方法与它对现代大模型训练的影响。