DPO 把奖励模型与 PPO 改写成一个成对分类损失,但偏好并未消失,而是藏进了策略相对参考模型的概率变化。本文从四个对数概率出发,解释它为何简单、为何有效,以及离线偏好优化的边界。
FlashAttention 没有近似注意力,也没有消除二次计算;它通过分块、在线 softmax 与重计算避免物化巨大的注意力矩阵。本文从 GPU 内存层级解释它为何更快,以及 FA2、FA3 如何继续榨出硬件效率。
Mamba 不保存完整 KV cache,而是用选择性状态空间把历史压进固定状态。本文从选择性、扫描算法与实证边界解释它为何成为 Transformer 之外的重要路线。
DeepSeek-V2/V3 同时压缩 KV cache 与稀疏激活专家。本文从推理时真正搬运的数据出发,拆解 MLA、解耦 RoPE、DeepSeekMoE 与 V3 的无辅助损失负载均衡。
LLaMA 没有发明全新的 Transformer,却用更充分的训练、RoPE 等成熟组件和可部署的模型尺寸改变了开放模型生态。本文拆解它的配方,并澄清 GQA 到底从哪一代开始。