Featured image of post PagedAttention:局部更慢,系统为何更快

PagedAttention:局部更慢,系统为何更快

PagedAttention 的注意力 kernel 本身并不一定更快,却让 vLLM 获得更高服务吞吐。本文从 KV cache 的动态增长出发,解释分页、块表、按需分配与写时复制如何把显存管理变成推理系统的核心能力。

Featured image of post DPO:奖励模型去哪了

DPO:奖励模型去哪了

DPO 把奖励模型与 PPO 改写成一个成对分类损失,但偏好并未消失,而是藏进了策略相对参考模型的概率变化。本文从四个对数概率出发,解释它为何简单、为何有效,以及离线偏好优化的边界。

(1 - 6)
Enter 按 Enter 键跳转