Featured image of post DPO:奖励模型去哪了

DPO:奖励模型去哪了

DPO 把奖励模型与 PPO 改写成一个成对分类损失,但偏好并未消失,而是藏进了策略相对参考模型的概率变化。本文从四个对数概率出发,解释它为何简单、为何有效,以及离线偏好优化的边界。

(1 - 5)
Enter 按 Enter 键跳转