<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>对齐 on 辰远</title>
        <link>/tags/%E5%AF%B9%E9%BD%90/</link>
        <description>Recent content in 对齐 on 辰远</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>Lee</copyright>
        <lastBuildDate>Wed, 09 Sep 2026 22:29:32 +0800</lastBuildDate><atom:link href="/tags/%E5%AF%B9%E9%BD%90/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>InstructGPT：用 RLHF 教会大模型「听话」</title>
            <link>/p/instructgpt-rlhf/</link>
            <pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
            <guid>/p/instructgpt-rlhf/</guid>
            <description>&lt;img src=&#34;/p/instructgpt-rlhf/cover.jpg&#34; alt=&#34;Featured image of post InstructGPT：用 RLHF 教会大模型「听话」&#34; /&gt;&lt;h2 id=&#34;引言模型变大--更懂你&#34;&gt;引言：模型变大 ≠ 更懂你&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;2020 年 GPT-3 以 175B 参数震惊世界，但用户很快发现一个尴尬的事实：这个怪兽经常「好心办坏事」。你让它写一段代码注释，它给你生成一篇技术博客；你问它事实性问题，它一本正经地编造；你让它拒绝不当请求，它被诱导几句就说出有害内容。&lt;/p&gt;&#xA;&lt;p&gt;换句话说，GPT-3 &lt;strong&gt;没对齐（misaligned）&lt;/strong&gt;——它的语言建模目标（预测下一个 token）和用户的使用意图之间存在鸿沟。&lt;/p&gt;&#xA;&lt;p&gt;2022 年 3 月，OpenAI 发表了一篇后来改变了整个行业走向的论文：&lt;em&gt;Training Language Models to Follow Instructions with Human Feedback&lt;/em&gt;。这篇论文提出了一种叫 &lt;strong&gt;RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）&lt;/strong&gt; 的方法，分三步把 GPT-3 改造成了能更好理解用户意图的 InstructGPT。而 ChatGPT 的诞生，正是沿着这条路线走下去的结果。&lt;/p&gt;&#xA;&lt;p&gt;本文将拆解 InstructGPT 的三个训练阶段、关键超参、定量效果，以及它留下的「对齐税」问题。&lt;/p&gt;&#xA;&lt;h2 id=&#34;step-1监督微调sft-让模型先学好答案&#34;&gt;Step 1：监督微调（SFT）—— 让模型先学「好答案」&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;RLHF 的第一步是最直观的：&lt;strong&gt;找人来写好答案，然后让模型照猫画虎&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;OpenAI 雇佣了标注员，针对从 API 收集的 prompt（用户提问）写出高质量的回答。这些 prompt 覆盖了生成、问答、写作、总结、代码等九大类任务。标注员写的回答不追求完美，但要「有用」——回答 prompt 所问、不编造事实、不给有害建议。&lt;/p&gt;&#xA;&lt;p&gt;最终收集了约 &lt;strong&gt;13k 条标注员演示数据&lt;/strong&gt;（train 12,725 + valid 1,653），再加上一小部分（约 1.4k）真实用户提交的 prompt 作为补充。&lt;/p&gt;&#xA;&lt;p&gt;在这些数据上，用监督学习微调 GPT-3 的预训练权重。1.3B 和 6B 模型训练 16 个 epoch，更大 batch size（32），学习率 9.65e-6；175B 用 batch size 8 和学习率 5.03e-6。所有模型使用 residual dropout 0.2 和余弦衰减学习率。对每个模型规模，选择验证集上 RM 分数最高的 checkpoint。&lt;/p&gt;&#xA;&lt;figure&gt;&lt;img src=&#34;/p/instructgpt-rlhf/rlhf-pipeline.svg&#34;&gt;&lt;figcaption&gt;&#xA;&#x9;&#x9;&#x9;&lt;h4&gt;图 1：InstructGPT 的 RLHF 三步流程——SFT 学习人类的示范回答，奖励模型学习人类的偏好排序，PPO 用奖励信号优化策略&lt;/h4&gt;&#xA;&#x9;&#x9;&lt;/figcaption&gt;&#xA;&lt;/figure&gt;&#xA;&#xA;&lt;p&gt;这一步产出一个「会回答」但还不极致对齐的模型 π_SFT。&lt;/p&gt;&#xA;&lt;h2 id=&#34;step-2奖励模型reward-model-让模型学会分辨好坏&#34;&gt;Step 2：奖励模型（Reward Model）—— 让模型学会分辨好坏&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;SFT 只能让模型「会写」，但无法教它「哪种写法更好」。第二步要做的就是训练一个&lt;strong&gt;打分器&lt;/strong&gt;，让它学会预测人类更喜欢哪个回答。&lt;/p&gt;&#xA;&lt;p&gt;具体做法：对一批 prompt，用 SFT 模型采样 K = 4~9 个不同回答（不同的 temperature），然后标注员对这些回答&lt;strong&gt;排序&lt;/strong&gt;（从最好到最差）。每个 prompt 的排序产生 C(K, 2) 个比较对（两个回答中哪个更好）。&lt;/p&gt;&#xA;&lt;p&gt;这里有一个精妙的设计：&lt;strong&gt;用排序而非打分&lt;/strong&gt;。让两个标注员各自给同一个回答打 1-5 分，一致性很差——每个人对「3 分」的标准不同。但如果只让他们比较「A 还是 B」更好，一致性就高得多。这也是 RLHF 方法论的基石思想之一。&lt;/p&gt;&#xA;&lt;p&gt;奖励模型用这些对比数据训练。约 &lt;strong&gt;33k 个 prompt&lt;/strong&gt;（训练集），每个产生多次采样。关键发现：只用 &lt;strong&gt;6B 参数&lt;/strong&gt;做奖励模型——尝试 175B 会导致训练极不稳定。训练 1 个 epoch，学习率 9e-6，batch size 64（每 batch 可含 2,304 个比较对）。&lt;/p&gt;&#xA;&lt;p&gt;损失函数很直觉：给定两个回答 y_w（更好）和 y_l（更差），最大化打分差异：&lt;/p&gt;&#xA;$$L(θ) = -log(σ(r_θ(x, y_w) - r_θ(x, y_l)))$$&lt;p&gt;这里的 σ 是 sigmoid。两个回答间奖励差越大，模型越有信心区分。最终奖励会加归一化 bias，使来自标注员的示范回答得分为 0——这样就为 PPO 阶段建立了参照系。&lt;/p&gt;&#xA;&lt;h2 id=&#34;step-3ppo-强化学习--用奖励信号驱动对齐&#34;&gt;Step 3：PPO 强化学习 —— 用奖励信号驱动对齐&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;有了奖励模型，第三步就是用它来优化语言模型策略。&lt;/p&gt;&#xA;&lt;p&gt;PPO（Proximal Policy Optimization）是一种可以稳定训练的策略优化算法。OpenAI 的 RLHF 实现直接使用了 Schulman et al. (2017) 的原始 PPO 算法。&lt;/p&gt;&#xA;&lt;p&gt;每个 episode，从 prompt 集合中采样一个 prompt，用当前策略生成回答 y，然后：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;正向信号&lt;/strong&gt;：奖励模型打分 r_θ(x, y)，越高越好&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;负向约束&lt;/strong&gt;：KL 散度惩罚，如果策略偏离 SFT 模型太远&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;后者至关重要。没有 KL 惩罚，模型会迅速学会「取悦奖励模型」——它可能生成一些语法不通但你发现奖励模型给高分的话术（这叫 reward hacking）。KL 散度把策略锚定在 SFT 的分布附近，防止这种退化。&lt;/p&gt;&#xA;&lt;p&gt;目标函数：&lt;/p&gt;&#xA;$$max_φ E[r_θ(x, y)] - β · KL(π_φ ‖ π_{SFT})$$&lt;p&gt;其中 KL 惩罚系数 β = &lt;strong&gt;0.02&lt;/strong&gt;。OpenAI 还实验了 PPO-ptx 变体——在 RL 目标中加入预训练梯度（系数 γ = 27.8），混合 10% 预训练数据。PPO-ptx 版本的「对齐税」更低：在保持对齐效果的同时，对 NLP benchmark 性能的负面影响更小。&lt;/p&gt;&#xA;&lt;p&gt;关键超参：batch size 512、minibatch 64（只有 1 个 inner epoch）、PPO clip ratio 0.2、常数学习率、采样温度 1（无衰减）、权重 EMA 衰减率 0.992。value function 从奖励模型初始化，6B 参数。总计 256k 个 episode（约 31k 去重 prompt）。&lt;/p&gt;&#xA;&lt;h2 id=&#34;惊人的效果对比&#34;&gt;惊人的效果对比&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;InstructGPT 最震撼的结果是在人工评估中：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;对比&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;胜率&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;175B InstructGPT vs 175B GPT-3&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;85% ± 3%&lt;/strong&gt; 用户更喜欢 InstructGPT&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;175B InstructGPT vs few-shot 175B GPT-3&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;71% ± 4%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;1.3B InstructGPT vs 175B GPT-3&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;胜出&lt;/strong&gt;（参数不到对方 1%）&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;最后一条特别说明问题：用户宁愿用一个 &lt;strong&gt;1.3B 的对齐模型&lt;/strong&gt;，也不用 &lt;strong&gt;175B 的未对齐模型&lt;/strong&gt;。对齐的价值大于规模。&lt;/p&gt;&#xA;&lt;p&gt;在具体维度上：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;指令遵循&lt;/strong&gt;：InstructGPT 更擅长完成用户的请求（「不忽略约束」「不说废话」）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;真实性&lt;/strong&gt;：TruthfulQA 上 InstructGPT 产生真实答案的概率比 GPT-3 高约 &lt;strong&gt;1 倍&lt;/strong&gt;；封闭域幻觉率从 GPT-3 的 41% 降至 &lt;strong&gt;21%&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;有害性&lt;/strong&gt;：当提示「保持礼貌」时，InstructGPT 的有害输出比 GPT-3 少约 &lt;strong&gt;25%&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;偏见&lt;/strong&gt;：Winogender 和 CrowS-Pairs 数据集上没有明显改善&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;但要注意，这些有害性改善是 &lt;strong&gt;modest&lt;/strong&gt; 的——论文作者自己也坦诚地说，RLHF 不是安全的银弹。&lt;/p&gt;&#xA;&lt;h2 id=&#34;对齐税模型变得更聪明但也在某些地方变慢了&#34;&gt;对齐税：模型变得更聪明，但也在某些地方变慢了&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;RLHF 引入了「对齐税（alignment tax）」：对齐后模型在部分标准 NLP benchmark 上出现性能退化（如 DROP 问答集和翻译任务）。PPO-ptx 变体大大缓解了这个问题。&lt;/p&gt;&#xA;&lt;p&gt;更重要的发现是：InstructGPT 能&lt;strong&gt;泛化到未见过的标注员偏好&lt;/strong&gt;。训练数据之外的标注员同样更喜欢 InstructGPT 的输出，说明模型学到的不是迎合特定标注员，而是学到了更普遍的「有用性」标准。这种泛化也延伸到代码任务和非英文指令上。&lt;/p&gt;&#xA;&lt;figure&gt;&lt;img src=&#34;/p/instructgpt-rlhf/metrics.svg&#34;&gt;&lt;figcaption&gt;&#xA;&#x9;&#x9;&#x9;&lt;h4&gt;图 2：InstructGPT vs GPT-3 关键指标对比——人类偏好胜率 85%、幻觉率从 41% 降至 21%、有害输出减少 25%&lt;/h4&gt;&#xA;&#x9;&#x9;&lt;/figcaption&gt;&#xA;&lt;/figure&gt;&#xA;&#xA;&lt;h2 id=&#34;护栏视角&#34;&gt;护栏视角&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;作为一名关注 AI 安全的工作者，我认为 InstructGPT 的技术路线在安全方面有两个重要启示：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;正面&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;人类的排序比打分更可靠&lt;/strong&gt;。排序方案让标注员之间的一致性大幅提升，减少了训练数据中的噪声和歧义&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;KL 惩罚是一道天然的开发护栏&lt;/strong&gt;。它让模型不会为了取悦奖励模型而放弃语言能力，这在架构层面防止了一种 reward hacking&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;PPO-ptx 证明了对齐和安全可以和解&lt;/strong&gt;。混入预训练目标后，能力退化（alignment tax）大幅降低，说明安全优化不必然以牺牲性能为代价&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;挑战&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;有害性改善有限&lt;/strong&gt;。论文坦诚指出有害内容只减少了约 25%，在恶意 prompt 下模型仍可能越狱&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励模型自身的安全盲区&lt;/strong&gt;。奖励模型只在「两段回答哪个更好」的数据上训练，它无法评估一段回答中的微妙歧视或间接有害性&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;标注员偏见进入对齐目标&lt;/strong&gt;。如果标注员群体本身存在文化偏见，排序数据就无法具有普适性。论文作者也承认这是他们面临的主要限制之一&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;我的判断&lt;/strong&gt;：InstructGPT 定义了一个技术路线图，但它把一个关键问题留给了后来者——&lt;strong&gt;谁来定义「好」？&lt;/strong&gt; RLHF 把这个问题外包给了标注员，而标注员的偏好并不是普遍价值的代理。这解释了为什么后来的 Anthropic Constitutional AI 和 DeepSeek-R1 的规则奖励都在试图回答同一个问题：对齐目标不应该是纯粹的统计偏好聚合。&lt;/p&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;InstructGPT 的贡献不在于算法创新（PPO 和 RLHF 都出自更早的工作），而在于它&lt;strong&gt;第一次证明了：对齐比规模更重要&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;维度&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;核心发现&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;方法论&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;SFT → Reward Model → PPO 三步流水线，每步数据规模和超参都经过精心设计&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;关键取舍&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;KL 惩罚 β=0.02 平衡对齐与能力；PPO-ptx 降低对齐税&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;效果&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1.3B 对齐模型优于 175B 原始模型，幻觉率减半&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;局限&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;有害性改善有限，偏见无显著改善，对齐受限于标注员偏好&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;回头看，这篇论文是 ChatGPT 和整个对齐 / 后训练时代的技术基石。后来的 RLHF 变体——InstructGPT → ChatGPT → Constitutional AI → DPO → R1 的 GRPO——都是在它开辟的框架内扩展。但它的核心洞察至今未变：&lt;strong&gt;把模型做小不难，把模型做对才是最值得做的事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;参考资料&#34;&gt;参考资料&#xD;&#xA;&lt;/h2&gt;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;原论文&lt;/strong&gt;：Ouyang, L., Wu, J., Jiang, X. et al. &lt;em&gt;Training Language Models to Follow Instructions with Human Feedback&lt;/em&gt;. NeurIPS 2022. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2203.02155&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/2203.02155&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;OpenAI 官方博客&lt;/strong&gt;：&lt;em&gt;Aligning Language Models to Follow Instructions&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;https://openai.com/index/instruction-following/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://openai.com/index/instruction-following/&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;技术解读&lt;/strong&gt;：ArthurChiao. &lt;em&gt;InstructGPT 论文精读&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;http://arthurchiao.art/blog/instructgpt-paper-zh/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;http://arthurchiao.art/blog/instructgpt-paper-zh/&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;PPO 算法原论文&lt;/strong&gt;：Schulman, J. et al. &lt;em&gt;Proximal Policy Optimization Algorithms&lt;/em&gt;. 2017. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/1707.06347&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/1707.06347&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;RLHF 基础&lt;/strong&gt;：Christiano, P. et al. &lt;em&gt;Deep Reinforcement Learning from Human Preferences&lt;/em&gt;. NeurIPS 2017. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/1706.03741&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/1706.03741&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;对齐框架&lt;/strong&gt;：Askell, A. et al. &lt;em&gt;A General Language Assistant as a Laboratory for Alignment&lt;/em&gt;. 2021. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2112.00861&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/2112.00861&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;</description>
        </item></channel>
</rss>
