<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>DeepSeek on 辰远</title>
        <link>/tags/deepseek/</link>
        <description>Recent content in DeepSeek on 辰远</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>Lee</copyright>
        <lastBuildDate>Tue, 01 Sep 2026 22:08:21 +0800</lastBuildDate><atom:link href="/tags/deepseek/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>DeepSeek-R1：用强化学习激发大模型推理能力</title>
        <link>/p/deepseek-r1%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%BF%80%E5%8F%91%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E8%83%BD%E5%8A%9B/</link>
        <pubDate>Mon, 01 Sep 2025 00:00:00 +0000</pubDate>
        
        <guid>/p/deepseek-r1%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%BF%80%E5%8F%91%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E8%83%BD%E5%8A%9B/</guid>
        <description>&lt;img src="/p/deepseek-r1%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%BF%80%E5%8F%91%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E8%83%BD%E5%8A%9B/cover.jpg" alt="Featured image of post DeepSeek-R1：用强化学习激发大模型推理能力" /&gt;&lt;blockquote class=&#34;alert alert-note&#34;&gt;
    2025 年 1 月，DeepSeek 发布了 R1 系列推理模型，论文旋即登上 Nature。R1 的核心贡献在于：首次从实验上验证了「仅靠强化学习，无需监督微调」，就能让大模型自主学会长思维链推理、自我验证和错误回溯。本文从算法原理、训练管线到效果数据，完整拆解这一里程碑工作。
&lt;/blockquote&gt;

&lt;h2 id=&#34;引言推理能力的涌现之谜&#34;&gt;引言：推理能力的「涌现」之谜
&lt;/h2&gt;&lt;p&gt;2024 年 9 月，OpenAI 发布 o1 模型，首次将「推理时计算」（test-time compute）的概念带入主流视野。o1 能在回答问题之前生成一段内部思维链（Chain-of-Thought, CoT），自我验证、反复推敲，在数学、代码、科学推理上大幅超越 GPT-4o。&lt;/p&gt;
&lt;p&gt;但 o1 是闭源的，其训练方法对外界是一个黑盒。社区的普遍猜测是：OpenAI 使用大量人工标注的 CoT 数据做监督微调（SFT），再辅以强化学习（RL）对齐。&lt;/p&gt;
&lt;p&gt;DeepSeek 在 2025 年 1 月发布的 R1 论文彻底打破了这一认知。他们证明：&lt;strong&gt;只需要 RL，不需要 SFT，模型就能自动学会推理&lt;/strong&gt;。这个结论的意义不下于 AlphaGo 在围棋领域的突破——它意味着「推理能力」不是人类手把手教出来的，而是奖励信号驱动下自组织涌现的。&lt;/p&gt;
&lt;h2 id=&#34;基础架构deepseek-v3-base&#34;&gt;基础架构：DeepSeek-V3-Base
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1 系列并非从零训练，而是基于 DeepSeek-V3-Base 做后训练（post-training）。V3 本身是一个 MoE（Mixture of Experts）架构，671B 总参数，每次推理只激活 37B 参数，支持 128K 上下文窗口。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;模型&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;总参数量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;激活参数量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;上下文长度&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;基座模型&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;DeepSeek-R1-Zero&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;671B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;37B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;128K&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;DeepSeek-V3-Base&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;DeepSeek-R1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;671B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;37B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;128K&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;DeepSeek-V3-Base&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;R1 的训练不修改 V3 的架构，而是通过强化学习重新调整模型的行为——让模型学会在回答前「思考」。&lt;/p&gt;
&lt;h2 id=&#34;核心算法grpo去价值网络的强化学习&#34;&gt;核心算法：GRPO——去价值网络的强化学习
&lt;/h2&gt;&lt;p&gt;传统 RLHF 中，PPO（Proximal Policy Optimization）是最常用的算法。PPO 需要四个模型：Actor（策略网络）、Critic（价值网络）、Reference（参考模型）、Reward（奖励模型）。其中 Critic 和 Actor 参数量相当，训练时显存消耗翻倍。&lt;/p&gt;
&lt;p&gt;DeepSeek 使用的 GRPO（Group Relative Policy Optimization）彻底砍掉了 Critic 网络。其核心思想是：&lt;strong&gt;用组内相对优势代替价值函数的绝对优势估计&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;grpo-的数学原理&#34;&gt;GRPO 的数学原理
&lt;/h3&gt;&lt;p&gt;给定一个 prompt $q$，Actor 采样 $G$ 个候选回答 ${o_1, o_2, &amp;hellip;, o_G}$，每个回答由奖励模型打分得到 ${r_1, r_2, &amp;hellip;, r_G}$。第 $i$ 个回答的优势函数定义为：&lt;/p&gt;
$$A_i = \frac{r_i - \text{mean}(\{r_1,...,r_G\})}{\text{std}(\{r_1,...,r_G\})}$$&lt;p&gt;这个公式的含义很直观：&lt;strong&gt;如果你的回答在组内表现最好，优势为正，策略朝这个方向更新；表现最差，优势为负，策略远离这个方向&lt;/strong&gt;。组内标准化消除了奖励绝对值尺度的影响，使训练更加稳定。&lt;/p&gt;
&lt;p&gt;GRPO 的优化目标为：&lt;/p&gt;
$$\mathcal{J}_{GRPO}(\theta) = \mathbb{E}_{q \sim P(Q), \{o_i\}_{i=1}^G \sim \pi_{\theta_{old}}(O|q)} \left[ \frac{1}{G} \sum_{i=1}^G \left( \min\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)} A_i, \text{clip}\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)}, 1-\epsilon, 1+\epsilon \right) A_i \right) - \beta \cdot \mathbb{KL}(\pi_\theta || \pi_{ref}) \right) \right]$$&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\frac{\pi_\theta}{\pi_{\theta_{old}}}$ 是重要性采样权重，衡量新策略相对于旧策略的概率变化&lt;/li&gt;
&lt;li&gt;$\epsilon$ 是裁剪范围（R1 中设为 10），防止单步更新过大&lt;/li&gt;
&lt;li&gt;$\beta \cdot \mathbb{KL}$ 是 KL 散度惩罚，约束策略不要偏离参考模型太远（R1 中 $\beta=0.001$）&lt;/li&gt;
&lt;li&gt;去掉 Critic 后，单步训练显存占用降低约 50%，batch size 可以翻倍&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;grpo-vs-ppo-的直观对比&#34;&gt;GRPO vs PPO 的直观对比
&lt;/h3&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# PPO：需要价值网络估计状态价值&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# value = critic(state)  # 额外的前向传播&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# advantage = reward + gamma * value_next - value  # 依赖价值估计&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# GRPO：组内相对优势，无需价值网络&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# rewards = [reward_model(o1), reward_model(o2), ..., reward_model(oG)]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# advantages = (rewards - mean(rewards)) / std(rewards)  # 纯统计量&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id=&#34;奖励设计规则即信号&#34;&gt;奖励设计：规则即信号
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1 的奖励系统完全基于规则（rule-based），不依赖训练奖励模型。这有两个关键优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;零主观偏差&lt;/strong&gt;：规则客观可验证，不会出现奖励黑客（reward hacking）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;无限扩展&lt;/strong&gt;：不需要人工标注偏好数据&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;奖励分两类：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;准确性奖励（Accuracy Reward）&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;数学题：要求答案放在 &lt;code&gt;\boxed{}&lt;/code&gt; 中，正则匹配后与标准答案比较&lt;/li&gt;
&lt;li&gt;代码题：使用编译器运行测试用例，检查通过率&lt;/li&gt;
&lt;li&gt;科学题：使用符号验证器或代码解释器判断&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;格式奖励（Format Reward）&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;要求推理过程放在 &lt;code&gt;\think&lt;/code&gt; 和 &lt;code&gt;\think&lt;/code&gt; 标签之间&lt;/li&gt;
&lt;li&gt;最终答案放在 &lt;code&gt;\response&lt;/code&gt; 标签中&lt;/li&gt;
&lt;li&gt;格式合规给正向奖励，不合规给零分&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;语言一致性奖励（Language Consistency Reward）&lt;/strong&gt;（R1 专用）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;计算 CoT 中目标语言词的比例&lt;/li&gt;
&lt;li&gt;解决多语言混杂问题&lt;/li&gt;
&lt;li&gt;虽会轻微降低推理性能，但大幅提升可读性&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最终的奖励函数为：&lt;/p&gt;
$$R = R_{accuracy} + R_{format} + \lambda \cdot R_{language}$$&lt;h2 id=&#34;r1-zero纯-rl-的极限实验&#34;&gt;R1-Zero：纯 RL 的极限实验
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1-Zero 是论文中最激进的实验：&lt;strong&gt;直接在 V3-Base 上跑 GRPO，不用任何 SFT 数据&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;训练配置&#34;&gt;训练配置
&lt;/h3&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;超参数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;值&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;学习率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$3 \times 10^{-6}$&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;KL 系数 $\beta$&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.001&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;采样温度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.0&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;每组采样数 $G$&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;16&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;最大生成长度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;32,768 tokens（8.2k 步前）/ 65,536 tokens（之后）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;每步问题数&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;32&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;每步 batch size&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;512（32 × 16）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;总训练步数&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;10,400&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;训练 epoch&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.6&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;参考模型更新间隔&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;每 400 步替换为最新策略&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;涌现的行为&#34;&gt;涌现的行为
&lt;/h3&gt;&lt;p&gt;训练过程中，R1-Zero 自发出现了多种高级推理行为：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;自我验证（Self-Verification）&lt;/strong&gt;：模型会在解题过程中主动检查中间结果。例如解方程时，求出一个解后代入原方程验证。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;反思（Reflection）&lt;/strong&gt;：当发现推理路径走不通时，模型会回溯到上一步并尝试替代方案，而非继续错误路径。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;探索替代方案（Alternative Approach Exploration）&lt;/strong&gt;：对于复杂问题，模型会生成多个解题思路，比较后选择最优路径。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;思维链长度随时间增长&lt;/strong&gt;：这是关键量化指标。随着 RL 训练进行，模型输出的平均 token 数从 500 增长到 5,000+，说明模型学会了「想得更久」。&lt;/p&gt;
&lt;h3 id=&#34;定量效果&#34;&gt;定量效果
&lt;/h3&gt;&lt;p&gt;AIME 2024（美国数学邀请赛）的成绩：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;训练阶段&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;pass@1&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;多数投票（64 样本）&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;初始（V3-Base）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;15.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;RL 训练后（R1-Zero）&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;71.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;86.7%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;提升幅度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;+55.4%&lt;/strong&gt;&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;—&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;关键发现&lt;/strong&gt;：在 8,200 步（对应上下文长度从 32K 切换到 64K 的点）时，性能和输出长度都出现跳跃式增长。这暗示长上下文窗口对推理能力有直接的促进作用——模型需要足够的「思考空间」来展开完整推理链。&lt;/p&gt;
&lt;h3 id=&#34;局限性&#34;&gt;局限性
&lt;/h3&gt;&lt;p&gt;R1-Zero 虽然推理能力强，但存在三个突出问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;可读性差&lt;/strong&gt;：输出结构混乱，缺乏 Markdown 格式&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;语言混杂&lt;/strong&gt;：同一个回答中中英文混用，尤其当 prompt 包含多种语言时&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;通用能力缺失&lt;/strong&gt;：在写作、开放问答等非推理任务上表现不佳&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id=&#34;r1-正式版四阶段训练管线&#34;&gt;R1 正式版：四阶段训练管线
&lt;/h2&gt;&lt;p&gt;为解决 R1-Zero 的问题并进一步提升性能，DeepSeek 设计了四阶段训练管线：&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;/p/deepseek-r1%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%BF%80%E5%8F%91%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E8%83%BD%E5%8A%9B/pipeline.svg&#34;&gt;&lt;figcaption&gt;
      &lt;h4&gt;图 1：DeepSeek-R1 四阶段训练管线。从冷启动 SFT → 推理 RL → 拒绝采样&amp;#43;SFT → 全场景 RL，逐步提升推理能力并保持通用能力。&lt;/h4&gt;
    &lt;/figcaption&gt;
&lt;/figure&gt;

&lt;h3 id=&#34;阶段一冷启动cold-start&#34;&gt;阶段一：冷启动（Cold Start）
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;目标&lt;/strong&gt;：给 RL 一个稳定的起点，避免从 Base 模型直接 RL 的初期不稳定。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;数据收集&lt;/strong&gt;：几千条长 CoT 数据，通过以下方式生成：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Few-shot prompting：以长 CoT 为示例&lt;/li&gt;
&lt;li&gt;直接提示模型生成带反思和验证的详细答案&lt;/li&gt;
&lt;li&gt;收集 R1-Zero 的输出并人工后处理&lt;/li&gt;
&lt;li&gt;人工标注者精修格式&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;输出格式&lt;/strong&gt;：&lt;code&gt;|special_token|&amp;lt;reasoning_process&amp;gt;|special_token|&lt;/code&gt;，其中推理过程是 CoT，末尾有摘要总结结果。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;优势&lt;/strong&gt;：相比 R1-Zero，冷启动模型的输出可读性大幅提升，且用人类先验引导了推理模式，模型收敛更快。&lt;/p&gt;
&lt;h3 id=&#34;阶段二推理导向的-rl&#34;&gt;阶段二：推理导向的 RL
&lt;/h3&gt;&lt;p&gt;在冷启动模型上运行与 R1-Zero 相同的 GRPO 训练，重点强化数学、代码、科学、逻辑推理能力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键改进&lt;/strong&gt;：引入语言一致性奖励，在推理性能和可读性之间取得平衡。&lt;/p&gt;
&lt;h3 id=&#34;阶段三拒绝采样--监督微调&#34;&gt;阶段三：拒绝采样 + 监督微调
&lt;/h3&gt;&lt;p&gt;当推理 RL 收敛后，使用当前 checkpoint 生成 SFT 数据，分两类：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;推理数据（~600K 条）&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;从 RL checkpoint 做拒绝采样，每个 prompt 采样多个回答，只保留正确的&lt;/li&gt;
&lt;li&gt;引入生成式奖励模型（Generative Reward Model），将参考答案和模型输出送入 DeepSeek-V3 做判断&lt;/li&gt;
&lt;li&gt;过滤掉语言混杂、段落过长、代码块混乱的输出&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;非推理数据（~200K 条）&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;写作、事实问答、自我认知、翻译等通用能力&lt;/li&gt;
&lt;li&gt;复用 DeepSeek-V3 的 SFT 数据集&lt;/li&gt;
&lt;li&gt;对简单查询（如&amp;quot;你好&amp;quot;）不生成 CoT&lt;/li&gt;
&lt;li&gt;对复杂非推理任务，先让 V3 生成 CoT 再回答&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;训练&lt;/strong&gt;：在 V3-Base 上使用上述 800K 数据微调 2 个 epoch。&lt;/p&gt;
&lt;h3 id=&#34;阶段四全场景-rl&#34;&gt;阶段四：全场景 RL
&lt;/h3&gt;&lt;p&gt;这是最后的对齐阶段，综合提升有用性（helpfulness）和无害性（harmlessness）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;推理数据&lt;/strong&gt;：沿用规则奖励（数学、代码、逻辑）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;通用数据&lt;/strong&gt;：使用奖励模型（Reward Model）捕获人类偏好
&lt;ul&gt;
&lt;li&gt;有用性奖励：只评估最终摘要，不影响推理过程&lt;/li&gt;
&lt;li&gt;无害性奖励：评估整个回答（包括推理过程），检测风险内容&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;训练细节&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;超参数&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;值&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;学习率&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;$3 \times 10^{-6}$&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;采样温度&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;0.7（比第一阶段低）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;总步数&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,700&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;通用数据+偏好奖励引入时机&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;最后 400 步&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;训练成本&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;见论文附录 B.4.4&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;重要发现&lt;/strong&gt;：超过 400 步的偏好奖励训练会导致奖励黑客（reward hacking），因此只在最后 400 步引入。&lt;/p&gt;
&lt;h2 id=&#34;蒸馏把推理能力压缩进小模型&#34;&gt;蒸馏：把推理能力压缩进小模型
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1 最实用的贡献之一是蒸馏（distillation）。他们用 R1 生成的 800K 推理数据，在 Qwen2.5 和 Llama-3 系列上微调出 6 个小模型：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;蒸馏模型&lt;/th&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;基座&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;参数量&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;AIME 2024 pass@1&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Qwen-1.5B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Qwen2.5-1.5B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1.5B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;28.9%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Qwen-7B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Qwen2.5-7B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;7B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;55.9%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Qwen-14B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Qwen2.5-14B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;14B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;69.7%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Qwen-32B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Qwen2.5-32B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;32B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;72.6%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Llama-8B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Llama-3.1-8B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;8B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;50.4%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;R1-Distill-Llama-70B&lt;/td&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Llama-3.3-70B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70B&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;70.2%&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;关键结论&lt;/strong&gt;：&lt;strong&gt;R1-Distill-Qwen-32B 在 AIME 上达到 72.6%，超越了 o1-mini&lt;/strong&gt;。这意味着一个 32B 参数的稠密模型，仅靠 R1 生成的推理数据微调，就达到了闭源旗舰推理模型的水平。&lt;/p&gt;
&lt;h2 id=&#34;综合效果对比&#34;&gt;综合效果对比
&lt;/h2&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th style=&#34;text-align: left&#34;&gt;基准&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;指标&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;GPT-4o&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;Claude 3.5 Sonnet&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;DeepSeek V3&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;OpenAI o1-mini&lt;/th&gt;
          &lt;th style=&#34;text-align: center&#34;&gt;DeepSeek R1&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;AIME 2024&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;9.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;16.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;39.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;71.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;79.8%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;MATH-500&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;74.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;71.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;90.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;90.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;97.3%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;GPQA Diamond&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;49.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;65.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;59.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;60.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;71.5%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;HumanEval&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;90.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;91.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;82.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;92.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;96.4%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;LiveCodeBench&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;pass@1&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;35.1%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;33.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;39.6%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;63.4%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;65.9%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;Codeforces&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;rating&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;724&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;717&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,134&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;1,258&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;2,029&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;MMLU&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;acc&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;87.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;88.3%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;88.5%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;85.8%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;90.8%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td style=&#34;text-align: left&#34;&gt;SimpleQA&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;acc&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;38.2%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;28.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;24.9%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;7.0%&lt;/td&gt;
          &lt;td style=&#34;text-align: center&#34;&gt;&lt;strong&gt;30.1%&lt;/strong&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;解读&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;R1 在数学（AIME、MATH-500）和代码（HumanEval、Codeforces）上全面领先&lt;/li&gt;
&lt;li&gt;在科学推理（GPQA Diamond）上比 o1-mini 高出 11.5 个百分点&lt;/li&gt;
&lt;li&gt;在通用知识（MMLU）上达到 90.8%，超越了所有对比模型&lt;/li&gt;
&lt;li&gt;在事实问答（SimpleQA）上不如 GPT-4o，说明推理增强不一定提升事实准确性&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;基础设施rl-训练工程架构&#34;&gt;基础设施：RL 训练工程架构
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1 的 RL 框架分为四个解耦模块，各模块间通过异步调度提高效率：&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;/p/deepseek-r1%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%BF%80%E5%8F%91%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E8%83%BD%E5%8A%9B/rl-infra.svg&#34;&gt;&lt;figcaption&gt;
      &lt;h4&gt;图 2：DeepSeek-R1 的 RL 训练基础设施架构。四模块解耦设计，各模块完成后自动卸载模型释放显存。&lt;/h4&gt;
    &lt;/figcaption&gt;
&lt;/figure&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Rollout 模块&lt;/strong&gt;：使用 vLLM 加载 Actor 模型，从训练数据集中取 prompt 分发到多个 worker。对 MoE 架构实现专家并行策略，部署冗余热点专家副本平衡计算负载，利用 Multi-Token Prediction 做自推测解码加速推理。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;推理模块&lt;/strong&gt;：加载 Reward Model 和 Reference Model，对 Rollout 生成的样本做前向传播，计算模型基奖励。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;规则奖励模块&lt;/strong&gt;：使用代码执行器、答案匹配器、格式检查器等计算规则奖励。通过异步调度与 Rollout 和 Inference 模块重叠执行，隐藏延迟。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;训练模块&lt;/strong&gt;：加载 Actor 和 Critic（如果需要），计算损失并更新参数。使用 Best-Fit 数据打包策略减少 padding 浪费，集成 DualPipe 算法实现高效流水线并行。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;关键工程优化&lt;/strong&gt;：每个模块完成后自动将模型从 VRAM 卸载到系统内存或磁盘，为下一阶段释放显存。&lt;/p&gt;
&lt;h2 id=&#34;护栏视角从-ai-安全看-r1&#34;&gt;护栏视角：从 AI 安全看 R1
&lt;/h2&gt;&lt;p&gt;作为一名 AI 安全工程师，我认为 DeepSeek-R1 带来的安全启示同样深刻：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;正面&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CoT 的可读性使推理过程可审计。安全团队可以检查模型的思考过程，而非仅看最终输出&lt;/li&gt;
&lt;li&gt;规则奖励天然对抗 reward hacking，比基于人类偏好的奖励模型更鲁棒&lt;/li&gt;
&lt;li&gt;蒸馏让小模型也具备推理能力，降低了安全审计的计算成本&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;挑战&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;长 CoT 输出可能隐藏恶意逻辑。如果模型在推理过程中学会了隐藏恶意意图，传统安全检测更难发现&lt;/li&gt;
&lt;li&gt;语言一致性奖励可能被利用。攻击者可通过控制 CoT 语言比例来绕过奖励约束&lt;/li&gt;
&lt;li&gt;推理增强不等于安全增强。R1 在 SimpleQA 上表现不如 GPT-4o，说明推理能力的提升可能带来新的幻觉风险&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;我的判断&lt;/strong&gt;：R1 的训练范式实际上为 AI 安全提供了一个新方向——&lt;strong&gt;用可验证的规则奖励代替人类偏好，可以构建更可控、更可审计的安全对齐方案&lt;/strong&gt;。如果未来安全对齐也能采用类似 R1 的规则奖励思路，我们可能获得比 RLHF 更可靠的安全护栏。&lt;/p&gt;
&lt;h2 id=&#34;总结&#34;&gt;总结
&lt;/h2&gt;&lt;p&gt;DeepSeek-R1 的核心贡献可以概括为三点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;纯 RL 驱动推理涌现&lt;/strong&gt;：首次验证了 LLM 的推理能力可以通过 RL 自组织涌现，无需 SFT 数据&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GRPO 算法工程化&lt;/strong&gt;：去价值网络的 RL 算法使训练成本降低 50%，为大规模 RL 训练铺平了道路&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;推理蒸馏实用化&lt;/strong&gt;：用 R1 生成的推理数据微调小模型，32B 模型即可超越 o1-mini，大幅降低了推理模型的使用门槛&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;R1 标志着大模型训练从「数据驱动」向「奖励驱动」的范式转移。如果说 GPT-3 证明了 scaling law 是模型能力的上限，那么 R1 证明了：&lt;strong&gt;在同样的模型规模下，训练方法才是决定能力上限的关键&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;参考资料&#34;&gt;参考资料
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;原论文&lt;/strong&gt;：DeepSeek-AI. &lt;em&gt;DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning&lt;/em&gt;. arXiv:2501.12948, 2025. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2501.12948&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://arxiv.org/abs/2501.12948&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Nature 发表版&lt;/strong&gt;：&lt;em&gt;DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning&lt;/em&gt;. Nature, 645, 635–645, 2025. &lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1038/s41586-025-09422-z&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://doi.org/10.1038/s41586-025-09422-z&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;官方代码仓库&lt;/strong&gt;：https://github.com/deepseek-ai/DeepSeek-R1&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GRPO 原论文&lt;/strong&gt;：Shao et al. &lt;em&gt;DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open Language Models&lt;/em&gt;. arXiv:2402.03300, 2024.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-V3 技术报告&lt;/strong&gt;：DeepSeek-AI. &lt;em&gt;DeepSeek-V3: A 671B MoE Model with Multi-Head Latent Attention&lt;/em&gt;. arXiv:2412.19437, 2024.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RLHF 与 PPO 综述&lt;/strong&gt;：Lambert et al. &lt;em&gt;Illustrating Reinforcement Learning from Human Feedback&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/blog/rlhf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://huggingface.co/blog/rlhf&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
</description>
        </item>
        
    </channel>
</rss>
