<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Scaling Laws on 辰远</title>
        <link>/tags/scaling-laws/</link>
        <description>Recent content in Scaling Laws on 辰远</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>Lee</copyright>
        <lastBuildDate>Mon, 21 Sep 2026 09:08:58 +0800</lastBuildDate><atom:link href="/tags/scaling-laws/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>Chinchilla：大模型不是越大越好，数据也要一起扩展</title>
            <link>/p/chinchilla-scaling-laws/</link>
            <pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate>
            <guid>/p/chinchilla-scaling-laws/</guid>
            <description>&lt;img src=&#34;/p/chinchilla-scaling-laws/cover.jpg&#34; alt=&#34;Featured image of post Chinchilla：大模型不是越大越好，数据也要一起扩展&#34; /&gt;&lt;h2 id=&#34;引言参数竞赛漏掉了另一半&#34;&gt;引言：参数竞赛漏掉了另一半&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;如果把 2020—2021 年的大模型竞赛压缩成一句话，大概是：&lt;strong&gt;显卡更多，就把模型做得更大。&lt;/strong&gt; GPT-3 有 175B 参数，Gopher 有 280B，Megatron-Turing NLG 更冲到 530B。参数量成了最醒目的进度条，训练数据却常停留在约 300B token 的量级。&lt;/p&gt;&#xA;&lt;p&gt;这背后并不是盲目崇拜“大”。Kaplan 等人在 2020 年得到的缩放律指出，大模型的样本效率更高；在固定计算预算下，似乎应该优先增加参数，并在模型还没有充分收敛时停止训练。问题是，当实验跨到更大的模型和更长的训练区间，这个结论还成立吗？&lt;/p&gt;&#xA;&lt;p&gt;2022 年，DeepMind 的 &lt;em&gt;Training Compute-Optimal Large Language Models&lt;/em&gt; 给出了一个几乎反直觉的答案：当训练计算量固定时，当时的主流模型普遍&lt;strong&gt;参数太多、数据太少&lt;/strong&gt;。与其造一个巨大的“半成品”，不如用更小的模型读更多数据。&lt;/p&gt;&#xA;&lt;figure&gt;&lt;img src=&#34;/p/chinchilla-scaling-laws/cover.jpg&#34;&gt;&lt;figcaption&gt;&#xA;&#x9;&#x9;&#x9;&lt;h4&gt;封面：同等训练能量下，参数规模与数据量必须共同分配&lt;/h4&gt;&#xA;&#x9;&#x9;&lt;/figcaption&gt;&#xA;&lt;/figure&gt;&#xA;&#xA;&lt;p&gt;论文训练了 400 多个模型，规模从 70M 到 16B 以上，训练数据从 5B 到 500B token。然后它做了最有说服力的实验：用与 Gopher 基本相同的训练 FLOPs，训练一个只有 70B 参数、却看过 1.4T token 的模型——Chinchilla。结果，这个小四倍的模型几乎全面胜过 280B 的 Gopher。&lt;/p&gt;&#xA;&lt;p&gt;Chinchilla 的意义因此不只是一个新模型，而是把问题从“模型还能做多大”改写为：&lt;strong&gt;给定一笔算力，参数和数据应该怎样分账？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;先把账算清训练计算量由什么决定&#34;&gt;先把账算清：训练计算量由什么决定&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;对标准稠密 Transformer，一次训练的主导计算量可以近似写成：&lt;/p&gt;&#xA;$$C \approx 6ND$$&lt;p&gt;其中 $C$ 是训练 FLOPs，$N$ 是非 embedding 参数量，$D$ 是训练 token 数。常数 6 来自前向与反向传播的近似成本；精确工程核算会受到注意力长度、激活重算等因素影响，但这个式子足够描述缩放关系。&lt;/p&gt;&#xA;&lt;p&gt;固定 $C$ 后，$N$ 与 $D$ 形成跷跷板：参数翻倍，能看的 token 就必须减半。真正的目标并不是让任一项最大，而是让最终验证损失最小。&lt;/p&gt;&#xA;&lt;p&gt;论文用一个可分解的经验损失函数表达两种瓶颈：&lt;/p&gt;&#xA;$$L(N,D)=E+\frac{A}{N^\alpha}+\frac{B}{D^\beta}$$&lt;ul&gt;&#xA;&lt;li&gt;$E$ 是数据分布本身难以消除的熵下限；&lt;/li&gt;&#xA;&lt;li&gt;$A/N^\alpha$ 表示模型容量不足造成的损失；&lt;/li&gt;&#xA;&lt;li&gt;$B/D^\beta$ 表示数据不足、训练不充分造成的损失。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;参数很多但数据太少时，第二项不会因为模型变大而自动消失。这正是“欠训练”一词在 Chinchilla 语境中的含义：不是优化器没跑完，而是&lt;strong&gt;相对于模型容量，token 预算不够&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;三条证据如何指向同一个结论&#34;&gt;三条证据如何指向同一个结论&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;Chinchilla 论文没有只拟合一条曲线。它用三种方法交叉验证计算最优前沿。&lt;/p&gt;&#xA;&lt;p&gt;第一种方法固定模型大小，改变训练 token 数，观察每条训练曲线在不同计算预算下能达到的最低损失，再拟合最优 $N$ 和 $D$ 随 $C$ 的变化。得到的指数约为：&lt;/p&gt;&#xA;$$N_{opt}\propto C^{0.50},\qquad D_{opt}\propto C^{0.50}$$&lt;p&gt;第二种方法构造 IsoFLOP 曲线：对每个固定 FLOP 预算，训练多种参数量与 token 数组合。把最终损失画成参数量的函数，会看到一个清晰的“谷底”。谷底位置随算力移动，拟合指数约为 0.49 和 0.51。&lt;/p&gt;&#xA;&lt;p&gt;第三种方法直接对全部实验点拟合前面的参数化损失函数，得到的指数约为 0.46 和 0.54。三种方法的数值并不完全相同，却给出相同方向：&lt;strong&gt;算力增加时，参数量与训练数据量应大致等比例增长。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这修正了早期 Kaplan 缩放律中“更多预算主要拿去增大模型”的配置。工程上常把 Chinchilla 结果简化为“每个参数约 20 个 token”：70B × 20 ≈ 1.4T。这个比例很有用，但它不是自然常数。它依赖数据分布、模型族、训练目标和拟合区间；真正稳健的结论是参数与数据要共同扩展，而不是永远机械套用 20:1。&lt;/p&gt;&#xA;&lt;h2 id=&#34;同样算力70b-为什么能赢-280b&#34;&gt;同样算力：70B 为什么能赢 280B&#xD;&#xA;&lt;/h2&gt;&lt;figure&gt;&lt;img src=&#34;/p/chinchilla-scaling-laws/compute-allocation.png&#34;&gt;&lt;figcaption&gt;&#xA;&#x9;&#x9;&#x9;&lt;h4&gt;图 1：Gopher 与 Chinchilla 使用近似相同的训练算力；Chinchilla 把预算从参数量转向更多训练 token&lt;/h4&gt;&#xA;&#x9;&#x9;&lt;/figcaption&gt;&#xA;&lt;/figure&gt;&#xA;&#xA;&lt;p&gt;Gopher 有 280B 参数，训练约 300B token；Chinchilla 有 70B 参数，训练 1.4T token。粗略看，模型缩小四倍，数据增加约四倍，两者的 $N\times D$ 因而处在相近量级。&lt;/p&gt;&#xA;&lt;p&gt;这不是通过更换一种革命性架构取胜。论文明确说明 Chinchilla 基本沿用 Gopher 的模型架构和训练设置，主要差异包括数据配比、AdamW 优化器以及略作修改的 SentencePiece tokenizer。换句话说，胜负的核心证据来自&lt;strong&gt;计算预算分配&lt;/strong&gt;，而不是架构魔法。&lt;/p&gt;&#xA;&lt;p&gt;结果非常直接：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;指标&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th style=&#34;text-align: right&#34;&gt;Gopher 280B&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th style=&#34;text-align: right&#34;&gt;Chinchilla 70B&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;含义&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;训练 token&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;约 300B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;1.4T&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;更充分地消化模型容量&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;MMLU 5-shot&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;约 60.0%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;67.6%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;平均提升 7.6 个百分点&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;LAMBADA&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;74.5%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;77.4%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;更小模型仍有更强阅读预测&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;BIG-bench 平均&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;54.4%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;65.1%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;62 项中仅 4 项落后&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;在 MMLU 的 57 个任务中，Chinchilla 有 51 个优于 Gopher，2 个持平，只有 4 个更差。论文还显示它在大量任务上胜过 GPT-3、Jurassic-1 与 530B 的 MT-NLG。这里最值得记住的不是某个 benchmark 的小数点，而是反事实：&lt;strong&gt;如果同样的算力被错误地堆成更大参数量，最后得到的模型反而更差。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;训练最优不等于产品最优&#34;&gt;训练最优，不等于产品最优&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;Chinchilla 的目标函数只问一件事：固定预训练 FLOPs，怎样把训练损失降到最低。但真实产品还有部署成本。&lt;/p&gt;&#xA;&lt;p&gt;70B 模型不仅训练效果更好，推理时也比 280B 模型需要更少内存、更低带宽和更少计算。因此，Chinchilla 在这个案例里同时改善了训练结果与服务成本。不过从更一般的角度看，“训练一次”与“调用十亿次”并不是同一本账。&lt;/p&gt;&#xA;&lt;p&gt;2024 年的 &lt;em&gt;Beyond Chinchilla-Optimal&lt;/em&gt; 把预期推理需求纳入优化，结论是：当服务调用量很大时，可能值得把模型做得比 Chinchilla 最优点更小，再用更多 token 训练。预训练多花一次钱，换来每次推理都更便宜。这也解释了后来模型的“过度训练”趋势。&lt;/p&gt;&#xA;&lt;p&gt;Meta 的 Llama 3 是很好的官方例子。Meta 表示，按 Chinchilla 基准，8B 模型的计算最优训练量约为 200B token，但其 8B 和 70B 模型训练到 15T token 时仍持续改善。这里没有推翻 Chinchilla：目标已经从“给定训练 FLOPs 的最低损失”变成“兼顾质量与长期推理效率的产品模型”。&lt;/p&gt;&#xA;&lt;p&gt;所以更完整的决策链应当是：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;先用缩放实验估计参数、数据与损失的关系；&lt;/li&gt;&#xA;&lt;li&gt;再把可用数据质量、训练硬件与时间窗口纳入约束；&lt;/li&gt;&#xA;&lt;li&gt;最后加入模型生命周期内的推理量、延迟和显存成本。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;“20 token/参数”是起点，不是采购清单。&lt;/p&gt;&#xA;&lt;h2 id=&#34;数据成为新的稀缺资源&#34;&gt;数据成为新的稀缺资源&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;旧范式的主要瓶颈是如何把更大的模型切到更多加速器上；Chinchilla 之后，数据工程被推到同等重要的位置。论文估算，一个 175B 参数模型若位于其计算最优前沿，需要数万亿 token，而不是 GPT-3 使用的约 300B token。再往上扩展，所需的高质量、去重、合规数据增长得极快。&lt;/p&gt;&#xA;&lt;p&gt;“更多 token”也不能简单等同于“重复抓更多网页”。低质量数据会改变损失函数的常数和指数，重复数据还可能让模型记忆而非泛化。数据清洗、去重、语言与领域配比、污染检测，都会决定额外 token 是否真的提供新信息。&lt;/p&gt;&#xA;&lt;p&gt;我认为 Chinchilla 最深的产业影响，是把数据从训练流水线的原料变成了模型设计变量。架构团队不能先拍板参数量，再让数据团队“尽量填满”；两者必须在同一个预算模型里联合设计。&lt;/p&gt;&#xA;&lt;h2 id=&#34;护栏视角&#34;&gt;护栏视角&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;缩放律看起来是一项效率研究，但它也直接影响安全边界。&lt;/p&gt;&#xA;&lt;p&gt;第一，计算最优不代表风险最优。更多高质量 token 会提高知识覆盖与泛化能力，也可能提高模型在网络攻击、欺骗或敏感领域的能力。能力评估与危险能力评估必须跟着预训练规模同时扩展，不能等训练完成后才补测。&lt;/p&gt;&#xA;&lt;p&gt;第二，数据量压力会诱发来源与隐私风险。当路线图要求数万亿 token，团队更容易降低授权、个人信息清理和数据溯源标准。一个“计算上最优”的语料方案，可能在版权、隐私与偏见上完全不可接受。数据治理应当是预算约束，而不是训练后的合规附件。&lt;/p&gt;&#xA;&lt;p&gt;第三，缩放律是外推工具，不是安全证明。论文的拟合来自特定模型族、数据混合和计算区间；把曲线外推数个数量级，本身就带有不确定性。上线决策仍需要实测、红队、分层访问和持续监控，不能因为损失曲线可预测，就假设行为也同样可预测。&lt;/p&gt;&#xA;&lt;p&gt;我的判断是：Chinchilla 教会行业“不要浪费训练算力”，安全团队则需要补上下一句——&lt;strong&gt;也不要为了吃满缩放律而浪费数据治理与评估余量。&lt;/strong&gt; 最优点必须同时对技术、成本和风险负责。&lt;/p&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;Chinchilla 用一个极其干净的对照实验终结了单看参数量的竞赛叙事：70B 参数、1.4T token，在与 280B Gopher近似相同的训练计算量下取得更好结果。&lt;/p&gt;&#xA;&lt;p&gt;它留下了三条至今仍有价值的原则：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;固定训练预算时，参数量和数据量必须联合优化；&lt;/li&gt;&#xA;&lt;li&gt;参数与 token 大致等比例扩展，比只堆参数更接近计算最优；&lt;/li&gt;&#xA;&lt;li&gt;训练最优只是一个目标，数据质量与生命周期推理成本会把实际产品推向更小、训练更久的模型。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;参数量告诉我们模型能装下多少容量，token 数决定这些容量是否真正被训练出来。大模型的“规模”从此不再是一个数字，而是参数、数据、算力与部署需求共同组成的系统。&lt;/p&gt;&#xA;&lt;h2 id=&#34;参考资料&#34;&gt;参考资料&#xD;&#xA;&lt;/h2&gt;&lt;ol&gt;&#xA;&lt;li&gt;Hoffmann, J. et al. &lt;em&gt;Training Compute-Optimal Large Language Models&lt;/em&gt;. NeurIPS 2022. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2203.15556&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/2203.15556&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Google DeepMind. &lt;em&gt;An empirical analysis of compute-optimal large language model training&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;https://deepmind.google/blog/an-empirical-analysis-of-compute-optimal-large-language-model-training/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://deepmind.google/blog/an-empirical-analysis-of-compute-optimal-large-language-model-training/&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Kaplan, J. et al. &lt;em&gt;Scaling Laws for Neural Language Models&lt;/em&gt;. 2020. &lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2001.08361&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://arxiv.org/abs/2001.08361&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;OpenAI. &lt;em&gt;Scaling laws for neural language models&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;https://openai.com/index/scaling-laws-for-neural-language-models/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://openai.com/index/scaling-laws-for-neural-language-models/&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Sardana, N. et al. &lt;em&gt;Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws&lt;/em&gt;. ICML 2024. &lt;a class=&#34;link&#34; href=&#34;https://proceedings.mlr.press/v235/sardana24a.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://proceedings.mlr.press/v235/sardana24a.html&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Meta AI. &lt;em&gt;Introducing Meta Llama 3&lt;/em&gt;. &lt;a class=&#34;link&#34; href=&#34;https://ai.meta.com/blog/meta-llama-3/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xD;&#xA;    &gt;https://ai.meta.com/blog/meta-llama-3/&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;</description>
        </item></channel>
</rss>
