LLaMA 没有发明全新的 Transformer,却用更充分的训练、RoPE 等成熟组件和可部署的模型尺寸改变了开放模型生态。本文拆解它的配方,并澄清 GQA 到底从哪一代开始。
Chinchilla 用同等训练算力证明:70B 参数、1.4T token 的模型可以胜过 280B 的 Gopher。本文拆解计算最优缩放律、三种拟合方法与它对现代大模型训练的影响。
模型越大,不一定越懂你。OpenAI 用人类反馈强化学习(RLHF)三步走,让 1.3B 的 InstructGPT 比 175B 的 GPT-3 更受用户青睐。本文拆解 SFT、奖励建模、PPO 的每个环节。
T5 用一个统一的 text-to-text 框架吞下所有 NLP 任务,BART 用去噪自编码器把 BERT 的双向理解与 GPT 的生成能力拼在一起——Encoder-Decoder 路线的巅峰。
GPT-3 用 1750 亿参数证明了规模就是能力:不微调、不更新参数,仅凭几个示例就能击败当时最先进的微调模型,彻底改变了 NLP 的范式。