历史脉络:从 BERT 微调范式到 instruction tuning

07-发布与边界 入门≈ 15 分钟 #历史#脉络#人物 reviewed
我的状态:

一句话定义

「微调」的含义在七年间经历了三次跃迁:2018 年 BERT 时代的「下游任务微调」、2020 年 GPT-3 的「不微调冲击」、2021-2022 年 PEFT 与 instruction tuning 的「重新定义微调」,理解这条线才能理解今天工具箱的形状。

为什么重要

今天你用的每个选项——LoRA rank、chat template、DPO 的 β——都是特定历史问题的答案。不知道脉络的人会把「微调=在预训练模型上训练」当成自古如此的常识,也不知道当前范式(数据高效的 PEFT + 指令对齐)是权衡的产物而非终点。

前置知识

kp-001 的微调基本概念即可,本节不依赖任何实操。

核心概念

三次范式跃迁:

  • 2018 · BERT 时代:预训练 + 下游微调成为 NLP 标准管线。微调 = 换个任务头 + 全参更新,每个任务一个微调副本。「特征提取 vs 全微调」是当时最大争论。
  • 2020 · GPT-3 冲击:1750 亿参数的模型展示 few-shot/zero-shot 能力,「不微调直接用」成为可能,同时宣告全参微调大模型在算力上不可行——PEFT 的历史必要性由此奠定。
  • 2021-2022 · PEFT 与对齐:Adapter(2019)、Prefix/Prompt Tuning(2021)、LoRA(2021)相继提出;InstructGPT(2022)确立 SFT + RLHF 的对齐范式,ChatGPT 把「指令模型」变成公众认知。
  • 2023-2024 · 开源与平权:LLaMA 开源、Alpaca 证明小数据 SFT 可行、QLoRA 把训练门槛降到消费级显卡、DPO 简化对齐、DeepSeek-R1 展示 GRPO 推理强化。

原理与机制

推动范式转移的三股力量:算力约束(175B 全参不可行 → 参数高效方法兴起)、数据认识(海量低质不如千条精选 → LIMA 式数据哲学)、对齐需求(能力≠听话 → SFT/RLHF/DPO 的对齐栈)。关键人物:Devlin(BERT)、Brown(GPT-3)、Hu(LoRA)、Dettmers(QLoRA/bitsandbytes)、Ouyang 与 Christiano(RLHF 线)、Rafailov(DPO)、Shao(GRPO/DeepSeek 系)。流派分歧延续至今:全参派(追求上限,工业大厂场景)vs PEFT 派(轻量高效,应用工程主流);能力优先(CPT/大规模 SFT)vs 对齐优先(偏好优化);基准驱动 vs 场景驱动。

图示

2018 BERT: 预训练+全参下游微调(每任务一份模型)
2020 GPT-3: few-shot 不微调 / 全参不可行
2021 LoRA/Prefix: 参数高效微调成体系
2022 InstructGPT: SFT+RLHF 对齐范式 → ChatGPT
2023 LLaMA/Alpaca/QLoRA/DPO: 开源平权, 消费级微调
2024 GRPO/ORPO/KTO: 对齐算法百花齐放 → R1 推理范式

直观类比

像烹饪史的演进:先是什么都从零炖(BERT 全参),后来发现半成品加热就行(预训练范式),再后来发现不必整锅回炉、撒一把对路的调料就够(PEFT),最后连「怎么摆盘让客人满意」(对齐)都成了专门学问。

实例或案例

读 2021 年 LoRA 论文时若不知 GPT-3 语境,会奇怪「为什么只训 0.1% 参数还敢声称效果可比」——因为当时的现实问题不是效果而是「全参根本训不起」;读 2022 年 InstructGPT 会发现它用约 1.3B 模型而非 175B——因为对齐实验的成本约束。每篇经典的方法选择背后都是当年的算力与数据现实。

操作步骤

把历史当作学习导航:入门后按时间线精读五篇——BERT(2018)→ GPT-3(2020)→ LoRA(2021)→ InstructGPT(2022)→ DPO(2023),每篇只回答三个问题:它反对什么、它的核心假设、它牺牲了什么。

排错清单

  • 被营销话术迷惑(「全新算法碾压一切」):对照历史看它解决的是哪一年的问题、哪个约束。
  • 复现论文效果不佳:注意论文当年的模型规模与数据设定,很多结论有明确的适用边界。
  • 面试/汇报讲不清范式:用本节时间线组织叙事,每个节点只记「问题-方法-代价」三元组。

常见误区

  • 微调是老古董:形式在变(全参 → PEFT → 对齐微调 → 推理强化),「用数据改变模型行为」的需求从未退场。
  • LoRA 是最近才有的:它诞生于 2021 年,2023 年才因开源生态普及——工具诞生与工具普及是两件事。
  • 历史是线性进步:RLHF → DPO 的简化在部分场景牺牲了在线探索能力(GRPO 又把在线范式带回来),范式有轮回。

与其他知识点的关系

方法谱系的现状版见 kp-003;LoRA 与 DPO 的技术细节分别见 kp-005 与 kp-022;微调的定义见 kp-001。

延伸阅读

时间线五篇即延伸阅读:Devlin et al. 2018《BERT》、Brown et al. 2020《Language Models are Few-Shot Learners》、Hu et al. 2021《LoRA》、Ouyang et al. 2022《Training language models to follow instructions with human feedback》、Rafailov et al. 2023《Direct Preference Optimization》。

自测题

  1. GPT-3 对微调范式的双重冲击是什么?

答:一方面展示 few-shot 让「不微调」成为选项,另一方面 175B 让全参微调在算力上不可行——后者直接催生 PEFT。

  1. InstructGPT 确立的对齐管线是哪三段?

答:SFT → 奖励模型(人类偏好训练)→ PPO 强化学习。

  1. 2023 年把微调门槛降到消费级显卡的关键工作是哪两项?

答:LLaMA 等开源基座 + QLoRA(4-bit 量化 + LoRA 的工程组合)。

相关知识点

来源

  • Devlin et al. 2018《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》
  • Brown et al. 2020《Language Models are Few-Shot Learners》

基于模型知识整理,建议按需核对原文。