历史脉络:从 BERT 微调范式到 instruction tuning
一句话定义
「微调」的含义在七年间经历了三次跃迁:2018 年 BERT 时代的「下游任务微调」、2020 年 GPT-3 的「不微调冲击」、2021-2022 年 PEFT 与 instruction tuning 的「重新定义微调」,理解这条线才能理解今天工具箱的形状。
为什么重要
今天你用的每个选项——LoRA rank、chat template、DPO 的 β——都是特定历史问题的答案。不知道脉络的人会把「微调=在预训练模型上训练」当成自古如此的常识,也不知道当前范式(数据高效的 PEFT + 指令对齐)是权衡的产物而非终点。
前置知识
kp-001 的微调基本概念即可,本节不依赖任何实操。
核心概念
三次范式跃迁:
- 2018 · BERT 时代:预训练 + 下游微调成为 NLP 标准管线。微调 = 换个任务头 + 全参更新,每个任务一个微调副本。「特征提取 vs 全微调」是当时最大争论。
- 2020 · GPT-3 冲击:1750 亿参数的模型展示 few-shot/zero-shot 能力,「不微调直接用」成为可能,同时宣告全参微调大模型在算力上不可行——PEFT 的历史必要性由此奠定。
- 2021-2022 · PEFT 与对齐:Adapter(2019)、Prefix/Prompt Tuning(2021)、LoRA(2021)相继提出;InstructGPT(2022)确立 SFT + RLHF 的对齐范式,ChatGPT 把「指令模型」变成公众认知。
- 2023-2024 · 开源与平权:LLaMA 开源、Alpaca 证明小数据 SFT 可行、QLoRA 把训练门槛降到消费级显卡、DPO 简化对齐、DeepSeek-R1 展示 GRPO 推理强化。
原理与机制
推动范式转移的三股力量:算力约束(175B 全参不可行 → 参数高效方法兴起)、数据认识(海量低质不如千条精选 → LIMA 式数据哲学)、对齐需求(能力≠听话 → SFT/RLHF/DPO 的对齐栈)。关键人物:Devlin(BERT)、Brown(GPT-3)、Hu(LoRA)、Dettmers(QLoRA/bitsandbytes)、Ouyang 与 Christiano(RLHF 线)、Rafailov(DPO)、Shao(GRPO/DeepSeek 系)。流派分歧延续至今:全参派(追求上限,工业大厂场景)vs PEFT 派(轻量高效,应用工程主流);能力优先(CPT/大规模 SFT)vs 对齐优先(偏好优化);基准驱动 vs 场景驱动。
图示
2018 BERT: 预训练+全参下游微调(每任务一份模型)
2020 GPT-3: few-shot 不微调 / 全参不可行
2021 LoRA/Prefix: 参数高效微调成体系
2022 InstructGPT: SFT+RLHF 对齐范式 → ChatGPT
2023 LLaMA/Alpaca/QLoRA/DPO: 开源平权, 消费级微调
2024 GRPO/ORPO/KTO: 对齐算法百花齐放 → R1 推理范式直观类比
像烹饪史的演进:先是什么都从零炖(BERT 全参),后来发现半成品加热就行(预训练范式),再后来发现不必整锅回炉、撒一把对路的调料就够(PEFT),最后连「怎么摆盘让客人满意」(对齐)都成了专门学问。
实例或案例
读 2021 年 LoRA 论文时若不知 GPT-3 语境,会奇怪「为什么只训 0.1% 参数还敢声称效果可比」——因为当时的现实问题不是效果而是「全参根本训不起」;读 2022 年 InstructGPT 会发现它用约 1.3B 模型而非 175B——因为对齐实验的成本约束。每篇经典的方法选择背后都是当年的算力与数据现实。
操作步骤
把历史当作学习导航:入门后按时间线精读五篇——BERT(2018)→ GPT-3(2020)→ LoRA(2021)→ InstructGPT(2022)→ DPO(2023),每篇只回答三个问题:它反对什么、它的核心假设、它牺牲了什么。
排错清单
- 被营销话术迷惑(「全新算法碾压一切」):对照历史看它解决的是哪一年的问题、哪个约束。
- 复现论文效果不佳:注意论文当年的模型规模与数据设定,很多结论有明确的适用边界。
- 面试/汇报讲不清范式:用本节时间线组织叙事,每个节点只记「问题-方法-代价」三元组。
常见误区
- 微调是老古董:形式在变(全参 → PEFT → 对齐微调 → 推理强化),「用数据改变模型行为」的需求从未退场。
- LoRA 是最近才有的:它诞生于 2021 年,2023 年才因开源生态普及——工具诞生与工具普及是两件事。
- 历史是线性进步:RLHF → DPO 的简化在部分场景牺牲了在线探索能力(GRPO 又把在线范式带回来),范式有轮回。
与其他知识点的关系
方法谱系的现状版见 kp-003;LoRA 与 DPO 的技术细节分别见 kp-005 与 kp-022;微调的定义见 kp-001。
延伸阅读
时间线五篇即延伸阅读:Devlin et al. 2018《BERT》、Brown et al. 2020《Language Models are Few-Shot Learners》、Hu et al. 2021《LoRA》、Ouyang et al. 2022《Training language models to follow instructions with human feedback》、Rafailov et al. 2023《Direct Preference Optimization》。
自测题
- GPT-3 对微调范式的双重冲击是什么?
答:一方面展示 few-shot 让「不微调」成为选项,另一方面 175B 让全参微调在算力上不可行——后者直接催生 PEFT。
- InstructGPT 确立的对齐管线是哪三段?
答:SFT → 奖励模型(人类偏好训练)→ PPO 强化学习。
- 2023 年把微调门槛降到消费级显卡的关键工作是哪两项?
答:LLaMA 等开源基座 + QLoRA(4-bit 量化 + LoRA 的工程组合)。
相关知识点
来源
- Devlin et al. 2018《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》
- Brown et al. 2020《Language Models are Few-Shot Learners》
基于模型知识整理,建议按需核对原文。