大模型微调 · 实操知识库
微调工坊
从选型、原理到上线:把开源大模型调教成你的领域专家
这是一套实操向的大模型微调知识库:什么时候该微调(对比提示工程与 RAG)、LoRA/QLoRA 的数学原理与显存账、指令数据构造与去污染、训练超参与显存优化、SFT 与 DPO 的实操级流程、评估回归体系,以及合并量化与 vLLM 部署。每个知识点都带可执行步骤与排错清单,读完能独立完成一次从数据到上线的完整微调。
7 模块
32 知识点
690 分钟总量
12 站最小路径
总体进度0%
01决策与选型
先想清楚:要不要微调、选哪种方法、显存够不够。
- 微调是什么:定义与全景 入门≈ 15 分钟
- 何时该微调:微调 vs 提示工程 vs RAG 入门≈ 20 分钟
- 微调技术谱系与选型决策树 入门≈ 15 分钟
- 显存预算:从参数量到显存账 入门≈ 20 分钟
02PEFT原理
LoRA/QLoRA/软提示的数学原理、超参与显存账。
- LoRA 数学原理:低秩分解 核心≈ 25 分钟
- LoRA 实操超参:rank/alpha/目标模块 核心≈ 20 分钟
- QLoRA:4-bit 量化与显存账 核心≈ 25 分钟
- 软提示方法族:Prefix/Prompt Tuning/P-Tuning 核心≈ 15 分钟
- LoRA 合并与多适配器部署 进阶≈ 20 分钟
03数据工程
指令数据构造、清洗、配比与去污染——效果的上限在这里决定。
- 指令数据构造:从种子到指令-回答对 核心≈ 25 分钟
- 数据清洗与质量过滤 核心≈ 20 分钟
- 数据配比、去重与课程设计 核心≈ 20 分钟
- 数据去污染与评测隔离 核心≈ 20 分钟
- 对话模板与特殊 token 核心≈ 25 分钟
04训练实操
环境、超参、显存优化、监控续训与防遗忘。
- 框架选型与环境搭建 核心≈ 25 分钟
- 核心超参:学习率/批量/梯度累积/调度 核心≈ 30 分钟
- 显存优化工具箱:梯度检查点/FlashAttention/ZeRO 核心≈ 25 分钟
- 混合精度训练与数值稳定性 核心≈ 20 分钟
- 训练监控、断点与续训 核心≈ 20 分钟
- 灾难性遗忘与通用能力保持 进阶≈ 20 分钟
05对齐微调
SFT 全流程与 DPO 偏好优化的实操级展开。
- SFT 全流程实操:从数据到可用模型 核心≈ 30 分钟
- DPO 数学原理:从 RLHF 到直接偏好优化 进阶≈ 25 分钟
- DPO 实操:数据、调参与排错 进阶≈ 30 分钟
- 前沿对齐速览:GRPO/ORPO/KTO/SimPO 前沿≈ 15 分钟
06评估迭代
三层评估、回归测试与基准陷阱,守住质量底线。
- 评估体系三层设计:自动指标/LLM 评审/人工盲评 核心≈ 25 分钟
- 回归测试与消融实验 核心≈ 20 分钟
- 基准陷阱与评测诚信 进阶≈ 15 分钟
07发布与边界
合并量化导出、vLLM 部署、翻车手册、历史与伦理。
- 合并、量化与导出 进阶≈ 25 分钟
- 推理部署:vLLM 与多 LoRA 服务 进阶≈ 25 分钟
- 常见翻车模式与排错手册 核心≈ 25 分钟
- 历史脉络:从 BERT 微调范式到 instruction tuning 入门≈ 15 分钟
- 伦理、合规与许可 核心≈ 15 分钟