大模型微调 · 实操知识库

微调工坊

从选型、原理到上线:把开源大模型调教成你的领域专家

这是一套实操向的大模型微调知识库:什么时候该微调(对比提示工程与 RAG)、LoRA/QLoRA 的数学原理与显存账、指令数据构造与去污染、训练超参与显存优化、SFT 与 DPO 的实操级流程、评估回归体系,以及合并量化与 vLLM 部署。每个知识点都带可执行步骤与排错清单,读完能独立完成一次从数据到上线的完整微调。

7 模块 32 知识点 690 分钟总量 12 站最小路径
总体进度0%

01决策与选型

先想清楚:要不要微调、选哪种方法、显存够不够。

02PEFT原理

LoRA/QLoRA/软提示的数学原理、超参与显存账。

03数据工程

指令数据构造、清洗、配比与去污染——效果的上限在这里决定。

04训练实操

环境、超参、显存优化、监控续训与防遗忘。

05对齐微调

SFT 全流程与 DPO 偏好优化的实操级展开。

06评估迭代

三层评估、回归测试与基准陷阱,守住质量底线。

07发布与边界

合并量化导出、vLLM 部署、翻车手册、历史与伦理。