学习路径

沿最小可用路径走完,你可以在一个工作日内,把一个开源模型用 LoRA 微调成格式稳定、通过回归测试、可部署的领域助手。完整四阶段适合两周节奏的系统学习。

最小路径完成度0%

最小可用路径 12 站 · 约 285 分钟

  1. 1 微调是什么:定义与全景 入门≈ 15 分钟
  2. 2 何时该微调:微调 vs 提示工程 vs RAG 入门≈ 20 分钟
  3. 3 显存预算:从参数量到显存账 入门≈ 20 分钟
  4. 4 LoRA 数学原理:低秩分解 核心≈ 25 分钟
  5. 5 LoRA 实操超参:rank/alpha/目标模块 核心≈ 20 分钟
  6. 6 指令数据构造:从种子到指令-回答对 核心≈ 25 分钟
  7. 7 对话模板与特殊 token 核心≈ 25 分钟
  8. 8 框架选型与环境搭建 核心≈ 25 分钟
  9. 9 核心超参:学习率/批量/梯度累积/调度 核心≈ 30 分钟
  10. 10 SFT 全流程实操:从数据到可用模型 核心≈ 30 分钟
  11. 11 评估体系三层设计:自动指标/LLM 评审/人工盲评 核心≈ 25 分钟
  12. 12 合并、量化与导出 进阶≈ 25 分钟

阶段一 · 入门 建立全景、决策框架与显存直觉

  1. 微调是什么:定义与全景 入门≈ 15 分钟
  2. 何时该微调:微调 vs 提示工程 vs RAG 入门≈ 20 分钟
  3. 微调技术谱系与选型决策树 入门≈ 15 分钟
  4. 显存预算:从参数量到显存账 入门≈ 20 分钟
  5. 历史脉络:从 BERT 微调范式到 instruction tuning 入门≈ 15 分钟

阶段二 · 原理与数据 先懂原理,再啃数据工程

  1. LoRA 数学原理:低秩分解 核心≈ 25 分钟
  2. LoRA 实操超参:rank/alpha/目标模块 核心≈ 20 分钟
  3. QLoRA:4-bit 量化与显存账 核心≈ 25 分钟
  4. 软提示方法族:Prefix/Prompt Tuning/P-Tuning 核心≈ 15 分钟
  5. 指令数据构造:从种子到指令-回答对 核心≈ 25 分钟
  6. 数据清洗与质量过滤 核心≈ 20 分钟
  7. 数据配比、去重与课程设计 核心≈ 20 分钟
  8. 数据去污染与评测隔离 核心≈ 20 分钟
  9. 对话模板与特殊 token 核心≈ 25 分钟

阶段三 · 训练与对齐 跑通训练循环,进阶到偏好优化

  1. 框架选型与环境搭建 核心≈ 25 分钟
  2. 核心超参:学习率/批量/梯度累积/调度 核心≈ 30 分钟
  3. 显存优化工具箱:梯度检查点/FlashAttention/ZeRO 核心≈ 25 分钟
  4. 混合精度训练与数值稳定性 核心≈ 20 分钟
  5. 训练监控、断点与续训 核心≈ 20 分钟
  6. 灾难性遗忘与通用能力保持 进阶≈ 20 分钟
  7. SFT 全流程实操:从数据到可用模型 核心≈ 30 分钟
  8. DPO 数学原理:从 RLHF 到直接偏好优化 进阶≈ 25 分钟
  9. DPO 实操:数据、调参与排错 进阶≈ 30 分钟

阶段四 · 进阶与前沿 评测守住底线,部署完成闭环

  1. 前沿对齐速览:GRPO/ORPO/KTO/SimPO 前沿≈ 15 分钟
  2. 评估体系三层设计:自动指标/LLM 评审/人工盲评 核心≈ 25 分钟
  3. 回归测试与消融实验 核心≈ 20 分钟
  4. 基准陷阱与评测诚信 进阶≈ 15 分钟
  5. 合并、量化与导出 进阶≈ 25 分钟
  6. 推理部署:vLLM 与多 LoRA 服务 进阶≈ 25 分钟
  7. 常见翻车模式与排错手册 核心≈ 25 分钟
  8. 伦理、合规与许可 核心≈ 15 分钟