微调 Fine-tuning
在预训练模型权重上,用领域数据继续梯度下降,使模型行为、格式或知识分布向目标任务偏移的过程。
共 42 条术语。输入关键词即可过滤。
在预训练模型权重上,用领域数据继续梯度下降,使模型行为、格式或知识分布向目标任务偏移的过程。
更新模型全部权重的微调方式,效果上限高但显存开销约为每参数 16 字节(AdamW)。
在海量无标注语料上以自监督目标训练模型,产出基座模型(Base Model)的阶段。
用「指令-回答」对进行监督微调,让模型学会理解并执行指令;现代对话模型的基础训练阶段。
冻结基座权重、只训练少量新增或选中参数的方法族,含 LoRA、Adapter、Prefix/Prompt Tuning 等。
假设权重更新量 ΔW 低秩,用 B·A 两个小矩阵的乘积表示并只训练它们,训练后可合并回原权重的 PEFT 方法。
LoRA 中 ΔW=B·A 的内层维度,控制适配器的表达容量;常用 8-64。
LoRA 分支输出乘以 α/r 的系数,解耦「容量」与「扰动幅度」的超参。
把冻结基座权重以 NF4 格式量化为 4-bit 存储、再训练常规 LoRA 的组合方法,显著降低显存门槛。
为正态分布权重设计的信息论最优 4-bit 量化格式,QLoRA 的存储基础。
在 Transformer 层间串接小型瓶颈模块并只训练它们的 PEFT 方法;不可合并,推理有额外延迟。
软提示方法族:训练连续的「虚拟 token」向量拼入输入或每层注意力 K/V,不改模型权重。
用特殊标记把多轮对话序列化为模型输入字符串的约定;训练与推理必须一致。
模板中的控制标记(如 `<|im_start|>`、`<|im_end|>`、eos),需要注册进 tokenizer 并参与训练。
序列结束符。训练数据中回答末尾的 eos 参与损失计算,模型才能学会停止生成。
训练时只对 assistant 回答段(含 eos)计算损失、其余位置标签置 -100 的做法。
微调把模型压向窄分布,导致训练目标之外的通用能力显著退化的现象。
参数更新的步长。微调经验区间:全参 1e-5~2e-5,LoRA 1e-4~3e-4,DPO 5e-7~5e-6。
单卡批量 × 梯度累积步数 × 卡数,决定每步梯度的统计质量。
显存受限时,攒多个小批量的梯度再做一次参数更新,以时间换批量。
训练前期学习率从 0 线性升到目标值的阶段,通常占总步数的 3%-10%。
前向只存部分中间结果、反向时重算被丢弃部分,以约 20%-30% 速度换激活显存大幅下降。
利用 GPU 显存层级分块计算的精确注意力实现,省激活显存且显著提速,非近似算法。
把优化器状态、梯度、参数切分到多卡以降低单卡显存的分布式训练技术,分三档。
矩阵乘法用 16-bit、主权重与优化器状态保持 32-bit 的训练方式;bf16 免 loss scaling,fp16 需要动态 scaling。
fp16 训练中把损失放大使小梯度免于下溢、检测溢出后回退缩放因子的技巧。
SFT → 奖励模型 → PPO 强化学习的三段式对齐管线。
用成对偏好上「被偏好与被拒绝回答的似然比」直接构造损失的对齐方法,免奖励模型与强化学习。
DPO 损失中控制偏离参考模型幅度的系数,常用 0.05-0.3。
同一提示采样一组回答、以组内相对优势替代 critic 的在线强化学习算法,适用可验证奖励的推理任务。
DPO 后的免参考模型或免成对数据变体:ORPO 单阶段完成 SFT+偏好,KTO 接受好坏二元标注,SimPO 引入长度归一。
在人类偏好对上训练、为回答打分的模型,RLHF 的核心组件。
检测并剔除训练数据与评测数据的重叠,保证评测分数可信的流程。
目标任务数据与通用/多任务数据在训练集中的比例设计,防遗忘的第一道防线。
用强模型按评分表为开放回答打分的评估方式,上线前需与人工标注校准。
每次迭代在固定的领域+通用双评测集上验证「新改动未弄坏既有能力」的机制。
单变量控制实验,用于把效果提升归因到具体因素(数据/模板/超参/方法)。
vLLM 的 KV cache 分页管理技术,消除显存碎片、提升并发容量;配合连续批处理大幅提升吞吐。
一个基座常驻显存、按请求热切换多个 LoRA 适配器的服务形态。
主流导出量化格式:AWQ(激活感知、GPU 优先)、GPTQ(误差补偿、GPU 部署)、GGUF(llama.cpp 生态、CPU/Mac/端侧)。
推理服务两大延迟指标:首 token 延迟与每 token 生成间隔。
随模型交付的说明文档:基座与许可、训练数据描述、评测分数、已知限制与禁止用途。