术语表

共 42 条术语。输入关键词即可过滤。

微调 Fine-tuning

在预训练模型权重上,用领域数据继续梯度下降,使模型行为、格式或知识分布向目标任务偏移的过程。

全参微调 Full Fine-tuning

更新模型全部权重的微调方式,效果上限高但显存开销约为每参数 16 字节(AdamW)。

预训练 Pre-training

在海量无标注语料上以自监督目标训练模型,产出基座模型(Base Model)的阶段。

指令微调 Instruction Tuning / SFT

用「指令-回答」对进行监督微调,让模型学会理解并执行指令;现代对话模型的基础训练阶段。

参数高效微调 PEFT, Parameter-Efficient Fine-Tuning

冻结基座权重、只训练少量新增或选中参数的方法族,含 LoRA、Adapter、Prefix/Prompt Tuning 等。

LoRA Low-Rank Adaptation

假设权重更新量 ΔW 低秩,用 B·A 两个小矩阵的乘积表示并只训练它们,训练后可合并回原权重的 PEFT 方法。

秩 Rank, r

LoRA 中 ΔW=B·A 的内层维度,控制适配器的表达容量;常用 8-64。

Alpha 缩放因子

LoRA 分支输出乘以 α/r 的系数,解耦「容量」与「扰动幅度」的超参。

QLoRA

把冻结基座权重以 NF4 格式量化为 4-bit 存储、再训练常规 LoRA 的组合方法,显著降低显存门槛。

NF4 4-bit NormalFloat

为正态分布权重设计的信息论最优 4-bit 量化格式,QLoRA 的存储基础。

Adapter

在 Transformer 层间串接小型瓶颈模块并只训练它们的 PEFT 方法;不可合并,推理有额外延迟。

Prefix Tuning / Prompt Tuning / P-Tuning

软提示方法族:训练连续的「虚拟 token」向量拼入输入或每层注意力 K/V,不改模型权重。

对话模板 Chat Template

用特殊标记把多轮对话序列化为模型输入字符串的约定;训练与推理必须一致。

特殊 token Special Tokens

模板中的控制标记(如 `<|im_start|>`、`<|im_end|>`、eos),需要注册进 tokenizer 并参与训练。

eos End-of-Sequence

序列结束符。训练数据中回答末尾的 eos 参与损失计算,模型才能学会停止生成。

Loss Masking

训练时只对 assistant 回答段(含 eos)计算损失、其余位置标签置 -100 的做法。

灾难性遗忘 Catastrophic Forgetting

微调把模型压向窄分布,导致训练目标之外的通用能力显著退化的现象。

学习率 Learning Rate

参数更新的步长。微调经验区间:全参 1e-5~2e-5,LoRA 1e-4~3e-4,DPO 5e-7~5e-6。

有效批量 Effective Batch Size

单卡批量 × 梯度累积步数 × 卡数,决定每步梯度的统计质量。

梯度累积 Gradient Accumulation

显存受限时,攒多个小批量的梯度再做一次参数更新,以时间换批量。

Warmup

训练前期学习率从 0 线性升到目标值的阶段,通常占总步数的 3%-10%。

梯度检查点 Gradient Checkpointing

前向只存部分中间结果、反向时重算被丢弃部分,以约 20%-30% 速度换激活显存大幅下降。

FlashAttention

利用 GPU 显存层级分块计算的精确注意力实现,省激活显存且显著提速,非近似算法。

ZeRO

把优化器状态、梯度、参数切分到多卡以降低单卡显存的分布式训练技术,分三档。

混合精度 Mixed Precision

矩阵乘法用 16-bit、主权重与优化器状态保持 32-bit 的训练方式;bf16 免 loss scaling,fp16 需要动态 scaling。

Loss Scaling

fp16 训练中把损失放大使小梯度免于下溢、检测溢出后回退缩放因子的技巧。

RLHF Reinforcement Learning from Human Feedback

SFT → 奖励模型 → PPO 强化学习的三段式对齐管线。

DPO Direct Preference Optimization

用成对偏好上「被偏好与被拒绝回答的似然比」直接构造损失的对齐方法,免奖励模型与强化学习。

β Beta, DPO 温度

DPO 损失中控制偏离参考模型幅度的系数,常用 0.05-0.3。

GRPO Group Relative Policy Optimization

同一提示采样一组回答、以组内相对优势替代 critic 的在线强化学习算法,适用可验证奖励的推理任务。

ORPO / KTO / SimPO

DPO 后的免参考模型或免成对数据变体:ORPO 单阶段完成 SFT+偏好,KTO 接受好坏二元标注,SimPO 引入长度归一。

奖励模型 Reward Model, RM

在人类偏好对上训练、为回答打分的模型,RLHF 的核心组件。

数据去污染 Decontamination

检测并剔除训练数据与评测数据的重叠,保证评测分数可信的流程。

数据配比 Data Mixing

目标任务数据与通用/多任务数据在训练集中的比例设计,防遗忘的第一道防线。

LLM-as-a-Judge

用强模型按评分表为开放回答打分的评估方式,上线前需与人工标注校准。

回归测试 Regression Testing

每次迭代在固定的领域+通用双评测集上验证「新改动未弄坏既有能力」的机制。

消融实验 Ablation Study

单变量控制实验,用于把效果提升归因到具体因素(数据/模板/超参/方法)。

PagedAttention

vLLM 的 KV cache 分页管理技术,消除显存碎片、提升并发容量;配合连续批处理大幅提升吞吐。

多 LoRA 服务 Multi-LoRA Serving

一个基座常驻显存、按请求热切换多个 LoRA 适配器的服务形态。

AWQ / GPTQ / GGUF

主流导出量化格式:AWQ(激活感知、GPU 优先)、GPTQ(误差补偿、GPU 部署)、GGUF(llama.cpp 生态、CPU/Mac/端侧)。

TTFT / TPOT

推理服务两大延迟指标:首 token 延迟与每 token 生成间隔。

模型卡 Model Card

随模型交付的说明文档:基座与许可、训练数据描述、评测分数、已知限制与禁止用途。