评估体系三层设计:自动指标/LLM 评审/人工盲评
前置知识点
一句话定义
评估体系分三层:规则可判的用自动指标、开放生成用 LLM-as-judge、关键决策用人工盲评——三层各司其职,构成「快筛 → 细评 → 终审」的漏斗。
为什么重要
「感觉变好了」不是工程语言。没有评估体系的微调项目无法回答三个致命问题:v2 比 v1 好吗?好在哪个场景?可以上线吗?同时评估集是从 kp-013(去污染)到 kp-026(回归测试)所有质量机制的地基——它值得像对待产品一样被设计。
前置知识
kp-021 的 SFT 产出;kp-013 的评测隔离原则。
核心概念
- 自动指标层:抽取/分类/结构化输出用程序判分(准确率、F1、schema 校验通过率);文本重叠类指标(ROUGE/BLEU)只适合摘要且参考有限。
- LLM-as-judge 层:强模型按评分表给开放回答打分;需控制位置偏差(交换顺序各评一次)与长度偏差(评分表显式声明「长度不加分」)。
- 人工盲评层:双人独立评、答案匿名乱序、算评分者间一致性(Kappa),用于版本发布终审。
- 私有评测集:100-500 条覆盖业务场景分布的固定题目,冻结版本,是整个体系的锚。
原理与机制
三层漏斗的逻辑:自动层零成本,每次训练都跑,负责「挡住明显退化」;judge 层每次几分钱,负责「给出可比较的质量分」;人工层最贵,只在候选版本定夺时启用,负责「校准前两层」。judge 的可信度来自校准:先抽 50 条让人工与 judge 同时评,一致率(或相关系数)达标(如 Kappa>0.6)才能信任 judge 的批量结论,否则先改评分表。
评测集设计要点:按线上场景的真实分布采样(而不是按「好出题的方向」);每类场景留出可判分的锚点题;题目与训练数据做过 kp-013 去污染;版本冻结后任何改动都升版本号。
图示
每次训练 ──► 自动指标层(全量, 免费) ──过──► judge层(抽样, 便宜) ──过──► 人工盲评(候选版, 贵)
│ 明显退化,拦截 │ 质量分对比 │ 发布终审直观类比
体检分三档:自助测量(自动指标,天天测)、门诊化验(judge,按需)、专家会诊(人工盲评,大事才用)。全都自己上会累死,全交给仪器会误诊。
实例或案例
客服模型评测集 300 题:180 题格式遵从(自动判分)、90 题回答质量(judge 评分表:准确性/简洁性/语气三项 1-5 分)、30 题争议场景(人工盲评)。judge 校准:50 条双人标注与 GPT 级 judge 对照,Kappa 0.68 达标后批量启用。此后每个候选版本 10 分钟出全套分数,v1→v3 的迭代全部有据可查。
操作步骤
- 从业务真实请求分层抽样,人工整理 100-500 题,分「自动可判 / judge / 人工」三栏。
- 写自动判分脚本(精确匹配/正则/JSON schema 校验/关键字段断言)。
- 写 judge 评分表 prompt:维度定义、1-5 分档位描述样例、「长度与格式不单独加分」声明。
- judge 校准:50 条人工盲评 vs judge,Kappa≥0.6 才启用;不达标改评分表再校准。
- 冻结评测集版本;每个候选模型跑全三层,产出标准化评测报告(均值 + 按场景分组 + 失败案例清单)。
排错清单
- judge 分数与体感不符:查评分表是否被长度/格式带偏,或样本超出 judge 能力域,人工复核抽 20 条。
- 自动指标高分但用户差评:指标只测了表面格式,补 judge 与人工层覆盖质量维度。
- 评测分次次创新高但线上无感:评测分布与线上不符,重新按真实流量采样。
- 人工评分者间差异大:评分标准文档化 + 校准会议 + Kappa 复测。
常见误区
- 只有一层:只靠 judge 会被偏差骗,只靠人工评不动,只靠自动指标测不出质量。
- 评测集一劳永逸:业务演进后要按新版流量重采,但仍需保留旧版可回溯。
- ROUGE 万能:它度量与参考答案的字面重叠,对「更好的不同答案」会打低分,仅限摘要类任务使用。
与其他知识点的关系
评测集的防污染前置见 kp-013;回归测试把本节体系固化成流程见 kp-026;judge 偏差与基准争议的展开见 kp-027。
延伸阅读
Zheng et al. 2023《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》(LLM 评审方法论与偏差分析的奠基工作)。
自测题
- 三层评估各解决什么问题?
答:自动层免费快筛退化;judge 层低成本给开放回答打可比质量分;人工层终审发布并校准前两层。
- 为什么 judge 上线前要先与人工对照校准?
答:judge 有位置/长度/自偏好等系统性偏差,未校准的 judge 分数可能与人的判断系统性背离。
- 私有评测集的三条纪律是什么?
答:按真实场景分布采样、与训练数据去污染、版本冻结改动即升版。
相关知识点
- 数据去污染与评测隔离 核心
- 灾难性遗忘与通用能力保持 进阶
- 回归测试与消融实验 核心
- 基准陷阱与评测诚信 进阶
来源
- Zheng et al. 2023《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》
基于模型知识整理,建议按需核对原文。