基准陷阱与评测诚信
前置知识点
一句话定义
基准陷阱指让评测分数与真实价值脱节的系统性偏差——数据泄漏、judge 偏置、只看均值、公开基准过拟合——而评测诚信是把「分数」当「证据」的职业道德底线。
为什么重要
微调团队最常见的自我欺骗是「评测分涨了=模型变好了」。排行榜分数驱动着模型选型与汇报,但公开基准饱和、污染指控频发、judge 可被针对性优化的今天,分数与价值的鸿沟是行业级问题。识别陷阱保护自己不被骗,坚守诚信保护自己不骗人。
前置知识
kp-025 的评估体系;kp-013 的去污染方法。
核心概念
- 基准饱和:公开基准被反复训练/优化后失去区分度,人人 90 分。
- 过拟合评测:针对评测集的分布特性调数据调方法,分高但泛化差。
- judge 偏置:评审模型偏好长答案、偏好自家风格、位置偏差(先出现的答案得分高)。
- 均值遮蔽:平均分掩盖了「某类场景崩了」的局部灾难。
- 刷榜(benchmark gaming):故意把公开基准内容混入训练数据的作弊行为。
原理与机制
陷阱的识别清单:分数提升但盲评无感 → 过拟合评测或 judge 偏置;对公开基准提升巨大 → 首先怀疑污染(跑 kp-013 扫描);某子类分数暴跌被均值掩盖 → 必须看分组分数与最差 10% 样本;换一个 judge 分数结论反转 → judge 不可信,回到人工校准。机制上,公开基准(MMLU 类、Arena 风格)与私有评测的关系是「身份证 vs 体检报告」:公开基准提供跨团队可比性,但正因公开,它注定与训练数据存在说不清的重叠;私有评测才反映你的业务价值。两者不可互替。
伦理维度:对外报告微调效果时,必须声明评测集来源、去污染流程与 judge 校准方式;用公开基准刷分后选择性汇报,性质上属于误导性陈述(与 kp-032 的合规义务同源)。
图示
分数 ─?─► 真实价值
检查: 泄漏扫描(kp-013) / judge校准(kp-025) / 分组分数+最差10% / 盲评交叉
公开基准 = 跨团队可比的身份证; 私有评测 = 反映业务的体检报告直观类比
只看平均分的评测像只看平均气温选衣服——昼夜温差会给你教训;刷公开榜像背题库考驾照,理论满分不代表会开车。
实例或案例
某团队微调后在三个公开中文基准上平均提升 5 个点,宣传「模型显著增强」。内部按 kp-013 扫描发现训练数据与其中一个基准有 7% 重叠(来自开源指令集的搬运);剔除重叠重训后该基准提升归零,另两个基准提升 1-2 个点且盲评无感。事件结论写入团队规范:对外汇报必须附「去污染声明 + 私有评测数据」。
操作步骤
- 报告模板固定四要素:私有评测分数(分组)、公开基准分数、去污染声明、judge 校准说明。
- 每次评测输出看三张图:总分、分组分、最差样本清单。
- 公开基准只作参考坐标,不作验收标准;验收只认私有评测 + 盲评。
- 新 judge 或新基准引入时,先跑 kp-025 的校准流程。
- 团队内公示评测方法,接受质询——评测流程透明本身就是防作弊机制。
排错清单
- 公开基准涨、私有评测不涨:大概率过拟合公开基准分布,检查是否用了基准衍生数据。
- 私有评测连续大幅上涨:先自查评测集是否被训练侧改动(版本冻结纪律),再庆祝。
- judge 更换后结论反转:两套 judge 各自校准人工 50 条,以人工一致率高者为准。
- 子场景分数骤降被均值掩盖:评测报告强制带分组与分位数,不看均值下结论。
常见误区
- 分数 = 价值:分数只是价值的有偏采样,采样偏差不修正,分数就是装饰。
- 我们不会刷榜:无意污染与故意作弊的界限,正是去污染流程存在的意义——不做扫描就没有资格声称干净。
- 均值是默认视角:微调的失败模式几乎总是局部的(某场景崩),均值恰恰看不见局部。
与其他知识点的关系
去污染的技术手段见 kp-013;judge 校准见 kp-025;分组报告与回归机制见 kp-026;对外披露的伦理义务见 kp-032。
延伸阅读
本节不适用:基准批判是行业性讨论(如 Arena 争议、多篇污染分析工作),无单篇定论文献,建议保持对评测方法论讨论的跟踪。
自测题
- 公开基准大涨时,第一个动作是什么?
答:跑去污染扫描(kp-013),排除训练数据与基准重叠,再谈提升。
- 为什么「只看均值」在微调评测里特别危险?
答:微调的退化常是局部的(某子场景崩塌),均值会掩盖局部灾难,必须看分组分数与最差样本。
- 对外汇报微调效果的诚信底线是什么?
答:声明评测集来源与去污染流程、judge 校准方式,私有评测与公开基准并列呈现,不做选择性汇报。
相关知识点
- 数据配比、去重与课程设计 核心
- 回归测试与消融实验 核心
- 伦理、合规与许可 核心