1. 多基准汇总排名如何避免被覆盖度差异和单次实验运气放大,而采用区间和显著性
在多基准评测中,当不同 Agent 在不同评测集上的覆盖度(样本数)差异较大、且单次实验存在随机波动时,如何用区间估计和显著性检验而非简单看平均分来汇总排名,避免被噪声放大误导?
- 评分扰动与置信区间(置信区间、标准误)的构造
- 覆盖率归一化(per-sample 平均 vs 直接平均)与加权
- 两两比较的显著性检验,避免把"看起来更高"误判为"显著更强"
不要直接对每个基准算出的平均分再取平均并据此排序,因为覆盖度不同的基准对不同模型不公平,且单次运行带随机性。工程做法是:先对每个基准按样本级得分计算均值与标准误,构造置信区间;综合排名时用覆盖度加权(样本越多权重越大)或统一到 per-sample 平均的尺度;对任意两个模型做两两显著性检验(如配对 t 检验或 bootstrap 检验),只有当差异在给定显著性水平下成立时,才把排名差异视为可信;否则将两者归入"无显著差异"区间,展示为一组而非绝对顺序。最终汇报时给出每个模型的得分区间与彼此是否有显著差异,而不是单一排名数字。
单次实验的运气(seed、采样温度、网络抖动)会放大表面差异;区间与显著性把"统计噪声"与"真实能力差异"分开,避免为了几个百分点差异而做错误的选型或发布决策。这也是回归基线里"只有显著退化才阻断"的同一套逻辑。