1. LLM-as-Judge 作为 Agent 输出校验器时存在哪些偏差、成本与校准问题,如何防止校验器与执行器同源偏好
LLM-as-Judge 作为 Agent 输出的校验器时,存在哪些偏差(bias)、成本与校准问题?如何防止校验器与执行器(生成模型)同源带来的偏好?
- LLM-as-Judge 的偏差类型:位置偏差、长度偏差、自我偏好、谄媚偏差
- 成本问题:每轮校验的额外调用
- 校准问题:评判置信度不可靠
LLM-as-Judge 常见偏差包括:①位置偏差——更偏好出现在前面的答案;②长度偏差——答案越长越容易得分;③自我偏好(self-preference)——同源模型对自己生成的文本打分偏高;④谄媚/风格偏差——偏好听起来更自信或更符合人设的答案;⑤格式偏差。成本问题是每次校验都多一次 LLM 调用,叠加在已有成本上,需控制评判频率与模型大小。校准问题是 Judge 的置信度与实际正确率偏差大,不能直接用其分数当概率。防止同源偏好的关键:让执行器与校验器用不同模型/不同 prompt,避免"自己评自己";采用盲评(隐藏答案来源)、随机化候选顺序、多次评分取平均、明确 rubrics 评分标准来稳定判断。必要时用确定性校验或人工抽检兜底。
LLM-as-Judge 灵活但不可靠,其偏差源于"模型的主观性"。工程上通过"去同源、盲评、rubrics、多次采样"来缓解,并把 Judge 只用于"语义层"判断,规则与工具校验放在前面,既省成本又更可靠。