1. 基于 LLM-as-Judge 的自动化灰度质量门禁如何设计(阈值、样本量、置信区间),judge 误判如何处理(人工复判、二次评估)
基于 LLM-as-Judge 的自动化灰度质量门禁如何设计(阈值、样本量、置信区间)?judge 误判如何处理(人工复判、二次评估)?
- LLM-as-Judge 门禁的阈值与样本量设计
- 置信区间与显著性判定
- judge 误判的处理(人工复判、二次评估)
LLM-as-Judge 灰度门禁需在灰度期采集样本,用 judge 打分,并统计质量指标。设计要点:样本量要足够(依据指标方差与期望功效计算,如要达到 95% 置信、检测 1% 差异需要对应样本量);用置信区间而非单点值判断(如"新版本胜率 95% CI 下限 > 50%"才放量);阈值分层(质量差则停、中则观察、好则放量)。judge 误判不可避免,处理方式:对 judge 判定的边界样本与异常样本做人工复判(抽样人审);对 judge 自评置信度低的样本做二次评估(换 judge 或人审);定期用标注集校准 judge 的准确率与一致性,评估 judge 与人类的一致性(如 Cohen's Kappa)。
门禁的本质是"用统计方法评估新版本是否优于旧版本"。样本量、置信区间与阈值共同决定结论可靠性;judge 误判通过人工复判与校准兜底,避免门禁被错误判断带偏。