1. 同一指标在不同工具间定义不一致时,怎样建立内部统一语义和黄金样本
不同 RAG 评估工具对同一指标(如 Faithfulness)的定义可能不一致,如何建立内部统一语义和黄金样本,保证跨工具可比?
- 指标定义的跨工具差异
- 统一语义层
- 黄金样本的锚定作用
不同工具的同一指标名可能指不同计算逻辑(如 Faithfulness 在 A 工具是逐句断言语义蕴含,在 B 工具是整体相关性),直接横向比较会误导。建立统一语义:1) 在自己内部定义一个"指标字典",明确每个指标的精确定义、计算方式、输入输出与判定标准,作为唯一真源;2) 为每个指标建立黄金样本(golden set):人工标注一批"正例/反例",作为该指标"应该给的分数"的锚定基准;3) 用这些黄金样本验证各工具实现是否与内部语义一致,偏差大的工具要么校准要么弃用;4) 跨工具比较时先做"指标对齐校验",只比较语义一致的指标。
指标名相同不代表语义相同。统一语义 + 黄金样本是"校准"各工具的口径,保证评估结论可比、可信。