1. RAGAS/TruLens 的检索与生成指标如何与业务指标联动,评估集构建与阈值设定如何避免分数虚高?
请说明 RAGAS、TruLens 等评估框架的检索与生成指标(Faithfulness、Relevance、Recall 等)如何与真实业务指标(续费率、转化率、客服解决率)联动,以及评估集构建与阈值设定如何避免分数虚高?
- 是否理解指标不是越高越好,而是要与业务目标对齐
- 是否掌握评估集构建中避免偏差(如样本过简单)的方法
- 是否了解阈值设定如何避免"虚高"的陷阱
联动思路是建立"指标分层":底层是技术指标(Faithfulness、Relevance、Recall),中层是任务指标(任务成功率、首答正确率),顶层是业务指标(点击率、转化、客诉下降)。工程上先用小样本人工标注建立技术指标与业务指标的映射关系,确认技术指标提升确实带来业务改善后再规模化。评估集构建要覆盖真实分布:难例、边界、稀有但高价值场景,而非只挑"模型答得好的"样本。阈值设定用"失败驱动"而非"分数驱动"——先定义什么算不可接受的业务结果,再反推技术指标阈值。避免虚高的方法:用人工校准集(Gold Set)定期校准 LLM-as-Judge,用 Pairwise 强弱排序替代绝对分数,并对评估集做数据污染检查。
分数虚高通常源于:评估集过简单、Judge 与模型同源产生偏差、阈值拍脑袋。关键是让评估指标可追溯、可解释,并与业务闭环挂钩,而不是纸面分数漂亮。