1. 如何同时定义任务成功、正确性、忠实度、相关性、格式、安全、延迟和成本指标
一个真实的 LLM 应用往往同时有多个质量标准,如何在一个评估体系里同时定义任务成功、正确性、忠实度、相关性、格式、安全、延迟和成本这些指标,并让它们能协同工作而不互相打架?
- 指标分层与维度划分的能力
- 硬指标与软指标、质量指标与系统指标的分工
- 指标之间权衡关系的理解
把这些指标分成"质量维度"与"系统维度"两类,并建立指标字典。质量维度包括:任务成功(用户目标是否达成,通常是业务层的漏斗指标)、正确性(事实是否准确)、忠实度(回答是否忠于上下文/检索来源,不编造)、相关性(回答是否贴合问题)、格式(是否符合 JSON/Schema/排版要求)、安全(是否有有害内容、越权、幻觉风险)。系统维度包括延迟(TTFT、TPOT、P95)与成本(Token、缓存命中率、每请求成本)。每个指标都要有明确的定义、度量方式、评分量纲(0-1、分类、布尔)、数据来源和最低门槛。最后用"指标树"组织:顶层是任务成功,下层是支撑它的质量与系统指标,避免各指标各自为政。
关键不是"堆指标",而是定义每个指标"在什么场景下、用什么数据、达到多少算好"。硬指标(任务成功、格式合法)决定能否上线,软指标(语气、相关性)决定体验。延迟与成本是约束条件,不能与质量并列竞争,而是作为门槛参与取舍。