1. 在 AI 应用中如何评估 Embedding 质量,内在向量指标(MTEB 子集、相似度分布)与外在任务指标(召回率、命中率、答案正确率)的联合解读
在 AI 应用中如何评估 Embedding 质量?内在向量指标(MTEB 子集、相似度分布)与外在任务指标(召回率、命中率、答案正确率)应如何联合解读?
- 内在指标(MTEB、相似度分布)衡量向量空间质量
- 外在指标(Recall@K、命中率、答案正确率)衡量业务效果
- 联合解读避免"内在好但业务差"
内在指标关注向量空间本身:MTEB 子集(检索、分类、聚类等 benchmark)、相似度分布是否合理(正负样本分数可分离、分布不塌缩)。外在指标关注业务结果:Recall@K(正确的 K 条是否被召回)、命中率(答案是否在候选里)、答案正确率(RAG 端到端是否正确)。联合解读:内在指标反映"向量是否区分语义",外在指标反映"是否服务业务"。若内在好但外在差,问题在检索流程(切块、topK、rerank、融合)而非 Embedding;若外在好但内在异常,可能是评测集偏差。以"外在指标为主、内在指标辅助定位"的方式联合评估。
单一指标会误导:内在分数高不代表业务检索好,外在得分低也不一定是 Embedding 问题;联合解读才能定位是"向量质量问题"还是"检索链路问题"。