1. HyDE 如何通过生成假答案提升检索召回率,适用场景与局限
HyDE(Hypothetical Document Embeddings)如何通过生成假答案提升检索召回率?其适用场景与局限是什么?
- HyDE 的原理(生成假设文档替代查询检索)
- 适用场景(查询短、词汇鸿沟、生成能力强时有效)
- 局限(生成偏差、成本、领域依赖)
HyDE 的核心思想是"用假设文档代替查询去做向量检索":先用 LLM 根据查询生成一段"假设的答案文档"(可能包含虚构内容,但句式与词汇贴近目标文档风格),再对该假设文档做 Embedding,用它(或它与查询的融合向量)检索向量库。原理上,短查询(如"系统权限如何分配")的向量空间位置远离目标文档(词汇与结构差异大),而假设文档把查询"翻译"成与目标文档同分布的长文本,检索命中率显著提升——本质是用生成能力补偿查询的表示不足。适用场景:查询极短或高度口语化、目标文档为长文(假设文档与长文档同分布)、检索器为纯稠密向量(无词法路兜底)、以及查询含抽象概念时。局限:一是生成偏差——LLM 生成的假设文档可能偏离真实答案主题,检索被带偏(生成质量差时 HyDE 反而不如直接查询);二是成本与延迟——每次检索多一次 LLM 调用 + Embedding;三是领域依赖——假设文档的写作风格需与语料一致,跨领域效果波动大;四是可解释性弱——"用虚构文本检索"让结果难以解释。工程实践:HyDE 与原始查询双路检索融合(HyDE 结果 + 原查询结果 RRF 合并),用评估集验证增益(Recall 提升但准确率不降),对生成质量差或成本敏感场景关闭 HyDE 降级为直接检索。
HyDE 的价值在于"用生成补偿表示":查询向量表示不足时,假设文档提供同分布的长文本表示。答题要讲清原理、适用条件(短查询/长文档/纯稠密)、三类局限(偏差、成本、解释性),并给出"双路融合 + 评估验证"的工程落地。