多模态 RAG 与高级检索技术

共 20 题
📑 题目列表 20 题
#
★★★

1. HyDE 如何通过生成假答案提升检索召回率,适用场景与局限

HyDE(Hypothetical Document Embeddings)如何通过生成假答案提升检索召回率?其适用场景与局限是什么?

  • HyDE 的原理(生成假设文档替代查询检索)
  • 适用场景(查询短、词汇鸿沟、生成能力强时有效)
  • 局限(生成偏差、成本、领域依赖)

HyDE 的核心思想是"用假设文档代替查询去做向量检索":先用 LLM 根据查询生成一段"假设的答案文档"(可能包含虚构内容,但句式与词汇贴近目标文档风格),再对该假设文档做 Embedding,用它(或它与查询的融合向量)检索向量库。原理上,短查询(如"系统权限如何分配")的向量空间位置远离目标文档(词汇与结构差异大),而假设文档把查询"翻译"成与目标文档同分布的长文本,检索命中率显著提升——本质是用生成能力补偿查询的表示不足。适用场景:查询极短或高度口语化、目标文档为长文(假设文档与长文档同分布)、检索器为纯稠密向量(无词法路兜底)、以及查询含抽象概念时。局限:一是生成偏差——LLM 生成的假设文档可能偏离真实答案主题,检索被带偏(生成质量差时 HyDE 反而不如直接查询);二是成本与延迟——每次检索多一次 LLM 调用 + Embedding;三是领域依赖——假设文档的写作风格需与语料一致,跨领域效果波动大;四是可解释性弱——"用虚构文本检索"让结果难以解释。工程实践:HyDE 与原始查询双路检索融合(HyDE 结果 + 原查询结果 RRF 合并),用评估集验证增益(Recall 提升但准确率不降),对生成质量差或成本敏感场景关闭 HyDE 降级为直接检索。

HyDE 的价值在于"用生成补偿表示":查询向量表示不足时,假设文档提供同分布的长文本表示。答题要讲清原理、适用条件(短查询/长文档/纯稠密)、三类局限(偏差、成本、解释性),并给出"双路融合 + 评估验证"的工程落地。

#
★★★

2. Query Expansion 如何通过 LLM 生成多个子查询提升召回

Query Expansion(多查询扩展)如何通过 LLM 生成多个子查询提升召回?其实现与代价如何控制?

  • 多查询扩展的原理(从不同角度/同义词/子主题生成子查询)
  • 子查询检索结果的融合(RRF、去重)
  • 成本与延迟控制(并行、数量限制、缓存)

多查询扩展(Multi-Query Retrieval,MQR)的思路:原始查询信息量不足时,让 LLM 从多个角度生成若干子查询——同义改写("如何申请退款"→"退货退款的流程")、子主题拆解("RAG 优化"→"分块优化""重排优化""查询改写")、补充限定(把模糊查询具体化),每个子查询独立检索,结果融合后召回覆盖更全。融合方式:多路子查询的结果用 RRF 融合(避免子查询间分数不可比)、对重复文档去重;子查询数量通常 3-5 个(过少收益有限,过多引入噪声与成本)。提升机制:召回多样性——不同子查询命中不同文档子集,合并后 Recall 提升;对长尾查询尤其有效(单路检索覆盖面窄)。代价控制:子查询并行执行(延迟约为单路 + 改写时间,而非乘子查询数);子查询生成用轻量模型或限制输出长度;检索结果缓存(相同子查询命中缓存);动态触发——对"低置信/低召回"查询才启用扩展,简单查询不扩展;扩展后仍用重排收敛,防止噪声子查询把不相关文档带入 top 结果。评估:对比"单查询 vs 多查询扩展"的 Recall@K 与 nDCG 增益,若增益小于成本(延迟与 token),则收窄触发范围;监控扩展子查询的"有效贡献率"(有多少子查询的结果最终进入 top 答案)。

MQR 的本质是"用生成增加检索视角":单查询是单视角,扩展是多元视角并融合。答题要点是"生成策略(改写/拆解/限定)→并行检索 + RRF 融合 → 成本控制(并行、限量、缓存、按需触发)→ 增益评估"。

#
★★★

3. Re-ranking 在召回-精排两阶段中如何接入

Re-ranking(重排)在"召回-精排"两阶段检索中如何接入?接入位置与流程是什么?

  • 两阶段检索架构(粗召回 + 精重排)的分工
  • 重排的接入位置(召回后、组装前)与候选规模
  • 重排打分与最终排序的关系

重排接入在"粗召回之后、上下文组装之前",形成两阶段漏斗:第一阶段粗召回(向量检索 + BM25 等廉价信号)从全库召回 top-50~200 候选,目标是高召回率、低成本;第二阶段重排(交叉编码器等精排模型)对候选逐对打分,输出 top-3~8 进入生成上下文,目标是高精度。接入要点:一是候选规模选择——重排成本与候选数线性增长,按"召回率-重排收益曲线"选候选数(如 top-100 重排比 top-200 质量几乎不降时取 100);二是打分与排序——重排分替代召回分成为最终排序依据(重排分与召回分需统一,避免混用排序);三是过滤时机——权限等硬过滤在召回阶段完成,重排阶段不再重复过滤;四是多样性——重排后可能集中于单一文档,需在重排输出上做 MMR 或限流,避免上下文信息冗余;五是工程实现——重排批量处理(候选对合并成 batch 一次前向)、结果缓存、重排失败时回退召回排序(兜底);六是评估——对比"仅召回排序"与"召回+重排"的 nDCG 提升,确认重排的增量价值,并监控重排耗时在端到端延迟中的占比。重排模型选择:交叉编码器精度最高但成本高,可用蒸馏后的轻量模型;候选少或实时性要求高时,也可用向量路精排(如用更精细的相似度策略)替代。

两阶段检索是"成本与精度"的经典分解:召回负责宽、重排负责准。答题要讲清接入位置(召回后组装前)、候选规模决策(收益曲线)、打分替代关系、多样性与兜底,并落到重排增量价值的评估验证。

#
★★★

4. 图文混合 RAG 的检索链路,表格/图片如何解析、向量化与重排?

图文混合 RAG 的检索链路中,表格与图片如何解析、向量化与重排?

  • 表格与图片的解析(结构识别、OCR、caption)
  • 多模态向量化(文本化向量、视觉向量)
  • 跨模态重排(统一打分、模态感知排序)

图文混合 RAG 的链路是"解析→文本化→向量化→混合检索→跨模态重排"。解析阶段:表格用版面分析 + 表格结构识别还原行列结构,转成 Markdown/HTML 或"表头+行键值"线性文本;图片分两类——带文字的图(截图、含文字的图表)先 OCR 提取文本,无文字或语义丰富的图(趋势图、示意图)用视觉语言模型生成 caption 与结构化描述(数据趋势、关键指标、图示关系)。向量化策略:表格与图片的文本化产物进入文本 Embedding(保证与文本查询可比);对依赖视觉细节的图片(配色、布局、形状),用多模态 Embedding 模型编码图像本身,与文本向量统一空间——两类向量并存(文本化向量 + 视觉向量),检索时按模态类型匹配。混合检索:查询先用文本向量召回文本块与"文本化的图表证据",对视觉查询("哪张图展示了增长率")用多模态向量召回图像;两路结果按模态归一化后融合(同模态内排序、跨模态分数归一化)。重排:候选进入跨模态重排——用图文多模态重排模型对"查询文本 + 证据(图或文)"打分,解决跨模态相关性判断;重排后按证据质量(图:caption 与查询相关度 + OCR 文本命中;表:行命中与列覆盖)输出 top 证据,保留页码与区域坐标供引用。整体上"能文本化就文本化、需要视觉就向量化、重排必须跨模态"是核心原则。

图文混合检索的关键是"两条向量路径 + 统一排序":文本化路径保证可检索性,视觉向量路径保留视觉语义,跨模态重排解决"图文谁更相关"的判断。答题按解析→向量化→融合→跨模态重排展开,强调模态归一化与坐标保留。

#
★★

5. 表格 RAG 如何处理结构化数据的语义检索

表格 RAG 如何处理结构化数据的语义检索?

  • 表格的文本化表示(行列线性化、表结构保留)
  • 语义检索与结构化过滤的结合(列级、行级)
  • 表格问答的常见失败与对策

表格语义检索的核心是"把二维结构变成可检索的文本,同时保留结构语义"。文本化方案:一是行级线性化——每行转成"表头:值; 表头:值"的键值文本(如"产品:A100; 价格:1200; 库存:50"),逐行成块,适合"按条件查行"的查询;二是整表/分区表示——小表整表转 Markdown,大表按列簇或语义分区(如"价格信息""库存信息")分块,适合"对比与总结"类查询;三是表头增强——把表头信息(列名、单位、表标题)拼入每块,防止行块脱离表头语义。语义检索与结构化过滤结合:条件型查询("价格低于 1000 的产品")先用查询分析抽取结构化条件(列名、比较符、值),走元数据/标量过滤 + 行级检索双路(过滤圈定行范围,向量检索处理语义描述部分),最后行级重排;纯语义查询("哪些产品适合户外用")直接向量检索行块。常见失败与对策:行块上下文缺失(只有行没有表头语义)——用"表头前缀 + 行"拼接解决;大表被整体向量化导致语义稀释——分区/分块;表格数值比较类查询向量检索无能为力——走结构化执行(SQL/规则)而非向量;跨行聚合查询("平均价格")——转为表格工具调用(生成 SQL)而非纯检索。评估上构造"行命中率""列覆盖"等表格特有指标。

表格 RAG 的难点在于"结构语义":把表拍平成文本会丢结构,直接跑 SQL 又丢语义。答题的核心是"分层处理"——条件型查询走结构化过滤与执行、语义型查询走向量检索、聚合查询走表格工具,并给出文本化表示的具体方案。

#
★★

6. 跨模态检索的评估集如何构造

跨模态检索的评估集如何构造?标注与指标设计有哪些要点?

  • 跨模态评估集的结构(查询、模态、相关性标注)
  • 跨模态相关性标注的方法(成对标注、互检样本)
  • 跨模态特有的评估指标与偏差控制

跨模态评估集构造的核心是"让标注反映真实的跨模态相关性"。结构设计:查询集包含单模态查询(文查文、图查图)与跨模态查询(文查图、图查文),按业务比例混合;候选池包含各模态的证据(文档块、图片、表格、视频片段);每条查询标注"相关证据集"(可以跨模态多选)。相关性标注方法:成对标注——人工判断"查询与证据是否相关"(三分类:相关/部分相关/不相关),跨模态对(文-图对)由标注者看图判断语义是否对应;互检样本——构造"同一事实的图文双形态"样本,验证跨模态命中(图描述的事件与文本描述的是同一事实);对标注一致性做 Kappa 检验,跨模态标注的主观性高,需多标注者取多数。指标设计:跨模态场景沿用 Recall@K、MRR、nDCG,但需按"查询-证据模态对"分层报告(文查文的 Recall、文查图的 Recall),防止整体指标掩盖跨模态短板;新增"模态匹配率"(返回证据的模态与查询意图匹配程度)与"图文互检率"(互检样本的命中率)。偏差控制:模态数量不平衡(文本证据远多于图片)会压低图像召回指标,需按模态均衡抽样或报告分层指标;标注偏见(标注者偏好文本证据)通过强制"图也要标注"与随机次序缓解;评估集要随业务数据更新,防止模态分布漂移。

跨模态评估的难点是"相关性的跨模态判断"与"模态分布偏差":文图相关的标注比纯文本更难一致。答题按"查询-证据模态对结构→成对标注与互检样本→分层指标与模态匹配率→模态均衡与偏差控制"展开。

#
★★

7. Late Interaction(ColBERT 类)与稠密向量在文档级检索中的精度-成本对比?

Late Interaction(ColBERT 类)与稠密向量在文档级检索中的精度与成本如何对比?

  • Late Interaction 的原理(token 级向量交互打分)
  • 与单向量稠密检索的精度差异及原因
  • 成本差异(索引、查询延迟、存储)与工程适配

Late Interaction(ColBERT)把查询与文档都编码为 token 级向量序列,打分时做"token 级交互"(每个查询 token 与文档所有 token 计算最大相似度后聚合),而单向量稠密检索把整段文本压缩成一个向量(平均池化),两者精度差异的根源是"信息压缩粒度":单向量把细粒度信息(多义、局部匹配)平均化,语义相似但局部关键词不同时区分度下降;ColBERT 保留 token 级粒度,对"局部精确匹配 + 整体语义相关"(如查询含具体实体、短语)的文档明显更准,在文档级检索基准上 ColBERT 类通常优于同规模单向量。成本对比:索引——ColBERT 为每个 token 存向量(每文档向量数=token 数),索引规模是单向量的几十倍,存储与内存开销大;查询——ColBERT 需查询 token 与候选文档 token 的全交互(可用倒排式两阶段加速:先用 token 级倒排或单向量粗筛候选,再对候选做 late interaction 精算),延迟高于单向量但低于全交叉编码器重排;训练与推理——ColBERT 模型较小但前向输出序列长。工程适配:混合架构常见——粗召回用单向量(快、省),精排阶段用 late interaction(准、贵),替代部分交叉编码器重排(ColBERT 可预计算文档向量,延迟优于每查询全量编码的交叉编码器);压缩变体(ColBERTv2 残差量化)大幅降低索引体积;内存敏感场景用量化 + 剪枝。选择依据:查询含实体/短语匹配占比高、精度要求高且能承担索引成本时选 ColBERT 类;存储预算紧或延迟极敏感时用单向量 + 交叉编码器精排。

ColBERT 与单向量的对比本质是"token 级交互精度 vs 向量级压缩成本":交互越细越准但越贵。答题按"机制差异→精度来源(局部匹配保留)→成本三要素(索引/查询/存储)→混合架构落位(粗召回单向量 + 精排 ColBERT/交叉编码器)"展开。

#
★★

8. GraphRAG 与向量 RAG 的适用边界,多跳关系查询 vs 语义相似检索?

GraphRAG 与向量 RAG 的适用边界是什么?多跳关系查询与语义相似检索分别适合哪种?

  • 向量 RAG 的适用边界(语义相似、段落级答案)
  • GraphRAG 的适用边界(多跳关系、全局主题、可解释路径)
  • 混合使用的决策与架构

两种架构解决不同的问题类型。向量 RAG 适用:语义相似检索——问题答案直接落在某段文本上("退款流程"、"配置参数"),"query 与文档语义相似"即可命中;实现简单、更新快、对非结构化文本天然友好。其失效场景:多跳关系——"A 公司的供应商的客户有哪些",关系分布在多文档、向量相似度无法沿关系路径推理;全局聚合——"各产品线的共同风险"无单块文本可命中;精确路径——"哪些员工同时是 X 和 Y 项目的成员"需要结构遍历。GraphRAG 适用:多跳关系查询——沿实体-关系图遍历路径,天然支持"谁-关系-谁"的链式推理;全局主题问题——社区摘要聚合子图,回答"整体上是什么格局";可解释性——答案可展示图谱路径(A→供应商→B→客户→C)。其代价:实体抽取成本(LLM 推理与文档量成正比)、构建与维护(消歧、更新)、查询复杂度。边界判断:按查询分布统计——关系型/全局型占比高则值得引入;混合架构是主流——查询路由(语义问题走向量、关系问题走图谱、跨领域问题走 Agentic 多步)分流,两路结果可融合(关系证据 + 段落证据共同支撑答案);对中小知识库(实体关系简单)直接向量 RAG 足够,不必为"炫技"引入图谱。

本题考察"按问题类型选架构"的决策力:向量 RAG 是"找段落",GraphRAG 是"找路径与整体"。答题给出两边的适用边界与失效场景、引入图谱的成本判断(查询分布 + 数据规模),以及"路由分流 + 证据融合"的混合架构。

#
★★

9. 多模态文档的解析,PDF/表格/图片的 OCR 与版面理解?

多模态文档的解析:PDF、表格、图片的 OCR 与版面理解如何处理?

  • 版面理解(layout understanding)的内容(区域检测、阅读顺序)
  • OCR 的适用与局限(扫描件、复杂版面、手写)
  • 表格与图片的专项解析(结构识别、caption 生成)

多模态解析的目标是"把版面还原为有序、可检索的结构化内容"。版面理解:用版面分析模型检测页面的区域(正文、标题、页眉页脚、图片、表格、公式),确定阅读顺序(多栏、图文混排的先后关系),输出每个区域的类型与边界框;版面理解是后续解析的基础——OCR 只认字,版面理解才知道字属于哪部分。OCR 处理:扫描件(无文本层 PDF)必须 OCR,选型关注准确率(印刷体高、手写与低质量扫描低)、多语种支持、以及"OCR + 版面"一体化模型(如 PaddleOCR、Tesseract、云 OCR);OCR 结果带置信度,低置信区域标记待人工复核;对清晰数字文档(有文本层 PDF)无需 OCR 可直接提取文本层。表格专项:表格结构识别(行、列、单元格、跨行跨列合并)还原为 Markdown/HTML,或按"表头+行"结构存储;复杂表格(嵌套表头、合并单元格)需专用模型,还原质量用"表格结构准确率"评估。图片专项:自然图片/图表生成 caption 与关键信息描述(图表的数据要点、趋势);同一文档中图片与引用它的正文建立关联(figure 编号 ↔ 正文引用),检索时可整体返回"正文+图"。工程注意:解析流水线要保留页码、区域坐标与来源层(原文→解析块→文本化块)映射;解析失败率(OCR 低置信、版面识别失败)监控并进入人工修复队列。

多模态解析是"版面理解 + OCR + 结构识别"的组合拳:只做 OCR 会丢版面结构(哪段是标题、哪个是表格)。答题按"版面理解(区域+阅读顺序)→OCR(何时用、置信度)→表格结构识别→图片 caption 与图文关联"分层展开,并强调坐标与溯源保留。

#
★★

10. 多跳/迭代检索(iterate-retrieve-read、Agentic RAG)在复杂问题拆解中的工程价值,以及检索步数与成本的控制?

多跳/迭代检索(iterate-retrieve-read、Agentic RAG)在复杂问题拆解中的工程价值是什么?检索步数与成本如何控制?

  • 迭代检索的工程价值(问题拆解、证据累积、可解释性)
  • 检索步数与成本的失控风险
  • 控制手段(预算、收敛、降级)

工程价值有三:一是问题拆解——复杂问题被分解为依赖链上的子问题,每跳解决一步(如"产品 X 在地区 Y 的销量"先查 X 的产品线、再查区域数据),比一次性宽泛检索精准;二是证据累积与校正——每跳基于上一跳的答案精化查询,逐步逼近证据(iterate 检索不到→改写→再检索),提高最终证据质量;三是可解释性——每跳的检索与结论形成推理链,答案可回溯(用户可见"查了什么、得到什么")。风险与成本:每跳一次 LLM 调用(改写/中间答案)+ 一次检索,跳数失控则成本倍增、延迟恶化、错误累积。控制手段:跳数上限(如 3-4 跳)+ 收敛检测(证据不再变化即停)+ 每跳 Token 预算(中间答案限定长度、检索结果裁剪 top-k)+ 终止条件显式化(证据充分/达到上限/无法推进);成本控制再叠加:跳间信息压缩(只传结构化事实不传全文)、子查询并行(同跳内并行检索)、检索与中间推理用小模型(大模型只做最终生成);降级路径——达到上限仍无答案时,用已有证据回答并标注不确定性,或转"无法回答"+ 人工。监控指标:平均跳数、单跳成本、终止原因分布(收敛占比/达上限占比)、跳间信息传递质量;"达上限占比"高说明拆解或检索效率差,需优化查询改写与每跳检索精度而非无脑加跳数。

迭代检索的价值与风险同源:多跳带来拆解能力与证据链,也带来成本与错误累积。答题按"价值三要点(拆解/校正/可解释)→失控风险→控制手段(上限、收敛、预算、降级)→运营指标"展开,强调"控制比跳数更重要"。

#
★★

11. 检索质量评估指标,Recall@k、MRR 与 nDCG 分别度量什么,在多模态与跨模态场景如何构造相关性标注集?

检索质量评估指标 Recall@K、MRR 与 nDCG 分别度量什么?多模态与跨模态场景如何构造相关性标注集?

  • 三个指标的定义与度量对象(覆盖率、首个相关位置、排序质量)
  • 指标选择与任务类型的匹配
  • 多模态相关性标注集的构造要点

三个指标的度量对象不同。Recall@K:前 K 个结果中相关文档占全部相关文档的比例,度量"召回覆盖率"——回答"该找的是否都在结果里",适合关注"不能漏"的场景(RAG 证据召回);不惩罚排序(相关文档在位置 1 还是 K 都一样)。MRR(Mean Reciprocal Rank):第一个相关结果位置的倒数均值,度量"第一个正确结果是否靠前",适合"用户只需一个正确答案"的任务(单轮问答、查号);对后续相关结果不敏感。nDCG:按位置加权(越靠前增益越大)计算相关度累积并归一化,度量"整体排序质量",适合"结果列表整体供用户浏览"的场景(多证据综合、搜索列表);需要分级相关性(0/1 或 0-2 相关度)。选择:RAG 证据召回主看 Recall@K(配合 nDCG 看排序),首答位置敏感任务加看 MRR。多模态标注集构造:查询集覆盖各模态类型(文查文、文查图、图查文、混合查询);候选集为跨模态证据池(块、图、表、视频帧);标注用分级相关(不相关/部分相关/相关)并区分模态匹配维度;跨模态对标注(文-图)需人工看图判断语义对应,用双人标注 + Kappa 一致性校验;构造"互检对"(同一事实的图文形态)验证跨模态命中;按"查询模态 × 证据模态"分层计算指标,避免模态不平衡掩盖短板。标注工具上支持图片/表格预览,标注规范给出跨模态相关性的判定示例(图是文本的插图 vs 图是独立信息)。

指标选错会误导优化方向:MRR 高的系统可能漏证据(Recall 低)。答题先精确区分三指标(覆盖/首答/排序),再给跨模态标注集的结构(模态对分层、分级标注、互检对、一致性校验)。

#
★★

12. 混合检索(稠密 + 稀疏)的融合策略,BM25 与稠密向量的分数归一化与加权融合(RRF、线性加权),在长尾与冷启动场景的互补性?

混合检索(稠密 + 稀疏)的融合策略是什么?BM25 与稠密向量的分数归一化与加权融合(RRF、线性加权)如何选择?长尾与冷启动场景的互补性如何体现?

  • 分数归一化方法(min-max、z-score、platt 缩放)与适用条件
  • RRF 与线性加权的选择(分数可比性、信息利用)
  • 长尾与冷启动场景的互补机制

融合前必须解决"两路分数不可比":BM25 是无界统计分数(受文档长度、词频影响),余弦相似度是有界距离,直接相加权重无意义。归一化方法:min-max(简单但对离群敏感)、z-score(均值方差标准化,需统计分布)、platt 缩放(用标注数据学分数到概率的映射,最稳但需数据);归一化后线性加权(w1×norm_bm25 + w2×cos_sim),权重由评估集调优。RRF 融合:不依赖分数归一化,对两路排名做 1/(k+rank) 融合,鲁棒(对分数尺度与离群不敏感)、实现简单,是"分数不可比或未归一化"时的首选;缺点是丢弃分数强度(第一名与第十名在 RRF 中差距固定)。选择原则:有标注数据且需精细调优用线性加权(可控性强、可解释权重),冷启动/快速上线用 RRF(无需标注、鲁棒),两者都可上线后继续 A/B 优化。互补性:长尾查询(低频词、少见表达)——向量路靠语义泛化可能召回同义内容,但精确词项命中少;BM25 对长尾词(DF 低)赋予高 IDF 权重,精确命中即高分,两路互补提升长尾召回;冷启动——新库语料少、Embedding 泛化不稳(向量空间未校准),BM25 不依赖训练分布、词法匹配稳定,作为冷启动的主信号;而语义查询又依赖向量路,混合在冷启动期提供"词法保底 + 语义探索"的双保险。工程上融合后再重排收敛,避免两路噪声同时进入上下文。

混合融合的技术要点是"先归一化再融合"与"按数据条件选融合方式":RRF 鲁棒零成本、线性加权精细有代价。答题覆盖归一化三法、两融合方式的取舍,以及长尾(IDF 高权重 vs 语义泛化)与冷启动(词法稳定 vs 分布未校准)的互补机制。

#
★★

13. 重排(Re-ranking)的工程落地,交叉编码器重排的延迟与成本控制、候选集大小选择,与精排分数如何校准?

重排(Re-ranking)的工程落地:交叉编码器重排的延迟与成本如何控制?候选集大小如何选择?精排分数如何校准?

  • 交叉编码器重排的延迟成本构成(每对编码、batch)
  • 候选集大小的选择(收益曲线、预算)
  • 分数校准(到概率、阈值、与下游融合)

交叉编码器重排的成本 = 候选对数量 × 单对编码成本:每对 (query, doc) 需要拼接后一次前向,候选 100 对即 100 次前向(可 batch 化但总计算量不变)。延迟与成本控制:一是候选集压缩——向量/BM25 粗召回先压缩到 top-50~100(用召回收益曲线决定:50 到 100 的 Recall 增益小于阈值即取 50);二是模型轻量化——用蒸馏后的重排模型(精度损失 <1% 换取数倍速度)、量化(int8);三是 batch 优化——同 query 的候选对合并成单 batch 前向,避免逐对调用;四是缓存——高频 query 的重排结果缓存;五是异步与流水——重排与首屏响应解耦(先给粗结果,重排后替换)或按需重排(简单查询跳过重排)。候选集选择:以"候选数 vs nDCG 收益曲线"决定,取"边际收益变缓"的点;按查询类型差异化——精确查询候选可少(前 20 足够),语义模糊查询候选需多(前 100);候选数受上下文预算约束(重排输出 top-k 直接进上下文)。分数校准:重排分是模型 logit,不同查询间不可直接比——用温度缩放/platt 校准映射到 [0,1] 概率或校准分数,用于三个目的:阈值判定(低于阈值视为无可靠证据→拒答)、跨查询比较(A 查询的 top-1 与 B 查询的 top-1 可比)、与后续融合(重排分作为最终排序唯一依据或与新鲜度等信号加权);校准需要带标注的数据(相关/不相关),上线后监控重排分分布漂移(分数普遍升高可能模型退化或查询分布变化)。

重排落地是"成本-质量"工程:交叉编码器最准也最贵。答题按"成本构成→控制手段(压缩/轻量/batch/缓存/异步)→候选集收益曲线→分数校准三用途"展开,体现工程闭环。

#
★★

14. 检索结果的增量更新,文档新增/删除/修订后,向量索引与缓存如何增量更新,陈旧向量如何识别与剔除?

检索结果的增量更新:文档新增、删除、修订后,向量索引与缓存如何增量更新?陈旧向量如何识别与剔除?

  • 增删改事件的索引增量更新(upsert、删除墓碑、版本覆盖)
  • 检索缓存与重排缓存的失效策略
  • 陈旧向量的识别(版本比对、指纹)与剔除

增量更新的目标是"事件到达后,检索结果尽快反映新状态"。新增:新文档分块、Embedding 后 upsert 写入索引,增量构建(HNSW 支持增量插入;IVF 需周期性重训聚类,期间新向量可进"新段"查询时合并);更新:用 doc_id 幂等覆盖(旧向量删除 + 新向量写入),文档级版本号递增;删除:打墓碑(tombstone)或物理删除,检索过滤墓碑;向量库的段(segment)机制——写入进新段、查询跨段合并、后台段合并清理墓碑数据。缓存失效:检索结果缓存与重排缓存以"文档集指纹"或版本号为键(缓存键含索引版本),文档变更时版本号变化即整体失效或按 doc_id 精准失效;LLM 响应缓存同理(答案可能引用被改文档,需按文档版本校验);失效策略权衡:整体失效简单但有缓存击穿风险,精准失效需维护"doc_id → 相关缓存条目"映射。陈旧向量识别:用元数据比对(索引记录的最新版本 vs 源系统版本,不一致即陈旧)、内容指纹(内容哈希变化检测)、时间戳水位(未更新的超期文档);识别出的陈旧向量先降权/过滤(不再进入候选),后台批量重算或剔除;重建时校验 doc 数与墓碑集一致。监控:陈旧文档占比、缓存命中率、增删改到检索可见的延迟(SLA 指标),并配"更新风暴"保护(批量更新限流)。

增量更新是"事件→索引→缓存"的一致性工程:索引靠 upsert+墓碑+版本,缓存靠版本化键失效,陈旧识别靠元数据/指纹比对。答题按"三类变更的索引操作→缓存失效策略→陈旧识别与剔除→监控 SLA"展开。

#

15. 多模态 RAG 的评估,检索模态混合时,图文相关性如何统一打分?

多模态 RAG 的评估:检索模态混合时,图文相关性如何统一打分?

  • 跨模态相关性的判定(语义对应、事实一致)
  • 统一打分的实现(多模态模型、归一化、分级)
  • 模态混合评估的指标与偏差控制

统一打分要解决"图文如何判相关":相关性定义分两级——语义对应(图的 caption/内容与查询主题一致)与事实一致(图呈现的数据/事件与查询要求的证据一致,如"2024 年销量柱状图")。实现方式:一是多模态相关性模型——用图文匹配模型(如 CLIP 类或专用 VQA/图文匹配模型)对"查询文本-图像"打分,把图像相关性纳入统一分数;二是桥接打分——图像先经 caption/OCR 转文本,文本相关性模型统一打分(简单但丢失视觉细节);三是分级标注 + 模型校准——标注分级相关性(不相关/部分相关/相关)训练或校准打分模型,输出统一相关性分数。工程上把"文本-文本相关性分"与"文本-图像相关性分"归一化到同一尺度(各模态内 z-score 或经校准映射概率),再按业务权重合成(如文本证据权重 0.7、图像 0.3)或经多模态重排统一排序。评估注意:指标按"查询类型 × 证据模态"分层报告(文查文 nDCG、文查图 nDCG),防止图文混报掩盖单模态短板;构造"图文等价证据"样本(同一事实既有文本又有图),评估系统能否把两种形态都视为相关;对"图是装饰还是信息"的歧义样本单独标注(装饰图不应算相关证据);标注一致性校验(跨模态主观性高,Kappa 检验);监控模态召回均衡(图证据召回率是否远低于文本)。

图文统一打分的本质是"把跨模态相关性映射到同一尺度":语义对应 + 事实一致两级判定,配合归一化与校准。答题按"相关性定义→打分实现(多模态模型/桥接/校准)→归一化合成→分层指标与偏差控制"展开。

#

16. 图文联合检索如何用跨模态 Embedding(如 CLIP 类模型)实现,文本与图像统一向量空间的工程代价与局限如何评估

图文联合检索如何用跨模态 Embedding(如 CLIP 类模型)实现?文本与图像统一向量空间的工程代价与局限如何评估?

  • CLIP 类跨模态 Embedding 的原理(图文对比学习对齐)
  • 统一向量空间的工程实现(双塔编码、索引融合)
  • 代价与局限(领域适配、细粒度、文本侧能力损失)

实现方式:CLIP 类模型用对比学习把图文对在共享空间中拉近,推理时文本编码器与图像编码器分别输出向量,同空间可比——检索时文本查询向量与图像向量直接算相似度即可(也可支持图查文)。工程实现:图像侧——文档中的图片经图像编码器产出图像向量,与文本块向量共库(或分库),查询侧——文本查询经文本编码器,跨库/跨类型检索后统一排序;索引上通常按模态分 collection 或打 type 标签,检索默认全模态、可按模态过滤;对"图内文字"补充 OCR 文本向量,弥补 CLIP 对密集文字图的不足。代价与局限评估:一是领域适配——CLIP 在通用图文对上训练,对专业领域图(医疗影像、工业图纸、内部图表风格)对齐质量差,需用领域图文对微调或融合专用模型;二是细粒度——CLIP 擅长"图文整体对应",对细粒度细节(图中具体数值、多对象关系)区分度不足,图表类(数据密度高)效果常不如"OCR + 文本化";三是文本侧能力——CLIP 文本编码器是短句级,长文本查询与文本检索能力弱于专用文本 Embedding(若文本查询为主,需文本路用专用模型 + 图像路用 CLIP 的异构双空间再映射);四是成本——双模型推理、双索引存储、微调需要图文标注数据。评估:构造"图查图、文查图、图查文、文查文"四类样本分别测 Recall@K,观察跨模态与单模态的差距;对图表类专门测"OCR 文本化 vs CLIP 向量"两方案的命中差异,按证据类型选择。

CLIP 类模型让图文共享向量空间成为可能,但"通用对齐 ≠ 业务适配":领域图文、图表细粒度、文本侧能力都是坑。答题按"原理与实现→四类代价(领域/细粒度/文本侧/成本)→按证据类型评估选方案"展开。

#

17. 检索结果的相似去重(语义重复、多文档重复信息)应如何实现,去重与重排的顺序与代价如何权衡

检索结果的相似去重(语义重复、多文档重复信息)应如何实现?去重与重排的顺序与代价如何权衡?

  • 相似重复的检测(哈希、向量相似度、聚类)
  • 去重与重排的顺序选择(先重排再去重 vs 先去重再重排)
  • 顺序的代价与质量权衡

相似重复检测:精确重复用文本哈希(SimHash/MinHash,容忍微变);语义重复用向量相似度阈值(同一查询下两候选余弦 > 0.9 视为重复)、或聚类(对召回集合按向量聚类,每簇保留代表);同源检测——同一文档的父子块、多版本内容,按 doc_id 与版本归并。顺序权衡:两种主流顺序各有适用场景。"先去重再重排":检索粗召回后先去重(候选 200→去重后 120),再对去重后的候选重排——好处是重排只处理有效候选(省计算、省延迟),坏处是去重用廉价信号(向量相似度)可能在重排前误杀"表面相似但实际相关角度不同"的候选(如两个相似段落一个含答案一个不含,向量相似度高但相关性不同)。"先重排再去重":先对全部候选重排,排序后按顺序贪心去重(保留分数高的、丢弃与已选相似的)——好处是去重决策基于精排分数(保留最相关代表),坏处是重排处理全部候选(成本高)。实践建议:粗召回规模大时用"轻量去重(哈希 + 低阈值向量去重)+ 重排 + 精排后贪心去重"两段式——先用廉价手段去除明显的重复,重排后用分数感知去重保多样性;去重阈值设"宽松"(只去除高度相似,>0.95),宁可多留候选交给重排裁决;上下文组装阶段再做最终去重(防止重复证据占用预算)。评估:对比不同顺序的 nDCG 与重排耗时,确认"去掉的候选是否影响最终答案支持率"(去重误杀率监控)。

去重与重排的顺序本质是"廉价信号的误杀风险 vs 精排信号的成本":先去重省算但可能误杀,先重排保准但贵。答题按"检测手段→两段式策略(轻量去重前置 + 精排后贪心去重)→误杀率评估"展开。

#

18. 多模态 RAG 的评测,图表问答的准确率衡量?

多模态 RAG 的评测:图表问答的准确率如何衡量?

  • 图表问答的答案类型(数值、趋势、比较、结论)
  • 衡量准确率的方法(精确匹配、语义等价、结构化校验)
  • 图表评测集的构造与指标分层

图表问答的答案形态多样,准确率衡量必须按答案类型分层。答案类型:数值型("2023 年销售额是多少"——精确值)、趋势型("哪个季度增长最快"——标签/排序)、比较型("A 与 B 谁更高"——关系判断)、总结型("这张图说明了什么"——自由文本结论)。衡量方法:数值型——精确匹配或容忍误差(±x% 或小数位),用"数值正确率"(提取答案中的数值与标准值比对);趋势/比较型——结构化比对(把答案解析为断言三元组"实体-属性-值/关系"与标注比对);总结型——语义等价判定(LLM-as-Judge 或 NLI 对齐,判定答案结论与标准结论语义一致)。指标分层:数值准确率、趋势判断准确率、总结相关性分(1-5)、以及"证据归属正确率"(答案依据的图表证据是否被正确引用);综合为图表问答正确率(按类型加权)。评测集构造:按图表类型覆盖(柱状图、折线、饼图、表格)与问题类型覆盖(单值/比较/趋势/多图综合);标注包含标准答案与支持依据(哪个图表区域);跨图表问题(多图对比)单独分组。易错点:数值幻觉(图里没有的数字被模型补全)——用"数值来源校验"(答案数值必须在证据图/表中存在);单位与坐标轴误读(千 vs 万)——答案数值校验时附单位匹配;图表视觉信息(图例、颜色含义)漏读——评测答案时检查是否涉及图例关键信息。指标呈现:按"图表类型 × 问题类型"交叉分层报告,暴露弱项(如"饼图的比例问答准确率低")。

图表问答评测的难点是"答案形态异构":数值要精确、趋势要结构化、结论要语义。答题按"答案类型分层(数值/趋势/比较/总结)→对应衡量方法(精确/结构化/语义)→证据归属与数值来源校验→交叉分层报告"展开。

#

19. 多模态检索的索引,图像与文本的统一向量空间?

多模态检索的索引:图像与文本的统一向量空间如何构建?

  • 统一向量空间的构建(多模态模型、映射方案)
  • 索引组织(混合索引、模态标签、分库)
  • 统一空间的局限与缓解

统一向量空间的构建有两条路径。路径一:单一多模态 Embedding 模型——CLIP 类模型直接输出图文共享向量(图像编码器与文本编码器输出空间一致),检索时文本查询与图像向量直接相似度排序;路径二:异构双空间 + 映射——文本用专用文本 Embedding(质量高)、图像用视觉编码器,两个空间通过"映射层"(用图文对样本训练一个把图像向量映射到文本空间的投影,或反之)对齐,保留各自模态的最优能力。索引组织:统一空间可放单一索引(同 collection),但工程上更常用"分索引 + 模态标签"——文本索引与图像索引分离(或同库分区),向量带 type 元数据(text/image/table),查询默认跨索引融合、可按模态过滤;统一打分需归一化(两路分数尺度校准)或用多模态重排统一排序。构建要点:对齐质量验证——用"互检样本"(图文对应事实)测图文互检命中率,映射损失(映射后图文相似度 vs 原始多模态模型)量化;索引更新——图像与文本各自增量更新,删除时按模态分别处理;存储——图像向量维度可能高于文本(CLIP 常 512-1024),量化方案按模态单独配置。局限与缓解:统一空间可能两头不优(文本检索弱于专用模型、图像细粒度不足)——缓解用"统一空间做召回 + 模态专用模型做重排"分层;冷门领域对齐差——用领域图文对微调或补充文本化桥接(图转 caption 进文本索引作为兜底路)。

统一向量空间的本质是"把不同模态编码进可比坐标系",但"统一"与"最优"存在张力:共享空间损失单模态能力。答题按"两条构建路径→索引组织(分库+模态标签+归一化)→对齐验证→局限缓解(分层重排、桥接兜底)"展开。

#

20. 图文混合检索的索引结构,文本向量与图像向量的联合索引、模态标签过滤与统一打分如何设计?

图文混合检索的索引结构:文本向量与图像向量的联合索引、模态标签过滤与统一打分如何设计?

  • 联合索引结构(同库分区 vs 分库、统一空间前提)
  • 模态标签过滤(type 元数据、过滤语义)
  • 统一打分(归一化、模态加权、重排)

索引结构设计取决于"是否统一空间":若图文在同一向量空间(CLIP 类),可建联合索引——同一 collection 混存图文向量,文档级粒度:一篇含图文档 = 文本块向量 + 图像向量(带 parent_doc_id);若双空间(文本专用 + 视觉专用),则分库/分区,查询双路召回后融合。推荐结构:统一 collection + 模态标签(type: text/image/table + doc_id 关联),理由:查询只需一次索引访问,删除按 doc_id 级联,检索可跨界。模态标签过滤:type 元数据进标量索引,支持三类过滤——只查文本(type=text)、只查图(type=image)、按文档查全模态(doc_id 限定);过滤语义要支持"图文配套返回"(命中图的块把同 doc 的文本块一起带回,避免图脱离上下文)。统一打分设计:跨模态分数归一化(各模态内分位数归一或模型校准);模态加权——业务对图文需求不同时按权重(如文本 0.7/图像 0.3)合成,或按查询类型动态(视觉意图查询加重图像权重——由查询分析输出);最终排序建议经多模态重排统一裁决(避免手工权重失衡);分数分布监控——按模态监控分数分布漂移(图像分整体偏低说明归一化失效)。另注意:同一文档图文块召回后的去重与组装(图与引用它的正文配对);索引更新时图文按 doc 事务更新,避免"文新图旧"。

图文混合索引的三大设计点:联合结构(统一 collection + 模态标签 + doc 关联)、过滤(type 过滤 + 图文配套)、统一打分(归一化 + 模态加权 + 重排裁决)。答题按结构→过滤→打分→配套与一致性细节展开,体现索引设计完整性。