分块、索引、检索与重排

共 19 题
#

1. 合同、技术文档和源代码应如何按结构、语义与代码边界分块,并保留可定位元数据

A 所有文档都应使用相同大小的固定 token 分块
B 代码注释应单独成块,与代码分离
C 合同按条款、技术文档按章节、代码按函数边界分块,并保留页码、行号、章节路径等可定位元数据 ✓ 正确答案
D 分块后无需校验块结构完整性
#

2. 分块粒度和重叠为何没有通用固定值,如何用查询集评估上下文完整性与噪声

A 512 token、50% 重叠是适用于所有场景的通用分块参数
B 重叠越大越好,永远不会引入噪声
C 分块参数取决于文档类型、查询粒度与模型能力,需用带标注查询集评估上下文完整性与噪声后确定 ✓ 正确答案
D 分块粒度只影响存储,不影响检索质量
#

3. 关键词、向量和混合检索各有哪些典型失败模式,查询路由应如何设计

A 向量检索在精确型号匹配上永远优于 BM25
B 关键词检索有词汇鸿沟失败、向量检索有精确匹配失败,查询路由应按查询特征选择路径并以混合检索兜底 ✓ 正确答案
C 混合检索可以解决所有查询问题
D 查询路由与降级路径无关
#

4. 检索中的“查询改写 + 多查询扩展”会增加多少延迟,复杂场景下是否值得

A 查询改写只增加毫秒级延迟
B 所有查询都应无条件进行多查询扩展
C 查询改写与多查询扩展带来数百毫秒到秒级延迟,应针对多轮、口语化、多意图查询按需触发并配合并行与缓存优化 ✓ 正确答案
D 改写不会改变检索结果
#

5. 查询改写、多查询扩展、元数据过滤和 reranker 的顺序如何影响质量与总延迟

A 标准顺序是查询改写/扩展→元数据过滤→召回→reranker,过滤前置缩小候选集、重排末位精排以兼顾质量与延迟 ✓ 正确答案
B 检索流水线中各环节的执行顺序对结果没有影响
C reranker 应放在召回之前执行
D 元数据过滤应尽量后置以保留更多候选
#

6. Embedding 模型或维度升级时,如何双写、回填、影子检索和无停机切换索引

A 升级期间新数据可以不写入新索引
B Embedding 升级必须停机重建索引
C 升级应通过双写、分批回填、影子检索对比与灰度切换实现无停机,并保留旧索引支持回退 ✓ 正确答案
D 维度变化无需考虑缓存失效
#

7. 父子分块(parent-child chunk)在长文档问答中如何平衡上下文完整性与精确性

A 父子分块是子块负责检索、父块负责上下文,兼顾精确性与完整性 ✓ 正确答案
B 父子分块只能用于短文档
C 父子分块会增加检索精度但一定降低上下文完整性
D 子块无需记录父块指针
#

8. 如何处理多语种混合检索(中文 + 英文 + 代码),Embedding 模型是否需要多语种

A 存在中文查英文等跨语种交互时必须选多语种对齐模型,并构造跨语种评估样本验证,代码检索需单独处理 ✓ 正确答案
B 中英混合语料用任何 Embedding 模型效果都一样
C 多语种模型不需要验证跨语种检索效果
D 代码块可以完全按自然语言分块处理
#

9. 如何让检索支持“在指定时间窗口内”或“指定产品线内”的限定,元数据过滤如何与向量检索结合

A 元数据过滤与向量检索只能二选一
B pre-filter 一定比 post-filter 召回率更高
C 检索支持时间窗、产品线等限定需把维度写入元数据,解析限定为过滤表达式并与向量检索联合执行,过滤条件由服务端注入 ✓ 正确答案
D 时间窗限定无法从对话上下文解析
#

10. 查询分析(query understanding)模块识别用户意图(搜索 vs 对话 vs 操作)

A 所有用户输入都应直接进入知识检索
B 查询分析应区分搜索、对话、操作意图,按意图路由到检索、对话或工具链路,低置信度时澄清而非武断路由 ✓ 正确答案
C 意图识别与置信度无关
D 操作类意图也应走知识库检索
#

11. Rerank 阶段延迟显著(>500ms)时,是否应在前置向量召回阶段用更便宜的信号过滤

A rerank 延迟高时应取消 rerank
B 可用向量分阈值、粗截断等廉价信号前置压缩候选集,并通过评估集控制误杀率,配合缓存与兜底策略 ✓ 正确答案
C 前置过滤越激进越好,无需评估
D rerank 候选集大小与延迟无关
#

12. 当召回内容重复且集中于同一文档时,如何做去重、多样性和父子块扩展

A MMR 只考虑相关性不考虑多样性
B 召回结果越多越好,无需去重
C 单文档占满上下文是正常现象
D 应用哈希与相似度去重、按文档限流与 MMR 保多样性、父子块去重扩展,保证上下文覆盖多来源信息 ✓ 正确答案
#

13. 向量量化后怎样用同一标注集测量召回损失,而不是只比较 QPS

A 量化后只需比较 QPS 提升即可
B 量化损失与数据分布无关
C 应用同一标注集分别建量化前后索引,对比 Recall@K、MRR、nDCG 衡量召回损失,并结合延迟收益权衡 ✓ 正确答案
D 量化不会造成任何召回损失
#

14. 向量检索的 k 值在初次粗筛与精排中分别应取多少,是否有简单经验公式

A 粗筛 k 通常取 50-200 保证召回覆盖,精排 k 取 3-10 受上下文预算约束,可依据召回率曲线确定 ✓ 正确答案
B 粗筛与精排应该使用同一个 k 值
C k 值越大答案一定越好
D 精排 k 与上下文窗口无关
#

15. 同一查询多次检索结果不一致时,如何对结果做稳定排序(基于证据强度而非偶然得分)

A 同一查询结果不一致是正常现象,无需处理
B 打破平局规则与排序稳定性无关
C 缓存无需绑定索引版本
D 结果不稳定源于索引版本、量化扰动与重排波动,应以多路信号聚合、多次采样与确定性规则基于证据强度稳定排序 ✓ 正确答案
#

16. 检索结果中包含敏感信息(用户 ID、token)时,应在何时做遮盖而不破坏检索质量

A 脱敏不会影响任何检索质量
B 敏感信息只需在答案展示时遮盖
C 高敏信息应在索引前脱敏使原文不进向量空间,检索后与生成前再遮盖,并评估脱敏带来的召回损失 ✓ 正确答案
D 日志中的查询文本无需脱敏
#

17. 语义分块(semantic chunking)与按固定 token 切分相比,在哪些文档类型上明显胜出

A 语义分块在主题连贯要求高的散文、多主题混杂文档与对话记录上明显胜出,结构化文档仍适合固定或结构切分 ✓ 正确答案
B 语义分块不需要任何 Embedding 计算
C 语义分块在任何文档类型上都优于固定切分
D 块大小不可控是语义分块的优点
#

18. 为什么 BM25 在精确关键词(型号、ID、专有名词)上仍优于向量检索,二者不是替代关系

A 向量检索在型号、ID 等精确匹配上优于 BM25
B BM25 的词项精确匹配对型号、ID、专有名词查询优于向量检索,而向量擅长语义近似,二者互补应组合使用 ✓ 正确答案
C BM25 与向量检索是完全替代关系
D 稀有词在向量空间中表征更稳定
#

19. 稀疏检索(SPLADE、BM42)相比传统 BM25 在哪些场景下提升显著

A SPLADE、BM42 通过学习式词项权重与词项扩展,在同义改写、术语变体与长查询场景下比 BM25 提升显著 ✓ 正确答案
B SPLADE 与 BM25 在召回效果上完全一致
C 稀疏检索没有任何推理成本
D 稀疏检索在精确型号匹配上远优于 BM25