# 1. ES 的索引别名(alias)与零停机重建 A 别名无法切换索引 B 重建索引必须停服 C 通过别名访问索引,重建新索引后原子切换别名实现零停机,避免直接改真实索引 ✓ 正确答案 D 别名只能指向一个索引
# 2. ES 索引 Mapping 的 keyword/text 与分词器(analyzer)配置 A text 不分词 B keyword 用于全文搜索 C 分词器只影响存储不影响检索 D keyword 不分词用于精确匹配/聚合,text 分词用于全文搜索,可用 fields 多字段兼顾两者 ✓ 正确答案
# 3. 业务库到搜索引擎的 CDC 近实时同步 A CDC 只能全量同步 B CDC 无法处理删除操作 C 通过监听 binlog 的 CDC 工具(Canal/Debezium)解析变更,经 MQ 幂等写入 ES,实现近实时最终一致 ✓ 正确答案 D 双写是最可靠的同步方案
# 4. 倒排索引与 FST(有限状态机)压缩词典 A 倒排索引把词映射到文档列表实现快速检索,FST 通过共享前缀压缩词典降低内存 ✓ 正确答案 B FST 是检索用的文档列表 C ES 检索是全文扫描 D 倒排索引用于压缩词典
# 5. 双写一致性与基于 binlog 的最终一致 A 双写是原子的 B 双写非原子且侵入,binlog 方案以库为事实源异步同步,配合幂等与对账实现最终一致 ✓ 正确答案 C binlog 方案比双写侵入更大 D binlog 方案无任何不一致
# 6. 向量与标量过滤的联合执行计划优化 A post-filter 一定更准确 B 向量与标量过滤无法联合 C 过滤位置不影响结果 D pre-filter 先过滤再检索保证召回,post-filter 先检索再过滤可能结果不足,ES knn 的 filter 参数做过滤感知优化 ✓ 正确答案
# 7. 多租户隔离,索引隔离 vs 字段隔离 A 索引隔离成本最低 B 两种方案无差异 C 字段隔离隔离最强 D 索引隔离物理隔离但资源开销大,字段隔离共享节省资源但隔离弱,按租户数量与隔离要求权衡 ✓ 正确答案
# 8. 检索性能,分片数、副本数与查询并发 A 分片多并行度高但过多会分片爆炸,副本承担读流量提升吞吐但写放大,需按资源平衡 ✓ 正确答案 B 分片越多越好 C 副本只影响写入 D 分片与查询并发无关
# 9. 检索与数据库的一致性校验与对账 A 对账只需比对数量 B CDC 同步后无需对账 C 对账无法发现差异 D 以库为事实源定期比对 ES 数据、发现差异并自动修复,作为同步方案的兜底 ✓ 正确答案
# 10. 检索索引重建(reindex)的滚动切换 A reindex 必须停服 B 别名无法用于切换 C 新建索引、reindex 复制数据、别名原子切换,实现零停机变更索引结构 ✓ 正确答案 D reindex 只能复制字段
# 11. 检索集群的容量规划与冷热分层 A 冷热分层只影响写入 B 所有数据都应放热节点 C 容量规划无需考虑副本 D 按数据量与节点资源规划分片节点,用 ILM 把热冷数据分层存储,平衡性能与成本 ✓ 正确答案
# 12. 索引模板(Index Template)与 ILM 生命周期 A ILM 用于定义索引结构 B 模板与生命周期无关 C 模板自动定义新索引结构并绑定 ILM 策略,ILM 按 hot/warm/cold/delete 自动迁移数据实现归档清理 ✓ 正确答案 D ILM 只能手动执行
# 13. BM25 相关性评分与自定义权重 A BM25 只考虑词频 B BM25 综合词频、稀有度与长度归一化评分,可用 boost 与 function_score 自定义权重 ✓ 正确答案 C boost 无法提升字段 D 相关性评分不可定制
# 14. ES 深度分页(search_after)替代 from/size A from/size 深页需全量排序代价高,search_after 用游标续页避免深页排序,适合滚动翻页 ✓ 正确答案 B search_after 适合随机跳页 C from/size 深页无性能问题 D search_after 需要加载全量数据
# 15. ES 的 _search 返回的 scroll 与 point in time A scroll 固化快照适合批量导出,PIT 提供时间点视图配合 search_after 适合稳定翻页 ✓ 正确答案 B scroll 适合翻页 C PIT 适合导出 D 两者完全相同
# 16. ES 的 bool 查询与 must/should/filter 语义 A must 必须匹配且计分,filter 必须匹配但不计分(可缓存),should 可选加分 ✓ 正确答案 B filter 参与评分 C must 不计分 D should 必须匹配
# 17. ES 的 bulk 批量写入与 refresh 策略 A refresh 与写入性能无关 B refresh 越频繁写入越快 C bulk 只能单条写入 D bulk 合并多个写入请求提升吞吐,refresh 控制可见性,实时性要求低可调大 refresh interval 提升写入性能 ✓ 正确答案
# 18. ES 聚合(terms/date_histogram)的 Java 构建 A 用 AggregationBuilders 构建 terms/date_histogram 聚合,从响应解析 bucket 的 key 与 docCount ✓ 正确答案 B 聚合无法用 Java 构建 C terms 聚合按时间分桶 D date_histogram 按字段分桶
# 19. Elasticsearch 的 RestHighLevelClient 与 Java API Client 差异 A RestHighLevelClient 是 ES 8 主推 B Java API Client 是旧版客户端 C Java API Client 是 ES 8 官方主推的类型安全客户端,RestHighLevelClient 已弃用,新项目应选 Java API Client ✓ 正确答案 D 两者持续并存无淘汰
# 20. Elasticsearch 的 dense_vector 与 knn 检索 A knn 检索是精确全量计算 B dense_vector 无法配置相似度 C dense_vector 存储向量并配置维度/相似度/HNSW 索引,knn 查询做近似最近邻检索返回 top-k ✓ 正确答案 D knn 检索无需向量索引
# 21. Embedding 模型选型与向量维度如何影响检索效果与存储/计算成本,降维与量化在大规模向量库中的取舍是什么 A 维度越高成本越低 B 量化不损失精度 C 降维只影响存储不影响计算 D 维度越高表达力强但成本高,降维与量化用精度换取存储/计算成本,需权衡精度与成本 ✓ 正确答案
# 22. HNSW 的 m 与 ef_construction 参数如何影响图的连通性、召回率与构建/查询延迟,ef_search 在查询阶段如何权衡精度与速度 A m 越大查询越快 B m 决定连通性、ef_construction 决定构建质量,两者提升召回但增加构建成本;ef_search 在查询时权衡精度与速度 ✓ 正确答案 C 三个参数都只影响召回 D ef_search 影响构建耗时
# 23. OpenSearch 与 Elasticsearch 的兼容与分叉差异 A OpenSearch 与 ES 完全一致 B OpenSearch 是闭源 C OpenSearch 是 ES 7.10 的 Apache 2.0 分叉,API 兼容但功能各自演进,选型看许可证与生态 ✓ 正确答案 D 两者无法迁移
# 24. OpenSearch 的 k-NN 插件支持向量检索 A k-NN 插件只能做精确检索 B OpenSearch 无法向量检索 C k-NN 插件用 knn_vector 字段与 HNSW/IVF 算法提供向量检索,与 ES 的 dense_vector 实现不同 ✓ 正确答案 D knn_vector 与 dense_vector 完全相同
# 25. OpenSearch 的安全插件(Security Plugin)与 RBAC A RBAC 只能控制单个用户 B 安全插件不支持认证 C OpenSearch 无访问控制 D 安全插件提供认证与 RBAC,按"用户-角色-权限"模型分配索引/文档/字段级权限 ✓ 正确答案
# 26. RAG 中检索质量对回答准确性的影响 A 检索质量直接决定回答准确性,需优化切分、混合检索、重排与元数据过滤提升召回与相关性 ✓ 正确答案 B 生成质量完全由 LLM 决定与检索无关 C 检索到越多文档回答越准 D 检索质量与回答无关
# 27. 中文分词(IK/analyzer)在检索召回的优化 A IK 无需词典 B IK 通过自定义词典、同义词扩展与分词模式优化提升中文分词准确度与召回率 ✓ 正确答案 C 分词器不影响召回 D 中文无需分词器
# 28. 关键词(BM25)与向量(ANN)的混合检索(RRF) A 混合检索用 BM25 精确匹配与 ANN 语义检索互补,RRF 按排名倒数融合两路结果提升召回 ✓ 正确答案 B 混合检索只能用一个检索 C RRF 会降低相关性 D RRF 依赖评分尺度
# 29. 大规模文档(亿级)分片与路由策略 A 按数据量规划分片避免过大或爆炸,按业务键路由聚簇减少查询范围并提升性能 ✓ 正确答案 B 路由会降低查询性能 C 亿级文档无需分片规划 D 分片越多性能越好
# 30. 检索结果截断(top-k)与多样性打散 A 打散越多相关性越高 B top-k 越大越好 C top-k 截断返回最相关结果控制数据量,打散通过分类限制/去重避免结果单一,需平衡相关性与多样性 ✓ 正确答案 D 打散会破坏所有相关性
# 31. 混合检索的 pre-filter 与 post-filter 差异 A pre-filter 先过滤再检索保证召回准确,post-filter 先检索再过滤可能结果不足,过滤严格时用 pre-filter ✓ 正确答案 B pre-filter 性能一定更好 C 两者无差异 D post-filter 一定召回更准
# 32. 混合检索的可观测,召回率与延迟分解 A 召回率无法评估 B 延迟分解无意义 C 混合检索无需可观测 D 用召回率评估检索质量,用延迟分解定位 BM25/ANN/融合/重排各阶段瓶颈,驱动优化 ✓ 正确答案
# 33. 重排序(ReRank)在混合检索后提升精度 A ReRank 增加召回量 B ReRank 在召回后对 top-k 候选用强模型精算相关性重排,兼顾召回广度与排序精度 ✓ 正确答案 C ReRank 对全量数据重排 D 重排序只用于召回阶段