Elasticsearch Java 客户端

共 33 题
#

1. ES 的索引别名(alias)与零停机重建

A 别名无法切换索引
B 重建索引必须停服
C 通过别名访问索引,重建新索引后原子切换别名实现零停机,避免直接改真实索引 ✓ 正确答案
D 别名只能指向一个索引
#

2. ES 索引 Mapping 的 keyword/text 与分词器(analyzer)配置

A text 不分词
B keyword 用于全文搜索
C 分词器只影响存储不影响检索
D keyword 不分词用于精确匹配/聚合,text 分词用于全文搜索,可用 fields 多字段兼顾两者 ✓ 正确答案
#

3. 业务库到搜索引擎的 CDC 近实时同步

A CDC 只能全量同步
B CDC 无法处理删除操作
C 通过监听 binlog 的 CDC 工具(Canal/Debezium)解析变更,经 MQ 幂等写入 ES,实现近实时最终一致 ✓ 正确答案
D 双写是最可靠的同步方案
#

4. 倒排索引与 FST(有限状态机)压缩词典

A 倒排索引把词映射到文档列表实现快速检索,FST 通过共享前缀压缩词典降低内存 ✓ 正确答案
B FST 是检索用的文档列表
C ES 检索是全文扫描
D 倒排索引用于压缩词典
#

5. 双写一致性与基于 binlog 的最终一致

A 双写是原子的
B 双写非原子且侵入,binlog 方案以库为事实源异步同步,配合幂等与对账实现最终一致 ✓ 正确答案
C binlog 方案比双写侵入更大
D binlog 方案无任何不一致
#

6. 向量与标量过滤的联合执行计划优化

A post-filter 一定更准确
B 向量与标量过滤无法联合
C 过滤位置不影响结果
D pre-filter 先过滤再检索保证召回,post-filter 先检索再过滤可能结果不足,ES knn 的 filter 参数做过滤感知优化 ✓ 正确答案
#

7. 多租户隔离,索引隔离 vs 字段隔离

A 索引隔离成本最低
B 两种方案无差异
C 字段隔离隔离最强
D 索引隔离物理隔离但资源开销大,字段隔离共享节省资源但隔离弱,按租户数量与隔离要求权衡 ✓ 正确答案
#

8. 检索性能,分片数、副本数与查询并发

A 分片多并行度高但过多会分片爆炸,副本承担读流量提升吞吐但写放大,需按资源平衡 ✓ 正确答案
B 分片越多越好
C 副本只影响写入
D 分片与查询并发无关
#

9. 检索与数据库的一致性校验与对账

A 对账只需比对数量
B CDC 同步后无需对账
C 对账无法发现差异
D 以库为事实源定期比对 ES 数据、发现差异并自动修复,作为同步方案的兜底 ✓ 正确答案
#

10. 检索索引重建(reindex)的滚动切换

A reindex 必须停服
B 别名无法用于切换
C 新建索引、reindex 复制数据、别名原子切换,实现零停机变更索引结构 ✓ 正确答案
D reindex 只能复制字段
#

11. 检索集群的容量规划与冷热分层

A 冷热分层只影响写入
B 所有数据都应放热节点
C 容量规划无需考虑副本
D 按数据量与节点资源规划分片节点,用 ILM 把热冷数据分层存储,平衡性能与成本 ✓ 正确答案
#

12. 索引模板(Index Template)与 ILM 生命周期

A ILM 用于定义索引结构
B 模板与生命周期无关
C 模板自动定义新索引结构并绑定 ILM 策略,ILM 按 hot/warm/cold/delete 自动迁移数据实现归档清理 ✓ 正确答案
D ILM 只能手动执行
#

13. BM25 相关性评分与自定义权重

A BM25 只考虑词频
B BM25 综合词频、稀有度与长度归一化评分,可用 boost 与 function_score 自定义权重 ✓ 正确答案
C boost 无法提升字段
D 相关性评分不可定制
#

14. ES 深度分页(search_after)替代 from/size

A from/size 深页需全量排序代价高,search_after 用游标续页避免深页排序,适合滚动翻页 ✓ 正确答案
B search_after 适合随机跳页
C from/size 深页无性能问题
D search_after 需要加载全量数据
#

15. ES 的 _search 返回的 scroll 与 point in time

A scroll 固化快照适合批量导出,PIT 提供时间点视图配合 search_after 适合稳定翻页 ✓ 正确答案
B scroll 适合翻页
C PIT 适合导出
D 两者完全相同
#

16. ES 的 bool 查询与 must/should/filter 语义

A must 必须匹配且计分,filter 必须匹配但不计分(可缓存),should 可选加分 ✓ 正确答案
B filter 参与评分
C must 不计分
D should 必须匹配
#

17. ES 的 bulk 批量写入与 refresh 策略

A refresh 与写入性能无关
B refresh 越频繁写入越快
C bulk 只能单条写入
D bulk 合并多个写入请求提升吞吐,refresh 控制可见性,实时性要求低可调大 refresh interval 提升写入性能 ✓ 正确答案
#

18. ES 聚合(terms/date_histogram)的 Java 构建

A 用 AggregationBuilders 构建 terms/date_histogram 聚合,从响应解析 bucket 的 key 与 docCount ✓ 正确答案
B 聚合无法用 Java 构建
C terms 聚合按时间分桶
D date_histogram 按字段分桶
#

19. Elasticsearch 的 RestHighLevelClient 与 Java API Client 差异

A RestHighLevelClient 是 ES 8 主推
B Java API Client 是旧版客户端
C Java API Client 是 ES 8 官方主推的类型安全客户端,RestHighLevelClient 已弃用,新项目应选 Java API Client ✓ 正确答案
D 两者持续并存无淘汰
#

20. Elasticsearch 的 dense_vector 与 knn 检索

A knn 检索是精确全量计算
B dense_vector 无法配置相似度
C dense_vector 存储向量并配置维度/相似度/HNSW 索引,knn 查询做近似最近邻检索返回 top-k ✓ 正确答案
D knn 检索无需向量索引
#

21. Embedding 模型选型与向量维度如何影响检索效果与存储/计算成本,降维与量化在大规模向量库中的取舍是什么

A 维度越高成本越低
B 量化不损失精度
C 降维只影响存储不影响计算
D 维度越高表达力强但成本高,降维与量化用精度换取存储/计算成本,需权衡精度与成本 ✓ 正确答案
#

22. HNSW 的 m 与 ef_construction 参数如何影响图的连通性、召回率与构建/查询延迟,ef_search 在查询阶段如何权衡精度与速度

A m 越大查询越快
B m 决定连通性、ef_construction 决定构建质量,两者提升召回但增加构建成本;ef_search 在查询时权衡精度与速度 ✓ 正确答案
C 三个参数都只影响召回
D ef_search 影响构建耗时
#

23. OpenSearch 与 Elasticsearch 的兼容与分叉差异

A OpenSearch 与 ES 完全一致
B OpenSearch 是闭源
C OpenSearch 是 ES 7.10 的 Apache 2.0 分叉,API 兼容但功能各自演进,选型看许可证与生态 ✓ 正确答案
D 两者无法迁移
#

24. OpenSearch 的 k-NN 插件支持向量检索

A k-NN 插件只能做精确检索
B OpenSearch 无法向量检索
C k-NN 插件用 knn_vector 字段与 HNSW/IVF 算法提供向量检索,与 ES 的 dense_vector 实现不同 ✓ 正确答案
D knn_vector 与 dense_vector 完全相同
#

25. OpenSearch 的安全插件(Security Plugin)与 RBAC

A RBAC 只能控制单个用户
B 安全插件不支持认证
C OpenSearch 无访问控制
D 安全插件提供认证与 RBAC,按"用户-角色-权限"模型分配索引/文档/字段级权限 ✓ 正确答案
#

26. RAG 中检索质量对回答准确性的影响

A 检索质量直接决定回答准确性,需优化切分、混合检索、重排与元数据过滤提升召回与相关性 ✓ 正确答案
B 生成质量完全由 LLM 决定与检索无关
C 检索到越多文档回答越准
D 检索质量与回答无关
#

27. 中文分词(IK/analyzer)在检索召回的优化

A IK 无需词典
B IK 通过自定义词典、同义词扩展与分词模式优化提升中文分词准确度与召回率 ✓ 正确答案
C 分词器不影响召回
D 中文无需分词器
#

28. 关键词(BM25)与向量(ANN)的混合检索(RRF)

A 混合检索用 BM25 精确匹配与 ANN 语义检索互补,RRF 按排名倒数融合两路结果提升召回 ✓ 正确答案
B 混合检索只能用一个检索
C RRF 会降低相关性
D RRF 依赖评分尺度
#

29. 大规模文档(亿级)分片与路由策略

A 按数据量规划分片避免过大或爆炸,按业务键路由聚簇减少查询范围并提升性能 ✓ 正确答案
B 路由会降低查询性能
C 亿级文档无需分片规划
D 分片越多性能越好
#

30. 检索结果截断(top-k)与多样性打散

A 打散越多相关性越高
B top-k 越大越好
C top-k 截断返回最相关结果控制数据量,打散通过分类限制/去重避免结果单一,需平衡相关性与多样性 ✓ 正确答案
D 打散会破坏所有相关性
#

31. 混合检索的 pre-filter 与 post-filter 差异

A pre-filter 先过滤再检索保证召回准确,post-filter 先检索再过滤可能结果不足,过滤严格时用 pre-filter ✓ 正确答案
B pre-filter 性能一定更好
C 两者无差异
D post-filter 一定召回更准
#

32. 混合检索的可观测,召回率与延迟分解

A 召回率无法评估
B 延迟分解无意义
C 混合检索无需可观测
D 用召回率评估检索质量,用延迟分解定位 BM25/ANN/融合/重排各阶段瓶颈,驱动优化 ✓ 正确答案
#

33. 重排序(ReRank)在混合检索后提升精度

A ReRank 增加召回量
B ReRank 在召回后对 top-k 候选用强模型精算相关性重排,兼顾召回广度与排序精度 ✓ 正确答案
C ReRank 对全量数据重排
D 重排序只用于召回阶段