# 1. parallel_replicas_count 参数控制副本数量,parallel_replicas_mode='sampling_key' A parallel_replicas_count 控制副本数,sampling_key 模式按采样键拆分数据到各副本并行 ✓ 正确答案 B parallel_replicas_count 只影响写入 C sampling_key 模式不需要任何键 D 副本数越多查询一定越快
# 2. Parallel Replicas 的合并阶段,局部结果如何按查询语义(ORDER BY/LIMIT/聚合)正确合并 A coordinator 按查询语义合并:ORDER BY 全局排序、LIMIT 取全局前 N、聚合用状态合并,保证结果一致 ✓ 正确答案 B 各副本直接返回原始数据,不做合并 C LIMIT 各副本独立生效即可 D 聚合只需简单求和
# 3. Parallel Replicas 在 ReplicatedMergeTree 上要求 zookeeper 协调 A Parallel Replicas 不依赖任何协调服务 B ZooKeeper 只影响写入,不影响查询 C ReplicatedMergeTree 通过 ZooKeeper/Keeper 协调副本数据同步,Parallel Replicas 借助该协调分发查询到各副本 ✓ 正确答案 D 副本无需协调数据
# 4. Parallel Replicas 在 23.3+ 支持,单查询跨 replica 并行处理 A 它只在实验特性下可用 B 它不支持副本并行 C 它 20.x 就稳定支持 D 23.3 起正式支持,单查询可跨多个副本并行处理,加速大表扫描 ✓ 正确答案
# 5. Parallel Replicas 适合大表扫表场景 A 它适合小数据点查 B 它适合大表扫表,把数据拆分到多副本并行读取,突破单副本 IO/CPU 瓶颈 ✓ 正确答案 C 它对所有查询都有收益 D 它只加速写入
# 6. ClickHouse Parallel Replicas 的分片内并行查询原理与 max_parallel_replicas 的配置权衡? A 副本数越多越好,无上限 B 它控制单查询最多利用的副本数,需权衡并行度提升与协调、网络、内存开销 ✓ 正确答案 C 它只影响写入并发 D 配置越大查询越慢
# 7. Parallel Replicas 与分布式表(Distributed)在外表/数据重分布的差异与适用边界? A 两者完全相同 B Parallel Replicas 跨分片并行 C Parallel Replicas 是分片内副本并行,Distributed 是跨分片并行,可组合实现双重并行 ✓ 正确答案 D Distributed 表在分片内并行
# 8. ClickHouse Parallel Replicas 的原理,同一个查询如何分片到同一分区的多个副本并行执行,与分布式表的差异? A Parallel Replicas 把同一分区数据按范围分到多副本并行,分布式表跨分片并行,并行对象不同 ✓ 正确答案 B Parallel Replicas 跨分片并行 C 分布式表利用副本冗余并行 D 两者都在同一副本上执行
# 9. Parallel Replicas 的适用边界,什么查询能线性加速,什么场景(单副本、分布式表组合)收益有限? A 点查最适合并行 B 所有查询都能线性加速 C 大表扫描/聚合可线性加速,单副本、小查询、点查场景收益有限 ✓ 正确答案 D 单副本也能并行
# 10. Parallel Replicas 的查询拆分,同分区数据在多副本并行? A 拆分成重叠的数据段 B 只在一个副本上读取 C 按数据范围拆分成不重叠段分派到多副本并行读取,再合并结果 ✓ 正确答案 D 跨分区拆分
# 11. 每副本可用的线程数(max_threads)与 parallel_replicas_count 如何决定一次查询的总并发度 A 总并发度只由 max_threads 决定 B 总并发度只由副本数决定 C 总并发度近似 = parallel_replicas_count × 每副本 max_threads,受数据量与 CPU 资源限制 ✓ 正确答案 D 两者互不影响
# 12. Parallel Replicas 下的一致性设置(allow_experimental_parallel_reading)与读取放大如何评估? A 同一数据被多副本读取造成读取放大,需权衡查询提速与集群总 IO 开销 ✓ 正确答案 B 读取放大只有好处 C 副本数越多读取放大越小 D 它无读取放大
# 13. Parallel Replicas 的集群配置(cluster 的 secret/权重)与故障切换语义? A secret 用于认证,权重用于负载均衡,副本故障时协调会避开故障副本保证查询可用 ✓ 正确答案 B 副本故障会导致查询必然失败 C secret 与权重无关 D 故障切换不依赖集群配置
# 14. ClickHouse 多副本并行读,与分布式表并行度的关系? A 两者互斥,不能同时使用 B 并行度与维度无关 C 分布式表在分片内并行 D 分布式表是跨分片并行,Parallel Replicas 是分片内副本并行,二者正交可叠加实现多维并行 ✓ 正确答案
# 15. Parallel Replicas 的适用限制,单分片多副本场景? A 任何表都能用 Parallel Replicas B 需 ReplicatedMergeTree 且副本同步一致,副本数决定并行度上限 ✓ 正确答案 C 副本越多并行度越高,无限制 D 单分片场景无法并行
# 16. Parallel Replicas 与分布式表的组合,跨分片并行的设计? A 组合实现「跨分片并行 × 分片内副本并行」的双层并行,最大化查询并行度 ✓ 正确答案 B 两者组合会降低并行度 C 组合不需要配置 cluster D 分布式表在分片内并行,Parallel Replicas 跨分片并行
# 17. Parallel Replicas 对数据版本(parts 集合)一致性的要求与读取保证 A 要求各副本 parts 集合一致,否则并行读取结果出错,副本同步延迟是正确性关键 ✓ 正确答案 B 各副本 parts 集合可不同 C 副本延迟不影响结果 D 无需协调数据版本