Parallel Replicas

共 17 题
#

1. parallel_replicas_count 参数控制副本数量,parallel_replicas_mode='sampling_key'

A parallel_replicas_count 控制副本数,sampling_key 模式按采样键拆分数据到各副本并行 ✓ 正确答案
B parallel_replicas_count 只影响写入
C sampling_key 模式不需要任何键
D 副本数越多查询一定越快
#

2. Parallel Replicas 的合并阶段,局部结果如何按查询语义(ORDER BY/LIMIT/聚合)正确合并

A coordinator 按查询语义合并:ORDER BY 全局排序、LIMIT 取全局前 N、聚合用状态合并,保证结果一致 ✓ 正确答案
B 各副本直接返回原始数据,不做合并
C LIMIT 各副本独立生效即可
D 聚合只需简单求和
#

3. Parallel Replicas 在 ReplicatedMergeTree 上要求 zookeeper 协调

A Parallel Replicas 不依赖任何协调服务
B ZooKeeper 只影响写入,不影响查询
C ReplicatedMergeTree 通过 ZooKeeper/Keeper 协调副本数据同步,Parallel Replicas 借助该协调分发查询到各副本 ✓ 正确答案
D 副本无需协调数据
#

4. Parallel Replicas 在 23.3+ 支持,单查询跨 replica 并行处理

A 它只在实验特性下可用
B 它不支持副本并行
C 它 20.x 就稳定支持
D 23.3 起正式支持,单查询可跨多个副本并行处理,加速大表扫描 ✓ 正确答案
#

5. Parallel Replicas 适合大表扫表场景

A 它适合小数据点查
B 它适合大表扫表,把数据拆分到多副本并行读取,突破单副本 IO/CPU 瓶颈 ✓ 正确答案
C 它对所有查询都有收益
D 它只加速写入
#

6. ClickHouse Parallel Replicas 的分片内并行查询原理与 max_parallel_replicas 的配置权衡?

A 副本数越多越好,无上限
B 它控制单查询最多利用的副本数,需权衡并行度提升与协调、网络、内存开销 ✓ 正确答案
C 它只影响写入并发
D 配置越大查询越慢
#

7. Parallel Replicas 与分布式表(Distributed)在外表/数据重分布的差异与适用边界?

A 两者完全相同
B Parallel Replicas 跨分片并行
C Parallel Replicas 是分片内副本并行,Distributed 是跨分片并行,可组合实现双重并行 ✓ 正确答案
D Distributed 表在分片内并行
#

8. ClickHouse Parallel Replicas 的原理,同一个查询如何分片到同一分区的多个副本并行执行,与分布式表的差异?

A Parallel Replicas 把同一分区数据按范围分到多副本并行,分布式表跨分片并行,并行对象不同 ✓ 正确答案
B Parallel Replicas 跨分片并行
C 分布式表利用副本冗余并行
D 两者都在同一副本上执行
#

9. Parallel Replicas 的适用边界,什么查询能线性加速,什么场景(单副本、分布式表组合)收益有限?

A 点查最适合并行
B 所有查询都能线性加速
C 大表扫描/聚合可线性加速,单副本、小查询、点查场景收益有限 ✓ 正确答案
D 单副本也能并行
#

10. Parallel Replicas 的查询拆分,同分区数据在多副本并行?

A 拆分成重叠的数据段
B 只在一个副本上读取
C 按数据范围拆分成不重叠段分派到多副本并行读取,再合并结果 ✓ 正确答案
D 跨分区拆分
#

11. 每副本可用的线程数(max_threads)与 parallel_replicas_count 如何决定一次查询的总并发度

A 总并发度只由 max_threads 决定
B 总并发度只由副本数决定
C 总并发度近似 = parallel_replicas_count × 每副本 max_threads,受数据量与 CPU 资源限制 ✓ 正确答案
D 两者互不影响
#

12. Parallel Replicas 下的一致性设置(allow_experimental_parallel_reading)与读取放大如何评估?

A 同一数据被多副本读取造成读取放大,需权衡查询提速与集群总 IO 开销 ✓ 正确答案
B 读取放大只有好处
C 副本数越多读取放大越小
D 它无读取放大
#

13. Parallel Replicas 的集群配置(cluster 的 secret/权重)与故障切换语义?

A secret 用于认证,权重用于负载均衡,副本故障时协调会避开故障副本保证查询可用 ✓ 正确答案
B 副本故障会导致查询必然失败
C secret 与权重无关
D 故障切换不依赖集群配置
#

14. ClickHouse 多副本并行读,与分布式表并行度的关系?

A 两者互斥,不能同时使用
B 并行度与维度无关
C 分布式表在分片内并行
D 分布式表是跨分片并行,Parallel Replicas 是分片内副本并行,二者正交可叠加实现多维并行 ✓ 正确答案
#

15. Parallel Replicas 的适用限制,单分片多副本场景?

A 任何表都能用 Parallel Replicas
B 需 ReplicatedMergeTree 且副本同步一致,副本数决定并行度上限 ✓ 正确答案
C 副本越多并行度越高,无限制
D 单分片场景无法并行
#

16. Parallel Replicas 与分布式表的组合,跨分片并行的设计?

A 组合实现「跨分片并行 × 分片内副本并行」的双层并行,最大化查询并行度 ✓ 正确答案
B 两者组合会降低并行度
C 组合不需要配置 cluster
D 分布式表在分片内并行,Parallel Replicas 跨分片并行
#

17. Parallel Replicas 对数据版本(parts 集合)一致性的要求与读取保证

A 要求各副本 parts 集合一致,否则并行读取结果出错,副本同步延迟是正确性关键 ✓ 正确答案
B 各副本 parts 集合可不同
C 副本延迟不影响结果
D 无需协调数据版本