# 1. 数据质量六维度(完整性/唯一性/及时性/有效性/准确性/一致性)如何落地为可执行规则? A 六维度是抽象概念,无法落地 B 只需监控完整性即可 C 应将完整性、唯一性、及时性、有效性、准确性、一致性分别转化为可执行 SQL 检测规则与阈值,由质量平台执行并告警 ✓ 正确答案 D 数据质量规则无法复用
# 2. 批流一体架构下,实时链路与离线链路的结果对账(Reconciliation)如何设计? A 实时与离线结果必然完全一致 B 实时与离线无需对账 C 应统一口径与时间窗口,设计 T+0 准实时与 T+1 全量对账,定义误差容忍并对超出差异告警定位 ✓ 正确答案 D 误差容忍会导致误报
# 3. 数据质量监控的告警分级与修复闭环,质量事故响应流程如何与数据血缘联动 A 所有告警都同等处理 B 应按严重度分级告警,通过血缘定位上游根因与下游影响,形成告警→定位→修复→验证→关闭的闭环 ✓ 正确答案 C 告警后无需修复闭环 D 血缘与事故响应无关
# 4. 数据湖(Iceberg/Hudi/Delta)的 ACID 特性如何测试,并发写入、时间旅行与回滚? A 应验证并发写入的冲突检测与一致性、时间旅行读取历史快照、回滚恢复指定版本,确保 ACID 语义正确 ✓ 正确答案 B 并发写同一表一定损坏数据 C 时间旅行无法读取历史 D 回滚会损坏数据
# 5. 如何用数据质量平台(Great Expectations/dbt test)实现"质量规则即代码"? A 质量规则只能手工维护 B 用 Great Expectations 的 Expectation 或 dbt test 将规则声明为代码,纳入版本管理与 CI 自动执行,实现可追溯可复用 ✓ 正确答案 C dbt test 无法自定义规则 D 质量规则无法纳入 CI
# 6. 埋点数据的质量测试,字段缺失率、重复上报、采样偏差如何纳入监控? A 只需监控埋点数量 B 应监控关键字段缺失率、重复上报率与采样偏差,设阈值告警,验证埋点数据完整、不重复、样本无偏 ✓ 正确答案 C 重复上报不影响统计分析 D 采样偏差无需监控
# 7. 数据对账的机制,行数对账、金额汇总对账、抽样比对(全量 vs 抽样)各自的适用场景与代价? A 全量比对总是优于抽样比对 B 行数与金额对账快速低成本、抽样与全量比对深度高成本,应按数据重要性选择对账深度,权衡覆盖率与代价 ✓ 正确答案 C 抽样比对不会漏测 D 行数对账能发现字段级错误
# 8. 湖仓一体的数据一致性测试,数据湖与数仓之间同步延迟、重复与丢失的验证方法 A 应验证同步延迟满足 SLA,通过主键差集与行数对账验证数仓无重复无丢失,并验证同步断点续传 ✓ 正确答案 B 湖与仓的数据必然一致 C 同步延迟无需监控 D 同步重复不影响数据
# 9. 数据湖表格式的 Schema 演进测试,列新增、删除、类型变更与分区结构变化对历史数据读取和下游消费的影响如何验证? A 列类型变更不影响历史数据读取 B 分区结构变化无需验证 C 列删除后历史数据不可读是正常的 D 应验证列新增/删除/类型变更与分区结构变化后,历史数据仍可读、下游消费兼容,保证演进向后兼容 ✓ 正确答案
# 10. 数据湖压缩与文件治理测试,小文件合并策略对查询性能与并发写入冲突的影响如何验证,压缩失败如何回滚? A 压缩必然提升查询性能 B 应对比压缩前后查询性能、验证压缩与并发写入的冲突检测、压缩失败能回滚且数据完整,确保治理安全可靠 ✓ 正确答案 C 压缩失败无需回滚 D 压缩与并发写入无冲突
# 11. 数据脱敏规则如何做测试,确保脱敏后数据不可逆且业务可用? A 脱敏只保证不可逆即可 B 应验证脱敏算法不可逆、脱敏后数据保持业务可用(类型/分布/关联)且一致,兼顾安全与可用 ✓ 正确答案 C 可逆加密不是脱敏 D 脱敏后无需保持关联关系
# 12. 实时对账与离线对账的差异,T+0 准实时核对与 T+1 全量核对的机制与误差容忍? A T+0 准实时快速但需容忍数据未落齐的误差,T+1 全量精确但滞后,两者结合实现快速感知与精确核对 ✓ 正确答案 B T+0 与 T+1 对账机制相同 C T+1 对账允许巨大误差 D T+0 对账结果总能精确
# 13. 数据质量监控的误报治理,规则阈值调优、告警去重与回归验证? A 应基于历史分布调优阈值、对重复告警去重合并,并用真实问题样本回归验证,平衡精确率与召回率 ✓ 正确答案 B 阈值越紧越好,误报无所谓 C 告警去重会漏掉真实问题 D 阈值调优无需回归验证
# 14. 湖仓一体的数据新鲜度监控,数据湖与数仓同步延迟的 SLA 如何度量? A 数据新鲜度只需看离线任务完成即可 B 同步延迟无需 SLA C 实时链路延迟无法度量 D 应度量数据产生到湖/仓可用的同步延迟,按表定义 SLA,监控延迟分布与达成率并超阈值告警 ✓ 正确答案
# 15. 数据质量团队与测试团队的职责划分,规则建设、监控运维与发布验证如何协同? A 质量团队负责规则建设与监控运维,测试团队负责发布验证,通过共享规则库与流程协同,质量规则作为测试验收标准 ✓ 正确答案 B 质量规则与测试无关 C 发布验证无需质量团队配合 D 两个团队职责完全重叠
# 16. 对账失败的自动化处置,告警、阻断发布、自动重跑与人工复核的流程设计? A 自动重跑无需验证 B 所有对账失败都必须人工复核 C 对账失败无需阻断发布 D 应分级处置:告警通知、关键失败阻断发布、可恢复失败自动重跑、复杂问题人工复核,形成自动为主人工兜底的闭环 ✓ 正确答案
# 17. 数据质量基线的建立,如何基于历史数据分布设定规则阈值与异常判定? A 阈值应固定,不随数据变化 B 应基于历史数据分布计算均值/分位数/标准差设定阈值,结合业务规则与季节校准基线,用样本评估误报与漏报 ✓ 正确答案 C 历史分布无法用于设阈值 D 基线无需随数据更新
# 18. 数据血缘在质量事故定位中的应用,问题表的上游依赖与影响下游如何快速圈定? A 通过预构建血缘,向上回溯定位根因、向下推导圈定受影响下游,快速生成影响明细并精准修复 ✓ 正确答案 B 血缘与事故定位无关 C 血缘只能定位上游,无法判断下游影响 D 定位后只能全量重刷
# 19. 对账的口径差异治理,源系统与目标系统的统计口径(含税、去重规则)不一致导致的对账差异如何识别与解决? A 源目标口径不同时对账一定失败 B 口径差异无法识别 C 应识别差异是否为口径因素(含税/去重/时间),建立口径映射归一化后比对,并用口径字典统一口径避免误报 ✓ 正确答案 D 对账差异总是数据 bug