分类分级与数据血缘

共 19 题
#

1. 敏感数据识别(PII、PHI、PCI)的自动扫描?

A 扫描识别出敏感字段后,应打标签并联动权限、脱敏与审计 ✓ 正确答案
B 银行卡号识别应结合 Luhn 校验,CVV 属于可安全展示的字段
C 仅靠正则表达式就能覆盖所有敏感数据类型,无需其他手段
D 扫描只需做一次,后续新增字段无需重新识别
#

2. 数据分类分级(Data Classification)的标准,公开、内部、机密、绝密?

A 机密级数据可向所有员工开放访问
B 分级标签应记录在元数据中,并驱动权限、加密与脱敏策略 ✓ 正确答案
C 数据一旦定级就永久不变,无需评估
D 公开数据意味着可以随意公开任何个人信息
#

3. 数据目录(Data Catalog)的应用,元数据、血缘、术语?

A 数据目录一旦建立就不需要更新
B 数据目录只存技术元数据,不涉及业务信息
C 数据目录是物理存储层,用于保存数据本体
D 数据目录通过统一组织技术元数据、业务术语与血缘,帮助用户找到并信任数据 ✓ 正确答案
#

4. 数据分类分级的工具,Apache Atlas、DataHub、Collibra?

A Apache Atlas 深度集成 Hadoop 生态,以类型系统和血缘为核心 ✓ 正确答案
B Collibra 是开源项目,适合 Hadoop 生态
C DataHub 是商业工具,需要付费购买
D 三者都是纯商业产品,无法开源使用
#

5. OpenMetadata、DataHub 的元数据模型?

A 两者都只支持血缘,不支持属性扩展
B OpenMetadata 基于关系数据库存储,不支持 JSON Schema
C DataHub 以 Aspect 片段为核心且支持版本化,OpenMetadata 采用类型系统与关系模型 ✓ 正确答案
D DataHub 的元数据模型不支持自定义属性
#

6. 元数据管理(Metadata Management),技术元数据、业务元数据?

A 技术元数据描述表结构、字段类型与血缘,业务元数据描述业务术语与数据负责人 ✓ 正确答案
B 业务元数据是系统自动采集的,无需人工维护
C 元数据管理与数据目录无关
D 两者都只能由人工维护
#

7. 数据契约(Data Contract)的应用,生产者-消费者约定?

A 数据契约只能约束消费者,无法约束生产者
B 数据契约只是口头沟通,无需落到文档
C 数据契约将 Schema、质量约束与 SLA 显式化,并通过契约测试自动校验生产端数据 ✓ 正确答案
D 数据契约一旦签订就不可变更
#

8. 数据分级标签如何随血缘自动传播?为什么下游表与报表应继承上游字段的敏感级别,传播规则如何设计?

A 下游不需要继承上游标签,可在出口单独处理
B 传播时应取多个上游字段的最高敏感级别,并允许基于脱敏/聚合的人工降级 ✓ 正确答案
C 敏感标签只能人工打标,无法自动传播
D 传播只适用于表级血缘,字段级血缘无意义
#

9. 血缘如何支撑影响分析(改表前评估下游影响)与问题溯源(上游变更导致下游数据异常)?两类场景对血缘粒度的要求有何不同?

A 两类场景对血缘粒度要求完全相同
B 影响分析只能向上游回溯,问题溯源只能向下游遍历
C 血缘粒度越粗越利于溯源
D 影响分析用于变更前评估下游影响,问题溯源用于故障后定位上游原因,后者更依赖字段级血缘 ✓ 正确答案
#

10. 数据血缘(Data Lineage)的概念,表 → 字段的下游链路?

A 表级血缘粒度粗、易采集,字段级血缘粒度细、更精确,是溯源与影响分析的基础 ✓ 正确答案
B 血缘是单向链表,不能表示多源汇聚
C 血缘只用于数据展示,不参与治理
D 血缘只描述表与表的关系,没有字段级血缘
#

11. Confluent Schema Registry 的兼容性策略,BACKWARD、FORWARD、FULL?

A 三种策略完全等价,无区别
B FULL 只要求向前兼容,不要求向后兼容
C FORWARD 指新旧 Schema 完全不兼容
D BACKWARD 指新 Schema 兼容旧 Schema,面向消费者先升级 ✓ 正确答案
#

12. Schema Registry 的应用,Kafka Avro/Protobuf Schema 版本管理?

A 消息中携带完整 Schema,无需注册表
B 生产者注册 Schema 得到 ID,消息携带 ID,Registry 按兼容性策略做版本管理 ✓ 正确答案
C Schema 一旦上线就不能更新
D Schema Registry 只能用于 Avro,不能用于 Protobuf
#

13. 数据库 Schema 注册表(Database Schema Registry)?

A 它只管理消息队列的 Schema,与数据库无关
B 它集中管理数据库 DDL 与 CDC 变更,版本化并通知下游,避免表结构变化导致消费方崩溃 ✓ 正确答案
C 数据库 Schema 一旦变更就无法同步
D 它只存 Schema 定义,不参与版本管理
#

14. Schema Registry 在消息队列与流处理中的应用,如何校验生产者与消费者的 Schema 兼容性,Avro/Protobuf 的演进策略如何设计?

A 兼容性校验发生在消费时,不兼容时才报错
B Avro 与 Protobuf 的演进规则完全相同
C 演进时新增字段应带默认值或设为可选,删除字段要谨慎,field number 不可复用 ✓ 正确答案
D 生产者可以随意修改 Schema,无需校验
#

15. Schema Registry 的实现要点,Schema 的存储、版本管理与缓存如何设计,注册表不可用时对生产消费链路的影响?

A 版本管理只保留最新版本
B Schema 存储无需去重,可重复注册
C 客户端本地缓存可缓解 Registry 不可用,但未缓存的新 Schema 无法解析,因此 Registry 需高可用 ✓ 正确答案
D Registry 不可用时对生产链路完全没有影响
#

16. Schema 演化的版本控制?

A 版本控制只记录最新版本,不保留历史
B Schema 不应当支持版本控制
C 每次变更递增版本号并留存历史,结合兼容性策略校验,支持按版本消费与回退 ✓ 正确答案
D 版本控制与下游消费无关
#

17. 字段级血缘为什么比表级血缘难?表达式改写、视图嵌套、函数处理会导致哪些解析误差?

A 表达式改写、视图嵌套与函数处理会带来漏报或误报,因此在解析精度上比表级血缘更难 ✓ 正确答案
B 解析 SQL 语法树即可 100% 准确获得字段级血缘
C 字段级血缘与表级血缘难度相当
D 通配符、聚合不会影响字段依赖判断
#

18. 分类分级结果如何联动数据库权限与动态脱敏?标签驱动的访问控制如何落地?

A 用策略引擎依据"用户角色+数据标签+操作"输出允许/遮盖/拒绝,实现标签驱动的访问控制 ✓ 正确答案
B 分级标签与权限、脱敏完全独立
C 动态脱敏只能靠人工在每个查询中处理
D 分级结果只用于文档展示,不参与执行
#

19. 数据血缘的采集方式,SQL 解析、执行计划观测与 ETL 工具元数据三种方案的覆盖度与成本?

A SQL 解析对动态 SQL 解析最准确
B 执行计划观测可以覆盖所有非 SQL 场景
C 三种方式完全等价,可任选其一
D SQL 解析覆盖度高但依赖方言,执行计划观测最真实但覆盖有限,ETL 元数据成本低但易为表级 ✓ 正确答案