AI 智能数据库(AI4DB)

共 18 题
#

1. 数据库自治(Autonomous Database)的核心理念,利用 AI/ML 实现自调优、自修复、自安全?

A 自治数据库主要通过 AI/ML 实现自调优、自修复、自安全,并形成感知-决策-执行的闭环 ✓ 正确答案
B 自治数据库只负责自动打补丁,不涉及查询优化
C 自治数据库完全取代 DBA,无需任何人工参与
D 自治数据库与普通数据库在性能上没有任何差异
#

2. AI 索引推荐的工作原理,基于工作负载分析、强化学习或遗传算法自动推荐最优索引?

A 索引推荐只需枚举所有单列索引即可得到最优解
B 索引越多查询越快,因此推荐时应尽量多建索引
C 虚拟索引(what-if)技术可以在不真正建索引的情况下估算查询收益 ✓ 正确答案
D 强化学习无法用于索引组合搜索
#

3. 智能查询优化器(Learned Optimizer),用深度学习模型替代传统代价模型估算行数与选择率?

A 它完全用深度学习取代了所有传统查询优化技术
B 学习型优化器不需要任何历史执行数据
C 深度学习模型对数据分布漂移不敏感,无需重训
D 它主要用 ML 模型学习查询特征到行数/选择率的映射,以弥补传统直方图与独立性假设的误差 ✓ 正确答案
#

4. Learned Index(学习型索引)的原理,用神经网络/回归模型拟合 CDF 替代 B-Tree 内部节点?Google 的 RMI(Recursive Model Index)与 ALEX(Adaptive Learned Index)如何在写密集场景处理插入与模型更新?

A ALEX 对写密集场景采用每次插入都全局重建模型的方式
B 学习型索引完全不需要局部搜索,预测即精确
C 它用模型拟合键的 CDF 来预测位置,再配合局部搜索定位,可替代 B-Tree 内部节点 ✓ 正确答案
D RMI 专为高效处理大量随机插入而设计
#

5. Learned Query Optimizer(学习型查询优化器),Bao(基于强化学习的 hint 选择)、Lero(pairwise 比较学习)如何用 ML 模型补充或替代传统 CBO 的基数估算?训练数据(query plan + latency)如何收集?

A 两者都直接学习查询到基数的精确映射
B 两者都不需要任何真实执行反馈
C Bao 用强化学习选择 hint 组合,Lero 用 pairwise 比较学习计划优劣,训练数据来自执行计划与实际延迟 ✓ 正确答案
D Lero 与 Bao 的实现方式完全相同
#

6. AI 驱动的连接池与资源调度,基于负载预测(LSTM/Prophet)动态调整连接池大小、读写分离权重与资源组配额的实践?

A 它用静态配置固定连接池大小,无需预测
B 资源配额调整无需考虑业务优先级
C LSTM 只能用于图像识别,无法用于时序预测
D 它基于时序模型预测负载,据此动态调整连接池、读写权重与资源配额 ✓ 正确答案
#

7. AI 驱动的参数调优(Auto-Tuning),如何根据负载特征自动调整数据库参数(如 work_mem、buffer pool)?

A 参数调优只需调节单个参数即可达到最优
B 贝叶斯优化无法用于参数调优
C 参数之间相互独立,无需联合优化
D 它基于负载特征在参数空间搜索最优配置,并采用小步验证与回滚机制 ✓ 正确答案
#

8. AI 在数据库安全中的应用,异常行为检测、SQL 注入智能识别、敏感数据自动分类?

A AI 可用于异常行为检测、SQL 注入识别与敏感数据自动分类,并需结合业务定制降低误报 ✓ 正确答案
B 异常行为检测只需静态规则即可覆盖所有攻击
C SQL 注入识别不需要分析 SQL 语句结构
D 敏感数据分类只能靠人工完成
#

9. 数据库智能助手(DBA Copilot),利用 LLM 辅助慢查询优化、索引建议与故障诊断?

A LLM 生成的优化建议无需任何工具验证即可直接执行
B Copilot 不使用任何数据库元数据
C Copilot 只能做慢查询优化,不能做故障诊断
D Copilot 通过 tool-use 获取真实统计与执行计划,再结合 LLM 生成建议,并需人机验证避免幻觉 ✓ 正确答案
#

10. 主流数据库的 AI 能力对比,Oracle Autonomous Database、阿里云 POLARDB AI、openGauss AI?

A 三个数据库的 AI 能力完全相同
B openGauss 是闭源数据库
C Oracle 强调企业级自治与安全,POLARDB 强调云原生 AI 生态,openGauss 强调开源开放与内核融合 ✓ 正确答案
D POLARDB 无法提供索引推荐能力
#

11. 预测性维护(Predictive Maintenance),利用时序分析预测磁盘故障、容量瓶颈与性能劣化?

A 它只在故障发生后进行修复
B 预测性维护无法预测磁盘故障
C 它利用 SMART 等时序指标与 ML 预测磁盘故障、容量瓶颈与性能劣化,提前触发维护 ✓ 正确答案
D 容量预测不需要任何历史数据
#

12. Learned Cardinality Estimation,用深度神经网络(MSCN、NeuroCard)替代直方图+独立性假设估算多表 JOIN 基数,在数据分布漂移时如何增量重训练?

A 它仍依赖独立性假设
B MSCN 与 NeuroCard 用深度神经网络学习多表联合分布,并在数据漂移时通过执行反馈触发增量重训 ✓ 正确答案
C 学习型基数估计对数据分布变化不敏感
D NeuroCard 只能估算单表基数
#

13. AI 驱动的慢查询根因分析,结合执行计划树、系统指标(CPU/IO/锁等待)与历史基线,自动定位性能退化原因并推荐修复动作?

A 只查看执行计划即可定位所有根因
B 锁等待与计划劣化不可能同时存在
C 历史基线对根因分析没有帮助
D 它整合执行计划、系统指标与历史基线,关联定位根因并推荐修复动作 ✓ 正确答案
#

14. 数据库异常检测(Anomaly Detection),基于时序模型(Isolation Forest、Transformer)检测 QPS/延迟/错误率的突变,触发自动扩容或告警?

A 它用统计基线、Isolation Forest、Transformer 等模型识别指标突变,并结合多指标与业务基线降低误报 ✓ 正确答案
B 只需设定固定阈值即可检测所有异常
C QPS 突然上升必然是故障
D Transformer 无法用于时序异常检测
#

15. 自然语言转 SQL(Text-to-SQL/NL2SQL)的技术演进,从规则匹配到 LLM 生成?

A 演进路径是从规则模板、监督学习到 LLM 生成,LLM 提升了泛化与交互能力但仍有幻觉风险 ✓ 正确答案
B 规则匹配阶段能处理任意复杂查询
C LLM 生成 SQL 不需要数据库 schema
D 监督学习阶段不需要标注数据
#

16. AI4DB 的局限性,模型训练成本、冷启动问题与可解释性挑战?

A 深度学习模型训练成本低且无需历史数据
B 可解释性对数据库运维并不重要
C 模型对数据分布漂移不敏感
D 它面临训练成本、冷启动与可解释性等挑战,实践中常采用 ML 推荐+规则兜底+人工验证的混合模式 ✓ 正确答案
#

17. AI 驱动的数据分区与布局优化,根据查询模式自动选择分区键、排序键与数据放置策略(hot/cold tiering)?

A 分区键应固定不变,无需考虑查询模式
B 排序键与查询谓词无关
C 冷热分层无法降低存储成本
D 它根据查询模式自动选择分区键、排序键,并按访问热度做 hot/cold 分层放置 ✓ 正确答案
#

18. AI4DB 与 DB4AI 的边界,AI 优化数据库内核(AI4DB)vs 数据库内置 ML 推理能力(DB4AI,如 BigQuery ML、PostgreSQL MADlib)的区别与融合趋势?

A 两者含义完全相同
B MADlib 是用于优化数据库内核的工具
C BigQuery ML 属于 AI4DB
D AI4DB 用 AI 优化数据库内核,DB4AI 在数据库内提供 ML 能力,两者正走向融合 ✓ 正确答案