# 1. 数据库自治(Autonomous Database)的核心理念,利用 AI/ML 实现自调优、自修复、自安全? A 自治数据库主要通过 AI/ML 实现自调优、自修复、自安全,并形成感知-决策-执行的闭环 ✓ 正确答案 B 自治数据库只负责自动打补丁,不涉及查询优化 C 自治数据库完全取代 DBA,无需任何人工参与 D 自治数据库与普通数据库在性能上没有任何差异
# 2. AI 索引推荐的工作原理,基于工作负载分析、强化学习或遗传算法自动推荐最优索引? A 索引推荐只需枚举所有单列索引即可得到最优解 B 索引越多查询越快,因此推荐时应尽量多建索引 C 虚拟索引(what-if)技术可以在不真正建索引的情况下估算查询收益 ✓ 正确答案 D 强化学习无法用于索引组合搜索
# 3. 智能查询优化器(Learned Optimizer),用深度学习模型替代传统代价模型估算行数与选择率? A 它完全用深度学习取代了所有传统查询优化技术 B 学习型优化器不需要任何历史执行数据 C 深度学习模型对数据分布漂移不敏感,无需重训 D 它主要用 ML 模型学习查询特征到行数/选择率的映射,以弥补传统直方图与独立性假设的误差 ✓ 正确答案
# 4. Learned Index(学习型索引)的原理,用神经网络/回归模型拟合 CDF 替代 B-Tree 内部节点?Google 的 RMI(Recursive Model Index)与 ALEX(Adaptive Learned Index)如何在写密集场景处理插入与模型更新? A ALEX 对写密集场景采用每次插入都全局重建模型的方式 B 学习型索引完全不需要局部搜索,预测即精确 C 它用模型拟合键的 CDF 来预测位置,再配合局部搜索定位,可替代 B-Tree 内部节点 ✓ 正确答案 D RMI 专为高效处理大量随机插入而设计
# 5. Learned Query Optimizer(学习型查询优化器),Bao(基于强化学习的 hint 选择)、Lero(pairwise 比较学习)如何用 ML 模型补充或替代传统 CBO 的基数估算?训练数据(query plan + latency)如何收集? A 两者都直接学习查询到基数的精确映射 B 两者都不需要任何真实执行反馈 C Bao 用强化学习选择 hint 组合,Lero 用 pairwise 比较学习计划优劣,训练数据来自执行计划与实际延迟 ✓ 正确答案 D Lero 与 Bao 的实现方式完全相同
# 6. AI 驱动的连接池与资源调度,基于负载预测(LSTM/Prophet)动态调整连接池大小、读写分离权重与资源组配额的实践? A 它用静态配置固定连接池大小,无需预测 B 资源配额调整无需考虑业务优先级 C LSTM 只能用于图像识别,无法用于时序预测 D 它基于时序模型预测负载,据此动态调整连接池、读写权重与资源配额 ✓ 正确答案
# 7. AI 驱动的参数调优(Auto-Tuning),如何根据负载特征自动调整数据库参数(如 work_mem、buffer pool)? A 参数调优只需调节单个参数即可达到最优 B 贝叶斯优化无法用于参数调优 C 参数之间相互独立,无需联合优化 D 它基于负载特征在参数空间搜索最优配置,并采用小步验证与回滚机制 ✓ 正确答案
# 8. AI 在数据库安全中的应用,异常行为检测、SQL 注入智能识别、敏感数据自动分类? A AI 可用于异常行为检测、SQL 注入识别与敏感数据自动分类,并需结合业务定制降低误报 ✓ 正确答案 B 异常行为检测只需静态规则即可覆盖所有攻击 C SQL 注入识别不需要分析 SQL 语句结构 D 敏感数据分类只能靠人工完成
# 9. 数据库智能助手(DBA Copilot),利用 LLM 辅助慢查询优化、索引建议与故障诊断? A LLM 生成的优化建议无需任何工具验证即可直接执行 B Copilot 不使用任何数据库元数据 C Copilot 只能做慢查询优化,不能做故障诊断 D Copilot 通过 tool-use 获取真实统计与执行计划,再结合 LLM 生成建议,并需人机验证避免幻觉 ✓ 正确答案
# 10. 主流数据库的 AI 能力对比,Oracle Autonomous Database、阿里云 POLARDB AI、openGauss AI? A 三个数据库的 AI 能力完全相同 B openGauss 是闭源数据库 C Oracle 强调企业级自治与安全,POLARDB 强调云原生 AI 生态,openGauss 强调开源开放与内核融合 ✓ 正确答案 D POLARDB 无法提供索引推荐能力
# 11. 预测性维护(Predictive Maintenance),利用时序分析预测磁盘故障、容量瓶颈与性能劣化? A 它只在故障发生后进行修复 B 预测性维护无法预测磁盘故障 C 它利用 SMART 等时序指标与 ML 预测磁盘故障、容量瓶颈与性能劣化,提前触发维护 ✓ 正确答案 D 容量预测不需要任何历史数据
# 12. Learned Cardinality Estimation,用深度神经网络(MSCN、NeuroCard)替代直方图+独立性假设估算多表 JOIN 基数,在数据分布漂移时如何增量重训练? A 它仍依赖独立性假设 B MSCN 与 NeuroCard 用深度神经网络学习多表联合分布,并在数据漂移时通过执行反馈触发增量重训 ✓ 正确答案 C 学习型基数估计对数据分布变化不敏感 D NeuroCard 只能估算单表基数
# 13. AI 驱动的慢查询根因分析,结合执行计划树、系统指标(CPU/IO/锁等待)与历史基线,自动定位性能退化原因并推荐修复动作? A 只查看执行计划即可定位所有根因 B 锁等待与计划劣化不可能同时存在 C 历史基线对根因分析没有帮助 D 它整合执行计划、系统指标与历史基线,关联定位根因并推荐修复动作 ✓ 正确答案
# 14. 数据库异常检测(Anomaly Detection),基于时序模型(Isolation Forest、Transformer)检测 QPS/延迟/错误率的突变,触发自动扩容或告警? A 它用统计基线、Isolation Forest、Transformer 等模型识别指标突变,并结合多指标与业务基线降低误报 ✓ 正确答案 B 只需设定固定阈值即可检测所有异常 C QPS 突然上升必然是故障 D Transformer 无法用于时序异常检测
# 15. 自然语言转 SQL(Text-to-SQL/NL2SQL)的技术演进,从规则匹配到 LLM 生成? A 演进路径是从规则模板、监督学习到 LLM 生成,LLM 提升了泛化与交互能力但仍有幻觉风险 ✓ 正确答案 B 规则匹配阶段能处理任意复杂查询 C LLM 生成 SQL 不需要数据库 schema D 监督学习阶段不需要标注数据
# 16. AI4DB 的局限性,模型训练成本、冷启动问题与可解释性挑战? A 深度学习模型训练成本低且无需历史数据 B 可解释性对数据库运维并不重要 C 模型对数据分布漂移不敏感 D 它面临训练成本、冷启动与可解释性等挑战,实践中常采用 ML 推荐+规则兜底+人工验证的混合模式 ✓ 正确答案
# 17. AI 驱动的数据分区与布局优化,根据查询模式自动选择分区键、排序键与数据放置策略(hot/cold tiering)? A 分区键应固定不变,无需考虑查询模式 B 排序键与查询谓词无关 C 冷热分层无法降低存储成本 D 它根据查询模式自动选择分区键、排序键,并按访问热度做 hot/cold 分层放置 ✓ 正确答案
# 18. AI4DB 与 DB4AI 的边界,AI 优化数据库内核(AI4DB)vs 数据库内置 ML 推理能力(DB4AI,如 BigQuery ML、PostgreSQL MADlib)的区别与融合趋势? A 两者含义完全相同 B MADlib 是用于优化数据库内核的工具 C BigQuery ML 属于 AI4DB D AI4DB 用 AI 优化数据库内核,DB4AI 在数据库内提供 ML 能力,两者正走向融合 ✓ 正确答案