# 1. On-call 与日常工作的平衡中值班后恢复时间(comp time)与值班期间非紧急工单的优先级处理 A 值班被唤醒不需补偿,属于正常工作 B 值班期间应优先处理紧急事件,非紧急工单记录待办,值班后处理 ✓ 正确答案 C 值班期间应同时处理所有工单,不容拖延 D 值班负担无需轮换公平
# 2. SLA 与 SLO 的关系是什么,即 SLA 合同中的可用性承诺如何定义、度量与违约处理? A SLA 是对外合同承诺,SLO 是内部目标,SLA 目标通常比 SLO 宽松以留余量 ✓ 正确答案 B SLA 与 SLO 是同一概念,目标值必须一致 C SLA 无需度量,只需口头承诺 D SLA 违约无需任何处理
# 3. SLA 合同中如何约定数据安全与隐私合规责任(如个人信息保护要求)? A SLA 无需涉及数据安全与隐私 B 数据安全责任完全由客户承担 C SLA 应明确数据加密、访问控制、安全事件报告与隐私法规(如 GDPR/PIPL)合规责任 ✓ 正确答案 D 数据泄露无需任何合同责任
# 4. 业务连续性管理(如 ISO 22301)中,SLA 如何与 RTO/RPO 等容灾目标衔接? A SLA 只承诺可用性,无需关注 RTO/RPO B RTO 指恢复时间目标、RPO 指恢复点目标,应纳入 SLA 的连续性承诺并靠演练验证 ✓ 正确答案 C RPO 指恢复时间目标 D RTO/RPO 与业务连续性管理无关
# 5. 什么是告警疲劳(alert fatigue)?如何通过告警治理(合并、抑制、阈值调优、无用告警下线)降低值班噪音 A 告警越多越安全,应尽量多设告警 B 告警治理只需增加告警数量 C 告警疲劳无法避免 D 告警疲劳指告警过多导致值班人员麻木,可通过合并、抑制、阈值调优与无用告警下线治理 ✓ 正确答案
# 6. 值班交接(handoff)应包含的关键信息中未恢复告警、正在进行的变更、已知异常与待跟进事项 A 交接只需口头说明,无需记录 B 交接信息无需可追溯 C 交接应包含未恢复告警、进行中变更、已知异常与待跟进事项等关键信息 ✓ 正确答案 D 交接与值班连续性无关
# 7. 告警体系如何形成反馈闭环,即从触发、响应、处置到规则优化的持续改进循环? A 告警规则一旦设置就无需调整 B 告警处置结果不应影响规则 C 告警体系应形成「触发→响应→处置→复盘→规则优化」的持续改进闭环 ✓ 正确答案 D 反馈闭环只需关注告警触发
# 8. 告警如何实现 alert correlation(关联分析)? A 关联分析无法用于根因定位 B 关联分析只按时间维度,其他维度无意义 C 关联分析会增加告警数量 D 关联分析是把同根因的多条告警归并,减少告警风暴并辅助根因定位 ✓ 正确答案
# 9. 告警如何实现 alert 自动化? A 告警自动化会让系统更危险,应避免 B 自动化只能处理通知,不能处理处置 C 告警自动化覆盖自动触发、通知、处置与关闭,自愈优先用于低风险可逆场景 ✓ 正确答案 D 自动化处置无需任何门禁或验证
# 10. 告警如何实现 audit(审计)? A 告警审计应记录触发、响应、处置、结果等全生命周期信息,并保留供追溯与合规 ✓ 正确答案 B 告警审计无需记录触发与处置信息 C 告警规则变更无需审计 D 审计记录可以随意篡改
# 11. 告警策略(policy)应包含的内容中触发条件、分级、路由与处理规则如何定义? A 告警策略只需定义触发条件,无需分级与路由 B 每条告警无需可行动性 C 告警策略应包括触发条件、分级、路由、处理规则与抑制去重等 ✓ 正确答案 D 告警策略一旦定义就不可修改
# 12. 如何设计慢燃尽(slow burn)告警,即长时间小幅消耗错误预算时如何及时预警? A 慢燃尽告警应立即 page 值班 B 慢燃尽告警用长窗口观察 1x 燃烧率,用低优先级通知预警 ✓ 正确答案 C 慢燃尽场景无需监控 D 慢燃尽告警只关注瞬时错误率
# 13. 7x24 全天候值班的响应流程如何设计,即从告警触达、确认、处置到升级与交接? A 响应流程应包含触达、确认、处置、升级与交接,并设明确时限与升级链 ✓ 正确答案 B 响应流程只需触达,无需确认与升级 C 值班无需确认即可视为已处理 D 升级链只在恢复后触发
# 14. MTTA/MTTR 统计与告警质量持续改进中 MTTA(确认时间)与 MTTR(恢复时间)的采集、分位数统计与趋势分析 A MTTA 指恢复时间,MTTR 指确认时间 B MTTA/MTTR 无需趋势分析 C 均值比分位数更能反映真实分布 D MTTA/MTTR 应用分位数统计并做趋势分析,以持续改进响应质量 ✓ 正确答案
# 15. On-Call 值班如何满足 on-call SLA(响应时限)? A on-call SLA 只需定义,无需工具保障 B 未按时 ack 无需升级 C 满足 on-call SLA 靠自动化触达、升级链兜底、双岗备份与达标率考核 ✓ 正确答案 D on-call SLA 时限应尽量收紧,无需考虑可达性
# 16. On-Call 轮换的设计中班次长度、时区覆盖、交接流程与负载均衡(公平性)如何实现 A 轮换应平衡班次长度、时区覆盖、交接与负载均衡,用值班数据保障公平 ✓ 正确答案 B 轮换只需保证有人值班,无需公平 C 多时区团队应让所有人夜间值班 D 轮换无需交接流程
# 17. 值班制度文档化中 runbook 质量、升级路径、常见场景处理 SOP 的持续维护机制 A runbook 应可执行、与告警关联,并通过复盘与演练持续维护 ✓ 正确答案 B runbook 只需写一次,无需更新 C 升级路径无需写成文档 D 值班文档与演练无关
# 18. 值班负担不均的识别与修正中通过值班数据发现「总是同一人扛」的问题并调整轮换策略 A 可通过被唤醒次数等值班数据识别「总是同一人扛」,并调整轮换与补偿 ✓ 正确答案 B 值班负担不均无法识别 C 值班负担应与个人无关,无需统计 D 轮换策略无需因负担数据调整
# 19. 告警分级(P1-P4)标准制定中影响范围、紧急程度、响应时限、升级路径的明确定义 A 分级只影响通知渠道,不影响响应 B 所有告警都应是 P1 C 告警分级应基于影响范围与紧急程度,明确各等级响应时限与升级路径 ✓ 正确答案 D 分级标准无需一致
# 20. 告警去重(dedup)的实现中按指纹/标签合并、事件窗口与恢复事件如何关联 A 去重会丢失所有信息,应避免 B 去重应按指纹/标签合并,并让恢复事件自动关闭同组告警 ✓ 正确答案 C 去重与恢复事件无关 D 去重粒度越粗越好,无需考虑根因
# 21. 告警疲劳与告警噪音的量化度量中告警响应率、误报率、告警/事件比与值班人员主观噪音评分 A 告警噪音无法量化 B 告警/事件比越大说明告警越精准 C 误报率越高说明告警越有价值 D 可用响应率、误报率、告警/事件比与值班主观评分综合量化告警噪音 ✓ 正确答案
# 22. 如何度量 On-call 健康度,即每班被叫醒次数、MTTA 分布、夜间打断次数与值班后补休落实率 A 可用每班被叫醒次数、MTTA 分布、夜间打断与补休落实率等度量健康度 ✓ 正确答案 B On-call 健康度无需度量 C 夜间打断次数不影响健康度 D 补休落实率与健康度无关
# 23. 如何设计 On-call 轮换机制以平衡覆盖率与值班负担,即 primary/secondary 双岗、轮值周期、值班人数与频率的计算 A 只需一人全年值班即可覆盖 B 用 primary/secondary 双岗、合理轮值周期与人数计算平衡覆盖率与负担 ✓ 正确答案 C 双岗会降低响应可靠性 D 轮换频率与告警量无关
# 24. 新人上值的 shadow/reverse-shadow 培训机制中 shadow 观察、reverse-shadow 被观察到独立上值的阶段设计 A 新人应直接独立上值,无需培训 B reverse-shadow 阶段新人无需监督 C 培训分 shadow 观察、reverse-shadow 被观察与独立上值三阶段,并设评估与求助通道 ✓ 正确答案 D 独立上值无需任何准入条件
# 25. 如何在 PagerDuty/Opsgenie 等值班工具中配置 on-call 流程,即排班、通知与升级如何落地? A 只需配置通知渠道即可 B 需配置排班(rotation)、通知与升级策略(escalation policy),实现自动路由与超时升级 ✓ 正确答案 C 升级策略无需配置时限 D 排班与通知互不影响