智能告警、AIOps 与事故响应流程

共 21 题
#

1. Grafana OnCall 的 rotation 与 override 配置中内部集成 Grafana Alerting 的优势与 webhook 对接外部系统的限制

A webhook 对接无需做格式映射
B override 配置无需复审
C native 集成 Grafana Alerting 比 webhook 对接外部系统更简单、上下文更完整 ✓ 正确答案
D rotation 只能按天配置
#

2. 事件驱动架构下的智能告警如何工作,即事件如何采集、关联并转化为可处置的告警?

A 智能告警只需采集即可,无需关联
B 事件无需统一接入总线
C 事件驱动告警通过采集、关联、决策把海量事件转化为少数可处置的高价值告警 ✓ 正确答案
D 关联分析只会增加告警数量
#

3. 告警未 ack 时的自动升级链如何设计,即 5 分钟未 ack 升上级、15 分钟升部门负责人、30 分钟升管理层

A 升级链只需一层,无需分层
B ack 后仍应继续升级
C 升级链按时限逐层递进(如 5 分钟→15 分钟→30 分钟),直到有人 ack,ack 后停止升级 ✓ 正确答案
D 升级链时限无需差异化
#

4. 告警通知渠道(电话/短信/IM webhook/邮件)如何按严重度分级触达,即 P0 电话加短信、P1 IM 加短信、P2 仅 IM、P3 工单

A 所有告警都应用电话触达
B 低优告警也应立即电话
C 按严重度分级触达:P0 电话+短信、P1 IM+短信、P2 IM、P3 工单 ✓ 正确答案
D 通知渠道与严重度无关
#

5. 智能告警助手(告警 Copilot)如何辅助值班人员,即告警摘要、根因分析与处置建议如何生成?

A Copilot 只能做摘要,不能做根因
B Copilot 用 LLM 结合指标/日志/trace/历史事件生成摘要、根因与处置建议,并强调可解释与证据 ✓ 正确答案
C Copilot 的建议无需人工确认即可自动执行
D Copilot 与值班工作流无关
#

6. 智能告警如何用 DBSCAN 做告警聚类?

A DBSCAN 基于密度聚类、无需指定簇数、能识别噪声,适合把相近告警聚为一组 ✓ 正确答案
B DBSCAN 需要预先指定簇数
C DBSCAN 只能识别球状簇
D DBSCAN 无法处理告警去重
#

7. 智能告警如何用 LLM 做告警分析与降噪?

A LLM 用语义理解做告警摘要、去重、分类与根因推理,但需规则兜底与证据约束防幻觉 ✓ 正确答案
B LLM 只能做规则匹配,无法做语义分析
C LLM 降噪无需人工复核
D LLM 一定比规则引擎更准确
#

8. PagerDuty 与 Opsgenie 在排班(rotation)与升级策略(escalation policy)上的差异中多层级升级、on-call handoff 与 override 机制

A 两者都没有 override 机制
B PagerDuty 不支持 on-call handoff
C 两者只能做单级升级
D PagerDuty 的 schedule 采用 layer 概念、escalation 编排更细,Opsgenie 更易用且与 Atlassian 集成好 ✓ 正确答案
#

9. PagerDuty 的 Event Rules 与 Alert Grouping 在降噪中的作用,即如何避免同一根因触发数百条告警

A Event Rules 用于丢弃所有告警
B Event Rules 做事件过滤/路由/抑制,Alert Grouping 把同根因告警合并为一条 incident,避免风暴 ✓ 正确答案
C Alert Grouping 会增加通知数量
D 降噪后可以不保留影响范围信息
#

10. 事故分级(sev1-sev4)标准的制定依据与示例

A 事故分级只依据事故数量
B 分级标准无需量化
C 所有事故都应定级为 sev1
D 分级依据影响范围、严重程度、数据/资金安全与恢复紧迫性,决定响应资源与升级路径 ✓ 正确答案
#

11. 事故响应如何度量 incident 的 MTTT?

A MTTT 指事故恢复时间
B MTTT 无法采集
C MTTT 与 MTTR 是同一概念
D MTTT 指从事故发生到完成分诊的时间,度量响应效率 ✓ 正确答案
#

12. 事故响应流程如何组织,即从发现、分级、指挥、处置到恢复与复盘的完整链路?

A 事故响应只需处置,无需复盘
B 复盘与改进无关
C 指挥与执行应合一
D 完整链路含发现、分级、指挥、处置、恢复与复盘,强调指挥分工与先止血后根治 ✓ 正确答案
#

13. 事故指挥官/沟通官/记录官等 ICS 角色分工

A ICS 通过指挥官、沟通官、记录官、执行等角色分工,实现决策、执行、沟通、记录分离 ✓ 正确答案
B 事故处置应全部由一人完成
C 记录官无需记录时间线
D 沟通官负责直接修复
#

14. 值班工具与 ChatOps/IM(Slack/钉钉/飞书)集成的常见失败点中 webhook 限流、消息格式解析与 ack 回写同步

A IM 集成不会有任何问题
B webhook 限流不会导致消息丢失
C ack 回写无需同步
D 常见失败点包括 webhook 限流、消息格式解析与 ack 回写同步,需用重试、幂等与状态同步规避 ✓ 正确答案
#

15. 值班工具的 API 自动化中通过 API 批量调整排班、查询 on-call 人员、自动创建 maintenance window

A API 只能查询,不能修改排班
B API 自动化无需安全认证
C 维护窗口必须手工创建
D 可通过 API 批量调整排班、查询 on-call 人员与自动创建维护窗口,需注意认证与权限 ✓ 正确答案
#

16. 值班工具选型评估中 PagerDuty、Opsgenie、Grafana OnCall、VictorOps 的成本模型与功能对比

A 选型需权衡功能、生态集成、成本与运维人力,PagerDuty 全而贵、Grafana OnCall 开源省成本 ✓ 正确答案
B 所有工具功能完全相同,只看价格
C Grafana OnCall 与商业工具功能完全一致
D 值班工具选型不影响运维
#

17. 多区域 follow-the-sun 值班中,PagerDuty/Opsgenie 的时区与 handoff 时间窗口配置

A 所有时区团队应同时值班
B 时区配置无关紧要
C 交接不需要重叠
D follow-the-sun 让各区只在本地时段值班,并在交接窗口重叠覆盖,避免空窗与夜间打扰 ✓ 正确答案
#

18. war room 的组织与信息同步节奏

A war room 应让所有人随意发言
B war room 与对外沟通无关
C 信息同步无需节奏
D war room 通过 IC 统一指挥、定期状态同步与记录官留痕,实现有序信息流与高效处置 ✓ 正确答案
#

19. 事故升级路径(escalation path)与升级条件的设计

A 升级路径只需一层
B 升级条件无需明确
C 升级路径按时间、影响、能力等明确条件逐级移交,并交接上下文与留痕 ✓ 正确答案
D 升级与事故分级无关
#

20. 事故响应中的变更管控(紧急变更 vs 标准变更)

A 紧急变更应简省审批但强记录、可回滚、事后补审,与标准变更的完整流程区分 ✓ 正确答案
B 紧急变更无需任何记录
C 标准变更也需紧急审批
D 事故中变更无需回滚预案
#

21. 对外沟通与状态页(status page)更新策略

A 状态页应事故即发布、按节奏更新、通俗描述、统一口径,并留痕与内部联动 ✓ 正确答案
B 状态页应在事故后很久才更新
C 状态页内容应使用技术黑话
D 状态页与客服沟通无关