事故应急响应与复盘

共 21 题
#

1. 讲一次重大事故中你作为指挥官或参与者的过程

A 事故指挥官的价值在于快速分级、果断止血、并行组织恢复与补偿并统一对外口径 ✓ 正确答案
B 事故分级是形式主义,所有事故都按同样方式处理
C 事故时应该先让所有人各自排查,等有结论再开会
D 重大事故中指挥官只需负责写代码修复
#

2. 事故前 2 小时你与产品 / 业务方沟通了什么

A 事故前 2 小时沟通应首报快、按固定节奏更新、用业务语言说影响并只承诺有把握的时间 ✓ 正确答案
B 为了安抚业务方,可以给出乐观的恢复时间
C 事故细节(包括猜测)都应该第一时间同步给业务方
D 事故首报应该等根因查清后再发给业务方
#

3. 事故第 24 / 72 小时你分别关注什么

A 第 24 小时聚焦数据补偿与业务影响报告,第 72 小时聚焦根因分析与可落地改进项,是事故后管理的关键节奏 ✓ 正确答案
B 数据补偿小事不用核实,补完即可
C 服务恢复后事故就算结束,无需再关注
D 事故复盘应该在恢复当天立即完成
#

4. 事故复盘报告你最在意哪三栏

A 复盘报告最重要的是影响损失统计栏,数字越大越受重视
B 根因栏写到"操作失误"就足够了
C 改进项可以写"加强意识"这类没有验证方式的条目
D 时间线、根因与改进项三栏是复盘报告的骨架,三者咬合才能确保复盘指向防复发 ✓ 正确答案
#

5. 事故分级与响应中如何建立 P0/P1/P2 分级标准并明确不同级别下的响应动作与升级路径?

A 事故升级应该由当值者凭感觉决定
B 事故分级只需要按事故造成的金钱损失大小划分
C 按影响范围与能力定义 P0/P1/P2,明确各级响应时限、角色与自动升级路径,并定期演练校准,是事故响应的体系化做法 ✓ 正确答案
D 分级标准制定一次即可,无需演练
#

6. 事故发生时信息混乱,你如何快速建立"事实时间线",区分事实、猜测与传言?

A 事故信息应该先记录再验证,保证时间线完整
B 通过专职记录员、原始存档与交叉验证建立时间线,只有多方佐证的信息才算事实,能保证决策与复盘的准确 ✓ 正确答案
C 事故群里说的一切都应该计入时间线
D 时间线只需要在复盘时凭记忆重建
#

7. 多团队协同处置重大事故时,你如何建立统一指挥与分工(指挥官、联络人、记录员),避免各救各的?

A 事故时所有团队都应该自由排查,谁先找到谁处理
B 建立统一指挥(指挥官、联络人、记录员)、一个作战群与任务化分工,能避免多团队"各救各的" ✓ 正确答案
C 多团队事故时每个团队各自负责自己系统的恢复即可
D 跨团队方案冲突时应各自按自己想法执行
#

8. 如何避免将事故复盘变成相互指责

A 通过会前定规则、用系统语言替代人物语言、挂起争议会后用数据裁决,能有效防止复盘变成相互指责 ✓ 正确答案
B 复盘只需要列出责任清单即可
C 复盘时出现指责应该当场制止并批评发言者
D 复盘必须点名批评责任人才能长记性
#

9. 讲一次 Action Item 没有落地的事故复盘

A 复盘会开完,Action Item 自然会落地
B 未落地的改进项说明复盘本身不重要
C 复盘改进项需要"负责人+截止日+验证方式"三字段与定期跟踪机制,才能避免落地率虚高 ✓ 正确答案
D Action Item 未落地说明团队成员不负责,应该处罚
#

10. 你如何向非技术高管或客户通报事故进展与影响,信息颗粒度与频率如何选择

A 向高管通报应该包含全部技术细节,体现专业性
B 面向非技术受众应翻译为业务影响与恢复承诺,并按影响级别和受众需求适配颗粒度与通报频率 ✓ 正确答案
C 事故通报应该等完全恢复后一次性说明
D 客户询问时只需说"正在处理"即可
#

11. 事故高压下你用什么具体动作稳定团队情绪、防止恐慌引发的次生决策失误

A 事故高压下应该让大家快速发言,集思广益
B 通过限时信息收集、书面化决策、双人验证与固定同步节奏等具体动作,能有效防止恐慌引发次生失误 ✓ 正确答案
C 高压下为了速度,生产操作可以单人完成
D 恐慌时应该让情绪激动的人继续主导排查
#

12. 事故复盘(postmortem)的写作中如何用"时间线加根因加改进项"避免归咎个人?

A 复盘报告里应该点名批评以儆效尤
B 用客观时间线、五问法把根因挖到系统层面、改进项指向机制,能从根本上避免复盘归咎个人 ✓ 正确答案
C 复盘报告写明责任人能让团队更重视
D 根因分析到"操作失误"就足够了
#

13. 事故后的恢复验证中如何用"演练加监控加回滚预案"确保同类事故不再发生?

A 监控告警配置完成后无需验证
B 事故恢复后写好复盘文档就完成了防复发
C 演练只是形式,预案存在即可
D 回滚预案、监控告警与定期演练三层防线相互验证,才能确保同类事故被及时发现和处置 ✓ 正确答案
#

14. 事故处置中你如何管理"对外统一口径",避免不同人向客户或管理层发出矛盾信息?

A 通过单一信息出口、模板化内容、发布前确认与编号管理,并事后快速纠偏,能有效避免对外口径矛盾 ✓ 正确答案
B 口径出现矛盾时只需内部说明即可,无需对外修正
C 事故时任何知情人都可以对外回应,速度更重要
D 对外信息不需要审批,越及时越好
#

15. 除了复盘改进,你如何推动"预防性投入"(容量、冗余、自动化测试),让团队愿意为看不见的风险买单?

A 预防性投入无法量化收益,只能靠管理层觉悟
B 用历史事故损失账单量化预期收益、绑定具体风险场景并小步验证,能有效推动团队为预防性投入买单 ✓ 正确答案
C 预防性投入只需要做一次,做完就一劳永逸
D 自动化压测属于锦上添花,应排在所有功能需求之后
#

16. 事故中“继续修 vs 立即回滚”的决策依据是什么,你如何避免“再试一下”心态扩大影响?

A 只要修复看起来快完成就应该继续试
B 回滚会导致数据丢失,任何时候都不应回滚
C 按修复确定性、回滚成本与影响趋势决策,并用"两次失败即回滚"等硬规则对抗"再试一下"心态,能防止影响扩大 ✓ 正确答案
D 事故中应该坚持修复到底,回滚等于承认失败
#

17. 事故中你与外部 SaaS 供应商沟通策略是什么

A 供应商故障时应该先争论责任归属再谈恢复
B 供应商不响应时应该等待而不是升级
C 联系供应商只需要说"我们的服务挂了"
D 证据先行、说清业务影响、按 SLA 路径升级并全程留痕,是与外部供应商高效协同恢复的最佳策略 ✓ 正确答案
#

18. 讲一次你因为事故重新设计了告警 / 值班体系

A 告警越多越安全,重要告警总会被看到
B 告警升级机制会打扰领导,应该取消
C 值班同学盯着群看就能保证告警响应
D 告警体系应分级收敛、按路由自动升级、核心告警直达并有自动上下文,才能保证响应效率 ✓ 正确答案
#

19. 事故后第 N 个月你如何评估改进是否真正生效

A 演练表现属于过程指标,不影响改进是否生效的判断
B 事故后只要同类事故没复发,改进就算生效
C 结合复发率、响应时效、演练表现与改进项落地率四维对照基线评估,才能确认改进真正生效 ✓ 正确答案
D 改进评估只需要在事故后做一次
#

20. 复盘后你如何用“改进项完成率+同类事故复发率”两个指标向管理层证明复盘真正生效?

A 用改进项完成率证明执行力、同类事故复发率证明有效性,并展示两者的关联趋势,是向管理层证明复盘价值的有效方式 ✓ 正确答案
B 复发率反弹时应该淡化处理,避免质疑
C 改进项完成率只统计完成数量即可,无需区分延期
D 向管理层证明复盘生效只需说"我们做了很多复盘"
#

21. 复盘发现根因涉及长期违规操作(如一直绕过评审上线)时,你如何区分组织问题与个人问题?

A 长期违规操作一定是个人责任心问题,应该处分当事人
B 从系统是否默许、是否存在排期压力、违规是否多点分布来区分组织问题与个人问题,并分别采取机制改进与个人处理 ✓ 正确答案
C 只要涉及违规就必须处分,无需区分原因
D 复盘中发现组织问题应该替个人开脱所有责任