业务连续性(BCP)与团队与文化建设

共 19 题
#

1. RTO/RPO/MAO 指标的制定与业务方对齐,包括业务影响分析(BIA)、关键业务流程识别与可接受中断时间

A 由技术团队按自身能力直接设定即可
B 应通过业务影响分析识别关键流程,将业务容忍度转化为 RTO/RPO 并与业务方对齐 ✓ 正确答案
C 指标设定后无需复审
D RPO 只关注恢复时间,与数据无关
#

2. SRE 团队的技能矩阵与 on-call 能力培养体系

A 技能矩阵是静态的,无需更新
B 只有少数专家能值班是正常现象
C on-call 只需会看界面即可
D 用技能矩阵评估差距,并通过影子值班、导师制渐进培养 on-call 能力,降低单点依赖 ✓ 正确答案
#

3. 两地三中心与同城/异地多活架构的选型权衡中成本、RTO/RPO、数据一致性与运维复杂度

A 多活架构成本低、复杂度也低
B 异地灾备可以实现零 RPO
C 应根据业务容忍度在成本、RTO/RPO、一致性与运维复杂度间权衡,多活虽可用性高但成本与复杂度高 ✓ 正确答案
D 所有业务都应采用多活
#

4. 备份策略设计与恢复演练的有效性验证中 3-2-1 策略、恢复演练频率与演练评估标准

A 应遵循 3-2-1 策略,并通过分级的恢复演练验证数据完整性、恢复耗时与 RTO 达标,跟踪缺陷闭环 ✓ 正确答案
B 只要做了备份就万无一失
C 恢复演练只在出事故时进行
D 备份频率与 RPO 无关
#

5. 如何落地 blameless culture 并避免流于口号

A 应聚焦系统与流程缺陷而非归咎个人,通过领导层示范、复盘模板与机制化避免口号化 ✓ 正确答案
B 无指责意味着任何行为都不追责
C blameless 就是想方设法找人担责
D 无指责文化只需贴在墙上即可
#

6. 容灾切换演练的组织、评估与回切流程中演练场景设计、参与角色、回切条件、演练报告与改进

A 回切是简单操作,无需验证
B 应设计场景、明确角色,并严谨定义回切条件与验证,通过报告与改进闭环暴露预案缺陷 ✓ 正确答案
C 演练只需验证切换,无需验证回切
D 演练报告无需跟踪改进项
#

7. 平台团队与业务团队的责任边界(Spotify 模型落地)

A 平台团队应负责所有业务应用
B 责任边界无需文档化
C 业务团队完全不管平台,无需协作
D 平台团队提供能力并保证其稳定,业务团队通过自服务使用平台并负责自身应用,边界需明确避免责任真空 ✓ 正确答案
#

8. 技术债量化与 Toil 消除的优先级决策

A Toil 完全无法量化
B 优先级决策只靠直觉即可
C 应量化 Toil 占用工时与技术债维护成本,用 ROI 评估优先消除高影响、可自动化的项 ✓ 正确答案
D 技术债无需偿还,长期放着即可
#

9. 应急沟通机制中事故通信树、状态页与内外部通报的时效与口径管理

A 通报口径可各不相同,各说各话
B 通信树无需更新联系人
C 状态页只对内部,外部无需了解
D 用通信树保证触达、状态页统一信息源,并统一由单一负责人管理时效与口径 ✓ 正确答案
#

10. GSLB 如何实现跨地域流量调度与容灾切换,健康检查与切换条件如何设计?

A GSLB 通过 DNS/Anycast/应用层调度流量,健康检查与切换条件需权衡止损与误切,并设计回切 ✓ 正确答案
B 健康检查失败一次就立即切换,越快越好
C 健康检查只用于就近接入,与容灾无关
D 切换后无需考虑回切
#

11. Spotify 模型中的 squad 如何组织以兼顾团队自治与组织对齐,落地时有哪些常见问题?

A squad 拥有使命与边界实现自治,通过使命、SLO 与评审对齐,避免边界不清与重复造轮子 ✓ 正确答案
B squad 应完全自治,无需对齐
C chapter 与 guild 会阻碍自治
D 组织结构应频繁变动以保持活力
#

12. fencing 机制如何防止脑裂与双主,即仲裁、STONITH 与故障节点隔离策略?

A 只要心跳正常就不会脑裂
B 双主无需预防,数据自会一致
C STONITH 会让故障节点继续运行
D 通过 quorum 仲裁保证多数派存活,并用 STONITH 等强制隔离故障节点,避免双主 ✓ 正确答案
#

13. 主备(active-passive)容灾架构如何实现,即数据同步、切换流程与 RTO/RPO 达成?

A 同步复制没有性能代价
B 同步复制 RPO 接近 0 但延迟高,异步复制 RPO 非零且性能好,RTO 由切换自动化程度决定 ✓ 正确答案
C 备节点无需验证,切换时再用即可
D 异步复制可达零 RPO
#

14. 如何识别 Tier 0 级关键业务并制定连续性方案,即恢复优先级、资源保障与演练频次?

A 所有业务采用相同的连续性方案
B 演练频次与业务级别无关
C Tier 0 业务可以接受长 RTO
D 通过 BIA 识别 Tier 0 业务,给予最高恢复优先级与资源保障,并采用高频演练 ✓ 正确答案
#

15. 演练分层设计中桌面推演、单组件演练与全量切换演练的适用场景与节奏安排

A 只要做全量切换演练即可,无需分层
B 桌面推演练流程、单组件演练练技术、全量切换演练练端到端,低层高频高层低频且问题闭环后升级 ✓ 正确答案
C 所有演练采用相同频率
D 桌面推演成本最高
#

16. DevOps 转型的组织阻力与渐进式推进路径

A 转型阻力来自文化、工具、流程与组织,应选试点渐进推进并配套文化变革与指标衡量 ✓ 正确答案
B 只要引入工具就能完成转型
C 转型应一步到位,全量替换
D 高层支持与转型无关
#

17. 如何建设团队知识库(wiki)并保持更新,使其真正支撑协作与新人培养?

A 知识库写好即可,无需更新
B 文档越复杂越好
C 知识库只用于存档,不参与协作
D 应组织清晰内容,并把更新纳入工作流、设 Owner 定期评审,使其成为新人培养的活文档 ✓ 正确答案
#

18. 结对/搭档(buddy)机制如何在运维团队中促进知识传递与变更质量提升?

A buddy 只是让新人多一个人聊天
B 高风险变更无需搭档
C buddy 会降低个人独立能力,应避免
D 通过变更/on-call/任务配对的搭档复核与指导,促进知识传递并降低误操作风险,但需避免形式化 ✓ 正确答案
#

19. 关键人员依赖治理中 bus factor、知识备份与单点人员风险的识别与缓解

A bus factor=1 说明系统很健壮
B 关键系统应由专人独享知识
C 应识别 bus factor 单点风险,通过知识备份、交叉培训与轮岗降低对少数人的依赖 ✓ 正确答案
D 文档化会降低维护效率