# 1. RTO/RPO/MAO 指标的制定与业务方对齐,包括业务影响分析(BIA)、关键业务流程识别与可接受中断时间 A 由技术团队按自身能力直接设定即可 B 应通过业务影响分析识别关键流程,将业务容忍度转化为 RTO/RPO 并与业务方对齐 ✓ 正确答案 C 指标设定后无需复审 D RPO 只关注恢复时间,与数据无关
# 2. SRE 团队的技能矩阵与 on-call 能力培养体系 A 技能矩阵是静态的,无需更新 B 只有少数专家能值班是正常现象 C on-call 只需会看界面即可 D 用技能矩阵评估差距,并通过影子值班、导师制渐进培养 on-call 能力,降低单点依赖 ✓ 正确答案
# 3. 两地三中心与同城/异地多活架构的选型权衡中成本、RTO/RPO、数据一致性与运维复杂度 A 多活架构成本低、复杂度也低 B 异地灾备可以实现零 RPO C 应根据业务容忍度在成本、RTO/RPO、一致性与运维复杂度间权衡,多活虽可用性高但成本与复杂度高 ✓ 正确答案 D 所有业务都应采用多活
# 4. 备份策略设计与恢复演练的有效性验证中 3-2-1 策略、恢复演练频率与演练评估标准 A 应遵循 3-2-1 策略,并通过分级的恢复演练验证数据完整性、恢复耗时与 RTO 达标,跟踪缺陷闭环 ✓ 正确答案 B 只要做了备份就万无一失 C 恢复演练只在出事故时进行 D 备份频率与 RPO 无关
# 5. 如何落地 blameless culture 并避免流于口号 A 应聚焦系统与流程缺陷而非归咎个人,通过领导层示范、复盘模板与机制化避免口号化 ✓ 正确答案 B 无指责意味着任何行为都不追责 C blameless 就是想方设法找人担责 D 无指责文化只需贴在墙上即可
# 6. 容灾切换演练的组织、评估与回切流程中演练场景设计、参与角色、回切条件、演练报告与改进 A 回切是简单操作,无需验证 B 应设计场景、明确角色,并严谨定义回切条件与验证,通过报告与改进闭环暴露预案缺陷 ✓ 正确答案 C 演练只需验证切换,无需验证回切 D 演练报告无需跟踪改进项
# 7. 平台团队与业务团队的责任边界(Spotify 模型落地) A 平台团队应负责所有业务应用 B 责任边界无需文档化 C 业务团队完全不管平台,无需协作 D 平台团队提供能力并保证其稳定,业务团队通过自服务使用平台并负责自身应用,边界需明确避免责任真空 ✓ 正确答案
# 8. 技术债量化与 Toil 消除的优先级决策 A Toil 完全无法量化 B 优先级决策只靠直觉即可 C 应量化 Toil 占用工时与技术债维护成本,用 ROI 评估优先消除高影响、可自动化的项 ✓ 正确答案 D 技术债无需偿还,长期放着即可
# 9. 应急沟通机制中事故通信树、状态页与内外部通报的时效与口径管理 A 通报口径可各不相同,各说各话 B 通信树无需更新联系人 C 状态页只对内部,外部无需了解 D 用通信树保证触达、状态页统一信息源,并统一由单一负责人管理时效与口径 ✓ 正确答案
# 10. GSLB 如何实现跨地域流量调度与容灾切换,健康检查与切换条件如何设计? A GSLB 通过 DNS/Anycast/应用层调度流量,健康检查与切换条件需权衡止损与误切,并设计回切 ✓ 正确答案 B 健康检查失败一次就立即切换,越快越好 C 健康检查只用于就近接入,与容灾无关 D 切换后无需考虑回切
# 11. Spotify 模型中的 squad 如何组织以兼顾团队自治与组织对齐,落地时有哪些常见问题? A squad 拥有使命与边界实现自治,通过使命、SLO 与评审对齐,避免边界不清与重复造轮子 ✓ 正确答案 B squad 应完全自治,无需对齐 C chapter 与 guild 会阻碍自治 D 组织结构应频繁变动以保持活力
# 12. fencing 机制如何防止脑裂与双主,即仲裁、STONITH 与故障节点隔离策略? A 只要心跳正常就不会脑裂 B 双主无需预防,数据自会一致 C STONITH 会让故障节点继续运行 D 通过 quorum 仲裁保证多数派存活,并用 STONITH 等强制隔离故障节点,避免双主 ✓ 正确答案
# 13. 主备(active-passive)容灾架构如何实现,即数据同步、切换流程与 RTO/RPO 达成? A 同步复制没有性能代价 B 同步复制 RPO 接近 0 但延迟高,异步复制 RPO 非零且性能好,RTO 由切换自动化程度决定 ✓ 正确答案 C 备节点无需验证,切换时再用即可 D 异步复制可达零 RPO
# 14. 如何识别 Tier 0 级关键业务并制定连续性方案,即恢复优先级、资源保障与演练频次? A 所有业务采用相同的连续性方案 B 演练频次与业务级别无关 C Tier 0 业务可以接受长 RTO D 通过 BIA 识别 Tier 0 业务,给予最高恢复优先级与资源保障,并采用高频演练 ✓ 正确答案
# 15. 演练分层设计中桌面推演、单组件演练与全量切换演练的适用场景与节奏安排 A 只要做全量切换演练即可,无需分层 B 桌面推演练流程、单组件演练练技术、全量切换演练练端到端,低层高频高层低频且问题闭环后升级 ✓ 正确答案 C 所有演练采用相同频率 D 桌面推演成本最高
# 16. DevOps 转型的组织阻力与渐进式推进路径 A 转型阻力来自文化、工具、流程与组织,应选试点渐进推进并配套文化变革与指标衡量 ✓ 正确答案 B 只要引入工具就能完成转型 C 转型应一步到位,全量替换 D 高层支持与转型无关
# 17. 如何建设团队知识库(wiki)并保持更新,使其真正支撑协作与新人培养? A 知识库写好即可,无需更新 B 文档越复杂越好 C 知识库只用于存档,不参与协作 D 应组织清晰内容,并把更新纳入工作流、设 Owner 定期评审,使其成为新人培养的活文档 ✓ 正确答案
# 18. 结对/搭档(buddy)机制如何在运维团队中促进知识传递与变更质量提升? A buddy 只是让新人多一个人聊天 B 高风险变更无需搭档 C buddy 会降低个人独立能力,应避免 D 通过变更/on-call/任务配对的搭档复核与指导,促进知识传递并降低误操作风险,但需避免形式化 ✓ 正确答案
# 19. 关键人员依赖治理中 bus factor、知识备份与单点人员风险的识别与缓解 A bus factor=1 说明系统很健壮 B 关键系统应由专人独享知识 C 应识别 bus factor 单点风险,通过知识备份、交叉培训与轮岗降低对少数人的依赖 ✓ 正确答案 D 文档化会降低维护效率