SLO 与可靠性

共 19 题
#

1. SLO(Service Level Objective)的设定方法,如何基于业务需求和历史数据制定合理的 SLO?为什么 SLO 不应过于严格?

A SLO 越严格越好,越接近 100% 越可靠
B SLO 应基于业务需求与历史数据,留出可消耗的错误预算 ✓ 正确答案
C SLO 完全由运维单方面决定,无需业务参与
D SLO 一旦设定就无需根据历史数据调整
#

2. Multi-Window Multi-Burn-Rate 告警的设计原理,为什么单一窗口告警不够?短窗口(快速消耗)与长窗口(慢速消耗)如何组合避免误报和漏报?

A 多窗口组合会增加误报概率
B 单一长窗口可快速发现严重故障
C 单一短窗口即可准确告警,无需多窗口
D 短窗口捕捉快速消耗,长窗口捕捉慢速消耗,多窗口同时超标才告警 ✓ 正确答案
#

3. 分布式系统可靠性测试中'稳态假设'的验证方法?

A 稳态假设与故障注入无关
B 需在故障前采集基线、故障中对比偏差、恢复后验证回归 ✓ 正确答案
C 稳态恢复时间无需验证
D 只需在故障时观察指标即可,无需基线
#

4. 批处理管道(Batch Pipeline)的 SLO 如何定义?与在线服务 SLO 的差异(延迟 vs 完整性 vs 新鲜度)?

A 批处理 SLO 与在线服务 SLO 完全一致
B 批处理 SLO 侧重完整性、新鲜度与准时性 ✓ 正确答案
C 数据新鲜度与批处理 SLO 无关
D 批处理 SLO 只需关注延迟分位数
#

5. 依赖 SLO 聚合(Dependency SLO Aggregation),当服务依赖多个下游时,如何计算组合可用性?串联与并联依赖的 SLO 计算方法?

A 并联冗余不会提升组合可用性
B 并联依赖组合可用性 = 各依赖可用性相加
C 依赖链越长组合可用性越高
D 串联依赖组合可用性 = 各依赖可用性相乘 ✓ 正确答案
#

6. 基于 SLO 的容量规划(Capacity Planning),如何从错误预算消耗趋势推导扩容时机和资源需求?

A 扩容只需考虑当前负载,无需预测增长
B 容量规划无需考虑错误预算消耗趋势
C 错误预算消耗加速可能说明容量趋于饱和,需扩容 ✓ 正确答案
D P99 延迟接近 SLO 上限无需扩容
#

7. SLO 与 SLI 的关系,如何为测试/发布定义 SLI(可用性、延迟、错误率),SLO 阈值如何设定?

A SLI 是度量指标,SLO 是目标阈值,测试用 SLO 判断发布是否达标 ✓ 正确答案
B SLO 阈值无需基于历史数据设定
C 延迟 SLI 只度量 P50,不关注分位数
D SLI 与 SLO 是同一概念
#

8. 错误预算(Error Budget)驱动的测试与发布决策,预算耗尽时测试与发布策略如何调整?

A 预算耗尽时应加速发布新功能
B 预算耗尽时应冻结高风险发布、加强可靠性测试 ✓ 正确答案
C 预算耗尽与测试策略无关
D 预算耗尽时应减少测试投入
#

9. 面向用户的 SLO 与内部 SLO 的区别,外部可感知指标与内部依赖指标如何分层管理?

A 外部 SLO 与内部 SLO 完全等价
B 内部 SLO 通常应严于外部 SLO 以留出余量 ✓ 正确答案
C 内部 SLO 用于对外承诺
D 外部 SLO 无需基于用户可感知指标
#

10. SLO 违约后的补救与回归验证流程,容量扩容、代码修复后如何验证 SLO 恢复?

A 容量扩容后无需验证负载下的延迟
B 修复后无需验证即可直接上线
C 应修复后用同口径 SLI 对比并监控确认 SLO 恢复 ✓ 正确答案
D 回归验证只需看修复是否成功,无需监控生产
#

11. SLO 与 SLA 的区别,SLA 是合同义务、SLO 是内部目标,两者的违约后果、度量口径与沟通对象有何不同?

A SLA 通常比 SLO 更严格
B SLA 是合同义务,违约有赔偿;SLO 是内部目标,违约属内部治理 ✓ 正确答案
C SLA 的沟通对象是内部团队
D SLO 与 SLA 是同一概念
#

12. SLI 的度量口径设计,可用性与延迟分位数的窗口、聚合方式(滚动窗口 vs 日历窗口)如何影响 SLO 判定?

A 滚动窗口能反映当前趋势、对突发敏感,日历窗口固定可预期 ✓ 正确答案
B 滚动窗口与日历窗口判定结果总是一致
C SLI 度量口径无需明确定义
D 延迟 SLI 应使用均值而非分位数
#

13. 错误预算(Error Budget)消耗速率监控与告警策略?

A 快速消耗与慢速消耗应用同一告警策略
B 只需在预算耗尽时告警一次
C 错误预算消耗速率无需监控
D 用多窗口燃尽率区分快速与慢速消耗,提前干预 ✓ 正确答案
#

14. 错误预算策略(Error Budget Policy)的制定,当预算耗尽时应触发哪些组织行为(冻结发布、增加测试、回滚)?如何避免策略被忽视?

A 预算策略无需与团队绩效挂钩
B 预算耗尽时应继续发布新功能
C 预算耗尽时应冻结发布、增加测试、优先修复,并自动化执行 ✓ 正确答案
D 预算策略应依赖人工自觉执行
#

15. 可靠性测试的开展,故障注入(Chaos)、回归与容量测试如何支撑 SLO 达成?

A 故障注入验证故障韧性、容量测试验证负载性能、回归验证变更质量 ✓ 正确答案
B 故障注入无法验证 SLO 是否达成
C 只需容量测试即可保障 SLO
D 可靠性测试与 SLO 无关
#

16. 可靠性测试,故障注入与恢复?

A 只需验证故障期间行为,无需验证恢复
B 应验证故障期间行为与故障后的恢复时间、数据完整性 ✓ 正确答案
C 故障注入只需覆盖网络故障
D 恢复测试无需验证数据完整性
#

17. SLO 的引入路径,从无到有如何先定义 SLI、再设定 SLO、最后用错误预算驱动决策?

A 应先定义 SLI,再设定 SLO,最后用错误预算驱动决策 ✓ 正确答案
B 应先设定 SLO 再定义 SLI
C 错误预算与 SLO 无关
D 引入 SLO 无需建立监控与告警
#

18. SLO 与成本的权衡,错误预算分配如何反映业务对可靠性的真实投入意愿?

A 错误预算越多,可靠性投入成本越高
B SLO 越高通常成本越高,错误预算分配反映可靠性投入意愿 ✓ 正确答案
C SLO 与成本无关
D 应无条件追求最高 SLO
#

19. 高可用目标的可达性校验,99.9% 与 99.99% 对应的年度宕机预算如何换算,如何评估团队目标设定的合理性?

A 可用性目标越高,成本投入越低
B 99.99% 对应年度宕机约 52.6 分钟,99.9% 约 8.76 小时 ✓ 正确答案
C 高可用目标只需拍脑袋设定,无需评估
D 99.9% 与 99.99% 的宕机预算相同