故障排查方法学

共 18 题
#

1. iptables 的表与链(filter/nat、INPUT/OUTPUT/FORWARD)如何理解,排查网络不通时如何定位规则问题?

A filter 表只处理转发流量
B 规则顺序不影响匹配结果
C 所有链都处理所有方向的包
D 入站走 INPUT、出站走 OUTPUT、转发走 FORWARD,规则自上而下匹配,排障用 -L -v 看命中计数 ✓ 正确答案
#

2. 在可靠性、交付速度与复杂度冲突时,如何用 SRE 的简单性原则削减无必要的系统与流程

A 复杂度越高系统越可靠
B 简单性会拖慢交付
C 复杂度是可靠性敌人,应识别并移除无必要系统与流程,用简单性换取可预测与快速交付 ✓ 正确答案
D 流程越多越好,无需精简
#

3. 如何依据 Google SRE 的消除 Toil 定义识别重复、可自动化且无长期价值的运维工作,并用指标证明收益

A 消除 Toil 无需关注 ROI
B Toil 是必须保留的专家工作
C Toil 无法量化,只能靠感觉
D Toil 是重复、可自动化、无长期价值且线性增长的工作 ✓ 正确答案
#

4. 如何用工程化容量模型判断自动化项目是否真的降低 Toil,而不是转移人工成本

A 只要上了自动化就是降低 Toil
B 自动化只会把人工成本转移到别处,无法真正降 Toil
C 自动化维护成本可忽略
D 用容量模型比较自动化节省的操作量与新增维护成本,只有在规模增长下总成本下降才是真降低 ✓ 正确答案
#

5. 如何设计面向用户旅程的 SLI,避免只监控内部资源而遗漏真实可用性

A SLI 只需监控 CPU/内存即可
B 内部资源正常则业务一定可用
C 应从用户核心操作路径定义成功率/延迟等 SLI,用真实请求与拨测捕捉真实可用性,内部资源监控仅作补充 ✓ 正确答案
D 用户旅程与 SLI 无关
#

6. 怎样把 SRE Book 的服务级目标、错误预算和发布决策接成可审计的闭环

A 错误预算与发布决策无关
B 发布决策应忽略错误预算
C 用错误预算衡量可用性消耗,预算耗尽时减缓或暂停发布,并用自动化闸门与可审计记录形成闭环 ✓ 正确答案
D 错误预算无法量化
#

7. FMEA(失效模式与影响分析)如何在故障预防与排查中应用,与根因分析(RCA)有何区别?

A FMEA 是事后分析,RCA 是事前预防
B FMEA 是事前识别失效模式并按严重度/频度/可检测度量化风险预防,RCA 是事后深挖根因避免复发 ✓ 正确答案
C FMEA 与 RCA 完全等价
D FMEA 只用于排查已发生故障
#

8. JVM safepoint 停顿如何排查与优化,即 safepoint 日志、GC 日志与锁竞争分析?

A safepoint 停顿无法观察
B 锁竞争不影响 safepoint 停顿
C safepoint 停顿与 GC 无关
D 通过 safepoint 日志与 GC 日志定位停顿来源,结合锁竞争分析,优化 GC 频率与锁粒度降低停顿 ✓ 正确答案
#

9. NUMA 架构下如何排查性能问题,即本地/远程内存访问、CPU 亲和性与 numastat 分析?

A 用 numastat 分析远程访问命中,通过进程绑核与内存绑定让 CPU/内存同节点,减少远程访问开销 ✓ 正确答案
B NUMA 下所有内存访问速度相同
C 远程访问不影响性能
D CPU 亲和性与内存访问无关
#

10. posix_fadvise 如何影响文件缓存与 I/O 性能,缓存命中率低的场景如何排查?

A posix_fadvise 会修改文件内容
B 缓存命中率低与 fadvise 无关
C fadvise 只影响网络 I/O
D 通过 fadvise 提示访问模式(顺序/随机/无需再读)能优化内核缓存策略,提升 I/O 并避免缓存污染 ✓ 正确答案
#

11. preadv/pwritev 等向量化系统调用的适用场景,I/O 问题排查中如何分析系统调用行为?

A preadv 一次只能读一个缓冲区
B 向量化 I/O 不适用于文件
C 向量化 I/O 用 iovec 一次处理多段内存,减少系统调用次数,适合聚合分散数据的 I/O 场景 ✓ 正确答案
D 系统调用次数不影响 I/O 性能
#

12. 如何排查 epoll 相关故障,即事件丢失、惊群效应与高 CPU 占用如何定位?

A edge-triggered 模式无需担心丢事件
B 多线程处理同 fd 不会导致竞争
C 事件丢失常与触发模式/未读尽有关,惊群可用 EPOLLEXCLUSIVE 缓解,高 CPU 用 strace/perf 定位空转 ✓ 正确答案
D 惊群效应无法缓解
#

13. 定时器相关故障(延迟、不准、CPU 飙高)如何排查,涉及哪些内核观测手段?

A 定时器不准与时钟同步无关
B 定时器 CPU 飙高无法观测
C 延迟/不准查时钟源与 tick,CPU 飙高用 perf/interrupts 定位定时器中断热点,并优化频率与回调 ✓ 正确答案
D 定时器回调中做重活无影响
#

14. 分布式排障的依赖分析中调用链、依赖图与级联故障的定位方法

A 用调用链与依赖图定位根因依赖,区分源头与受灾服务,用超时/熔断/限流切断级联传播 ✓ 正确答案
B 级联故障应逐服务排查
C 依赖关系与故障传播无关
D 级联故障无法定位源头
#

15. 排障工具链的选取中指标看趋势、日志看细节、追踪看链路、抓包看协议的组合应用

A 只需一种工具即可排所有故障
B 指标看趋势、日志看细节、追踪看链路、抓包看协议,按下钻顺序组合定位故障 ✓ 正确答案
C 抓包只能看应用层
D 指标异常时无需下钻日志
#

16. 排障知识沉淀中故障档案、runbook 与排查手册如何组织并保持更新

A 排障经验写一次即可永久有效
B 故障档案记载案例、runbook 标准化处置、排查手册提供方法论,复盘后更新并纳入版本管理 ✓ 正确答案
C 只需要排查手册即可
D 知识沉淀与复盘无关
#

17. 排障过程中的沟通与升级中状态更新频率、升级条件与信息同步渠道如何设计

A 排障过程无需沟通,解决后再汇报
B 升级条件无需预定义
C 初期高频更新状态、超时或超能力时及时升级并正式交接,用统一频道与状态页同步信息 ✓ 正确答案
D 信息同步渠道越多越好
#

18. 故障排查的科学流程中现象收集、假设生成、验证实验与根因确认如何避免跳跃式结论

A 应收集现象、生成假设、用验证实验确认,区分猜测与证据,避免跳跃式结论 ✓ 正确答案
B 根据现象直接定根因即可
C 无需验证假设
D 根因确认无需考虑变更