# 1. iptables 的表与链(filter/nat、INPUT/OUTPUT/FORWARD)如何理解,排查网络不通时如何定位规则问题? A filter 表只处理转发流量 B 规则顺序不影响匹配结果 C 所有链都处理所有方向的包 D 入站走 INPUT、出站走 OUTPUT、转发走 FORWARD,规则自上而下匹配,排障用 -L -v 看命中计数 ✓ 正确答案
# 2. 在可靠性、交付速度与复杂度冲突时,如何用 SRE 的简单性原则削减无必要的系统与流程 A 复杂度越高系统越可靠 B 简单性会拖慢交付 C 复杂度是可靠性敌人,应识别并移除无必要系统与流程,用简单性换取可预测与快速交付 ✓ 正确答案 D 流程越多越好,无需精简
# 3. 如何依据 Google SRE 的消除 Toil 定义识别重复、可自动化且无长期价值的运维工作,并用指标证明收益 A 消除 Toil 无需关注 ROI B Toil 是必须保留的专家工作 C Toil 无法量化,只能靠感觉 D Toil 是重复、可自动化、无长期价值且线性增长的工作 ✓ 正确答案
# 4. 如何用工程化容量模型判断自动化项目是否真的降低 Toil,而不是转移人工成本 A 只要上了自动化就是降低 Toil B 自动化只会把人工成本转移到别处,无法真正降 Toil C 自动化维护成本可忽略 D 用容量模型比较自动化节省的操作量与新增维护成本,只有在规模增长下总成本下降才是真降低 ✓ 正确答案
# 5. 如何设计面向用户旅程的 SLI,避免只监控内部资源而遗漏真实可用性 A SLI 只需监控 CPU/内存即可 B 内部资源正常则业务一定可用 C 应从用户核心操作路径定义成功率/延迟等 SLI,用真实请求与拨测捕捉真实可用性,内部资源监控仅作补充 ✓ 正确答案 D 用户旅程与 SLI 无关
# 6. 怎样把 SRE Book 的服务级目标、错误预算和发布决策接成可审计的闭环 A 错误预算与发布决策无关 B 发布决策应忽略错误预算 C 用错误预算衡量可用性消耗,预算耗尽时减缓或暂停发布,并用自动化闸门与可审计记录形成闭环 ✓ 正确答案 D 错误预算无法量化
# 7. FMEA(失效模式与影响分析)如何在故障预防与排查中应用,与根因分析(RCA)有何区别? A FMEA 是事后分析,RCA 是事前预防 B FMEA 是事前识别失效模式并按严重度/频度/可检测度量化风险预防,RCA 是事后深挖根因避免复发 ✓ 正确答案 C FMEA 与 RCA 完全等价 D FMEA 只用于排查已发生故障
# 8. JVM safepoint 停顿如何排查与优化,即 safepoint 日志、GC 日志与锁竞争分析? A safepoint 停顿无法观察 B 锁竞争不影响 safepoint 停顿 C safepoint 停顿与 GC 无关 D 通过 safepoint 日志与 GC 日志定位停顿来源,结合锁竞争分析,优化 GC 频率与锁粒度降低停顿 ✓ 正确答案
# 9. NUMA 架构下如何排查性能问题,即本地/远程内存访问、CPU 亲和性与 numastat 分析? A 用 numastat 分析远程访问命中,通过进程绑核与内存绑定让 CPU/内存同节点,减少远程访问开销 ✓ 正确答案 B NUMA 下所有内存访问速度相同 C 远程访问不影响性能 D CPU 亲和性与内存访问无关
# 10. posix_fadvise 如何影响文件缓存与 I/O 性能,缓存命中率低的场景如何排查? A posix_fadvise 会修改文件内容 B 缓存命中率低与 fadvise 无关 C fadvise 只影响网络 I/O D 通过 fadvise 提示访问模式(顺序/随机/无需再读)能优化内核缓存策略,提升 I/O 并避免缓存污染 ✓ 正确答案
# 11. preadv/pwritev 等向量化系统调用的适用场景,I/O 问题排查中如何分析系统调用行为? A preadv 一次只能读一个缓冲区 B 向量化 I/O 不适用于文件 C 向量化 I/O 用 iovec 一次处理多段内存,减少系统调用次数,适合聚合分散数据的 I/O 场景 ✓ 正确答案 D 系统调用次数不影响 I/O 性能
# 12. 如何排查 epoll 相关故障,即事件丢失、惊群效应与高 CPU 占用如何定位? A edge-triggered 模式无需担心丢事件 B 多线程处理同 fd 不会导致竞争 C 事件丢失常与触发模式/未读尽有关,惊群可用 EPOLLEXCLUSIVE 缓解,高 CPU 用 strace/perf 定位空转 ✓ 正确答案 D 惊群效应无法缓解
# 13. 定时器相关故障(延迟、不准、CPU 飙高)如何排查,涉及哪些内核观测手段? A 定时器不准与时钟同步无关 B 定时器 CPU 飙高无法观测 C 延迟/不准查时钟源与 tick,CPU 飙高用 perf/interrupts 定位定时器中断热点,并优化频率与回调 ✓ 正确答案 D 定时器回调中做重活无影响
# 14. 分布式排障的依赖分析中调用链、依赖图与级联故障的定位方法 A 用调用链与依赖图定位根因依赖,区分源头与受灾服务,用超时/熔断/限流切断级联传播 ✓ 正确答案 B 级联故障应逐服务排查 C 依赖关系与故障传播无关 D 级联故障无法定位源头
# 15. 排障工具链的选取中指标看趋势、日志看细节、追踪看链路、抓包看协议的组合应用 A 只需一种工具即可排所有故障 B 指标看趋势、日志看细节、追踪看链路、抓包看协议,按下钻顺序组合定位故障 ✓ 正确答案 C 抓包只能看应用层 D 指标异常时无需下钻日志
# 16. 排障知识沉淀中故障档案、runbook 与排查手册如何组织并保持更新 A 排障经验写一次即可永久有效 B 故障档案记载案例、runbook 标准化处置、排查手册提供方法论,复盘后更新并纳入版本管理 ✓ 正确答案 C 只需要排查手册即可 D 知识沉淀与复盘无关
# 17. 排障过程中的沟通与升级中状态更新频率、升级条件与信息同步渠道如何设计 A 排障过程无需沟通,解决后再汇报 B 升级条件无需预定义 C 初期高频更新状态、超时或超能力时及时升级并正式交接,用统一频道与状态页同步信息 ✓ 正确答案 D 信息同步渠道越多越好
# 18. 故障排查的科学流程中现象收集、假设生成、验证实验与根因确认如何避免跳跃式结论 A 应收集现象、生成假设、用验证实验确认,区分猜测与证据,避免跳跃式结论 ✓ 正确答案 B 根据现象直接定根因即可 C 无需验证假设 D 根因确认无需考虑变更