K8s 生产排障实战

共 21 题
#

1. API Server 过载或慢请求的排障中从 apiserver 指标、etcd 延迟、审计日志三层定位瓶颈

A 限流不影响 apiserver
B apiserver 指标与 etcd 无关
C 审计日志无法定位慢请求
D etcd 延迟高会导致 apiserver 写慢 ✓ 正确答案
#

2. Pod CrashLoopBackOff 的系统化排查路径中镜像、探针、启动命令、依赖服务、资源限制如何逐项定位?

A 依赖服务不影响启动
B CrashLoopBackOff 与探针无关
C 用 --previous 查看崩溃前日志 ✓ 正确答案
D OOM 不会导致重启
#

3. Pod OOMKilled 的定位与治理中 requests/limits 设定、JVM 容器感知以及内存泄漏与突发流量如何区分?

A 突发流量无法治理
B OOMKilled 与 limits 无关
C 内存泄漏会瞬时回落
D JVM 应用需容器感知避免超限 OOM ✓ 正确答案
#

4. Pod 一直 Pending/CrashLoopBackOff/ImagePullBackOff 的排查路径分别是什么?

A CrashLoop 事件不重要
B ImagePullBackOff 与镜像无关
C Pending 常因调度不满足(资源/污点/PVC) ✓ 正确答案
D 三者无需看事件
#

5. Service 不通的排查全链路中 Endpoints、kube-proxy 模式(iptables/IPVS)、CNI、NetworkPolicy、DNS 如何逐层验证?

A 无需检查 DNS
B kube-proxy 与流量无关
C NetworkPolicy 不影响流量
D 先检查 Endpoints 是否就绪 ✓ 正确答案
#

6. kubectl cordon/drain/uncordon 的节点维护流程中 drain 驱逐 Pod 的顺序与 --ignore-daemonsets、--delete-emptydir-data、--disable-eviction、--force 各自的风险以及 PDB 阻止驱逐导致 drain 卡住的定位方法?

A cordon 会驱逐已有 Pod
B --force 无任何风险
C drain 会受 PDB 约束,可能卡住 ✓ 正确答案
D --ignore-daemonsets 会删除 DaemonSet
#

7. Pod Evicted 与节点压力驱逐(node-pressure eviction)机制中 QoS 等级如何决定驱逐顺序?

A 节点压力只会驱逐 Guaranteed
B Guaranteed 最优先被驱逐
C 驱逐顺序与 QoS 无关
D BestEffort 最优先被驱逐 ✓ 正确答案
#

8. Pod 启动失败的排查路径中 kubectl describe 事件、容器日志与 init 容器状态如何逐层定位

A init 容器不影响主容器
B init 容器失败会阻塞主容器启动 ✓ 正确答案
C describe 事件无排查价值
D 启动失败只需看主容器日志
#

9. kubectl debug 与临时容器(ephemeral containers)在无 shell 精简镜像下的排障用法?

A 精简镜像无法排障
B 临时容器修改原容器
C kubectl debug 添加临时容器排障 ✓ 正确答案
D debug 会删除 Pod
#

10. kubelet 日志中的典型错误(PLEG 卡死、CNI 调用失败、镜像拉取超时)如何快速定位节点级故障并恢复

A CNI 失败与网络无关
B PLEG 卡死常因容器运行时异常 ✓ 正确答案
C 镜像超时只能等
D kubelet 日志无排查价值
#

11. kubelet 证书轮换失败导致节点反复 NotReady 的排查路径与 RotateKubeletServerCertificate 配置

A RotateKubeletServerCertificate 是默认关闭的
B 证书轮换无需 CSR
C 证书过期或轮换失败会使节点 NotReady ✓ 正确答案
D 节点 NotReady 与证书无关
#

12. node-problem-detector 如何以 DaemonSet 方式检测内核死锁、容器运行时异常与网络故障,并将问题上报为 NodeCondition 或 Event 两种语义不同的告警?

A NodeCondition 反映持续状态,Event 是瞬时事件 ✓ 正确答案
B NPD 只上报 Event
C NodeCondition 用于告警通知
D NPD 不用 DaemonSet
#

13. 如何用 kubelet 日志、容器运行时与 CNI 三层定位 Pod 网络不通?

A 从 kubelet 日志、运行时与 CNI 三层定位 ✓ 正确答案
B 只需看 CNI
C 运行时与网络无关
D kubelet 不参与网络
#

14. 节点 NotReady 的常见原因(kubelet、PLEG、磁盘压力、证书过期)与驱逐行为的连锁影响?

A 证书过期不影响 NotReady
B NotReady 不影响 Pod
C 节点 NotReady 后可能在别处重建 Pod ✓ 正确答案
D 磁盘压力不会驱逐
#

15. 镜像拉取失败细分中 registry 认证失败、镜像不存在、digest 不匹配、拉取限流如何用事件与日志区分

A "digest mismatch" 是镜像不存在
B "unauthorized" 表示认证失败 ✓ 正确答案
C 限流错误是 not found
D 所有失败相同
#

16. Pod 调度失败的排查中 Unschedulable 事件、污点容忍、节点资源与亲和规则如何逐项验证

A 节点资源不影响调度
B 污点无需容忍
C Unschedulable 事件给出调度失败原因 ✓ 正确答案
D 亲和规则总被满足
#

17. ResourceQuota/LimitRange 导致 Pod 无法创建的排障中从事件、Admission 日志与配额占用三处定位

A LimitRange 不影响创建
B ResourceQuota 超限会导致 Pod 创建失败 ✓ 正确答案
C 配额占用无法查看
D Admission 不拒绝超限请求
#

18. 存储挂载失败的排障中 PV/PVC 绑定状态、CSI 驱动日志与 kubelet 卷管理器挂载如何定位

A 挂载失败与 PVC 无关
B CSI 驱动日志无价值
C kubelet 不参与挂载
D PVC 未 Bound 会导致挂载失败 ✓ 正确答案
#

19. 节点磁盘压力(DiskPressure)触发驱逐与只读的排查中镜像堆积、日志增长与 emptyDir 占用如何治理

A 磁盘压力不会驱逐
B 日志增长不影响磁盘
C emptyDir 无磁盘占用
D 镜像堆积会导致 DiskPressure ✓ 正确答案
#

20. 集群 DNS 故障排障中 CoreDNS 副本状态、上游 forward 配置与 ndots 搜索域对解析延迟的影响

A DNS 故障只与镜像有关
B forward 配置不影响解析
C CoreDNS 副本无需检查
D ndots 与 search 域影响解析延迟 ✓ 正确答案
#

21. 集群升级时的排障预案中 etcd 备份、版本兼容与回滚策略?

A 升级无需备份
B 升级前应备份 etcd 以便回滚 ✓ 正确答案
C kubelet 可高于 apiserver 任意版本
D 回滚只降 worker