1. 混沌实验的故障注入类别(进程、网络、磁盘、时钟、状态损坏)如何按风险排序并沉淀为可复用故障库
请说明混沌实验的故障注入类别(进程、网络、磁盘、时钟、状态损坏)如何按风险排序并沉淀为可复用故障库?
- 故障注入类别的风险排序
- 风险排序的依据(影响范围、可逆性)
- 沉淀为可复用故障库
混沌实验的故障注入类别按「风险从小到大」排序,便于「先低风险后高风险」渐进验证。常见排序:① 进程故障(kill 进程)——风险低,影响单实例,可逆(可重启);② 内存/CPU 压力——风险中低,影响性能,可逆(停止压力);③ 网络故障(延迟、丢包)——风险中,影响范围较大,可逆(移除故障);④ 磁盘故障(磁盘满、IO 延迟)——风险中高,可能影响数据,部分可逆;⑤ 时钟故障(时间偏移)——风险中高,影响依赖时间的逻辑,较难立即恢复;⑥ 状态损坏(数据损坏、状态异常)——风险最高,可能造成数据丢失,最难恢复。风险排序依据:① 影响范围(单实例 vs 全局);② 可逆性(能否快速恢复);③ 数据/状态影响(是否损坏数据);④ 恢复复杂度。沉淀故障库:把「验证过的、参数化的故障实验」沉淀为「可复用故障库」(如 Chaos Hub、Litmus 实验模板),按「风险等级」分类,标注「触发条件、参数、影响、回滚」,供团队按需复用。故障库让「实验标准化、可复用、风险可控」。
故障注入有风险梯度——进程故障低危、数据/状态损坏高危。排序依据「影响范围、可逆性、数据影响」。沉淀故障库按「风险分级 + 参数化」复用,是「平台化混沌工程」的基础。