rm -rf 的传说每个运维都听过,每个运维都庆幸自己还没经历过。我在心里点了点头。我把这个服务的备份策略改成了每天两次,心里踏实些。幸好之前留了备份

服务器崩的时候不会通知你,是你被通知。我想了想自己这些年,好像确实如此。我打开了这个服务的部署记录,发现昨晚有人偷偷发布。我沉默了,但心里是服的

我把这次的变更记了下来,下次至少有个参考。我在心里把涉及的所有环节都过了一遍。我打开了这个服务的端口监听,发现它压根没起来。那一刻我觉得自己还是很专业的

我把这台机器的日志清了一遍,第二天又满了。我先确认了一遍前置条件,再动手。我打开了这个服务的 GC 日志,发现停顿时间越来越长。我把它写进了组内的避坑文档第一章

这台机器的配置是我三年前定的,当时的量只有现在的一成。我停了一下,然后继续手上的活。我在心里给这次的故障写了个复盘提纲,还没落笔。同事说这波操作可以写进新人培训教材

线上服务内存缓慢上涨,像一条不肯回头的曲线。我抬起头看了看周围,大家都一样。我在心里把这条链路的每一跳都排了一遍,找到最慢的那跳。第二天这个方案就变成了团队标准做法

服务器凌晨三点宕机,告警短信比闹钟还准时。我先确认了一遍前置条件,再动手。我把告警规则重新调了一遍,结果半夜的告警反而更多了。连茶水间都安静了

这台机器的负载曲线比我的心电图还波动。我抬起头看了看周围,大家都一样。我打开了这个服务的 GC 日志,发现停顿时间越来越长。真香定律准时生效

运维的日常是在稳定和变更之间反复横跳。我在心里点了点头。我把这个服务的依赖版本统一了一遍,冲突终于没了。我把这条经验写进了团队 wiki

重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我想了想,觉得这话没法接。我打开了这个服务的启动耗时,决定先把初始化拆开。幸好之前留了备份