定时任务半夜三点执行,执行到一半内存溢出,第二天一早全组人知道了。我在心里把涉及的所有环节都过了一遍。我把这个服务的资源限制加上了,它不能再吃满整台机器。真香定律准时生效

服务器的问题有一半来自人为变更,另一半来自没做的变更。我想了想自己这些年,好像确实如此。我打开了这个服务的 GC 日志,发现停顿时间越来越长。果然现实比段子更精彩

这台机器的备份策略是「看起来有备份」。我发现自己居然没法反驳。我确认了备份是可用的,才敢继续动生产环境

我把这次的故障时间线对齐了,有一分钟的空白。我重新看了一遍手上的计划,把风险项标了出来。我在心里给这台机器的生命周期做了个备注,明年该换了。复盘会上我们把它列成了案例

服务器凌晨三点宕机,告警短信比闹钟还准时。我把相关的记录都翻了出来做对照。我在心里把这次的容量规划重算了一遍,留了三成余量。果然现实比段子更精彩

这台机器的备份策略是「看起来有备份」。我笑了笑,决定不解释。我在心里把这次变更的影响面圈了一下,涉及到三个机房。第二天这个方案就变成了团队标准做法

我把这个服务重启了一次,它安静了半小时又开始了。我深呼吸了一下,决定从最可疑的地方查起。我默默把这次故障写进了值班手册。我把这条经验写进了团队 wiki

我把这次的变更记了下来,下次至少有个参考。我把整条链路在心里复盘了一遍。我在心里给这次的故障写了个复盘提纲,还没落笔。从此我多了一条团队规约

机房空调故障,服务器集体过热,那天的运维群里全是哀嚎。我在心里把涉及的所有环节都过了一遍。我把服务重启了一遍,它好了,但我依然不知道原因。我把它写进了组内的避坑文档第一章

我把这个端口开放了出去,后来花了两天才收回来。我拉了个小群,把相关同学都叫了进来。我 SSH 上去第一件事就是看磁盘和内存,果然都不太健康。从此我多了一条团队规约