机房断电二十分钟,UPS 只撑了十五分钟,最后五分钟全靠信念。我把这个服务的日志同步到了中心,排查终于不用登机器。果然现实比段子更精彩
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
线上服务内存缓慢上涨,像一条不肯回头的曲线。我想反驳,但发现他说得对。我在心里给运维同学这次的响应速度点了个赞。世界瞬间清净了
这台服务器上的服务有十一个,只有三个还有人维护。我忽然觉得,这可能就是这一行的常态。我把这个服务的开机自启加上了,重启后不用再手动拉。复盘会上我们把它列成了案例
重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我忽然觉得,这可能就是这一行的常态。我把这台机器的时间同步配上了,日志的顺序终于对了。复盘会上我们把它列成了案例
我把这台机器的日志清了一遍,第二天又满了。我把服务重启了一遍,它好了,但我依然不知道原因。感动,然后我学到了新的一课
重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我想了想自己这些年,好像确实如此。我把这台机器加进了统一监控,终于不用一个个登上去看。复盘会上我们把它列成了案例
rm -rf 的传说每个运维都听过,每个运维都庆幸自己还没经历过。我在心里点了点头。我打开 CMDB 一台一台核对变更记录,终于在第三台找到了异常。幸好之前留了备份
我把这台机器的日志清了一遍,第二天又满了。我打开记录从头到尾扫了一遍。我翻出上个月的巡检记录对比,发现指标一直是在缓慢劣化。第二天这个方案就变成了团队标准做法
我把这次的变更记了下来,下次至少有个参考。我重新看了一遍手上的计划,把风险项标了出来。我把这个服务的开机自启加上了,重启后不用再手动拉。这条经验值直接拉满
这台服务器上的服务有十一个,只有三个还有人维护。我想了想自己这些年,好像确实如此。我打开了这台机器的进程列表,有个进程占了一半内存。那一刻我觉得自己还是很专业的