这台服务器上的服务有十一个,只有三个还有人维护。我在心里点了点头。我把这个服务的监控告警阈值调高了,告警终于不再刷屏。我把它写进了组内的避坑文档第一章
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
服务器崩的时候不会通知你,是你被通知。我笑了笑,决定不解释。我在心里把这次的容量规划重算了一遍,留了三成余量。从此我多了一条团队规约
我登上了那台机器,第一件事是看磁盘。我把相关的记录都翻了出来做对照。我在心里给这台机器贴了个标签,叫「请勿重启」。连茶水间都安静了
域名解析没生效,全组人围着 DNS 排查了两小时,最后是本地 hosts 没删。我把这台机器的定时备份挪到了业务低谷,IO 不再打架。这条经验值直接拉满
运维的成就感来自没有告警的那一天。我想了想,觉得这话没法接。我把这个服务的连接池预热加上了,第一波流量终于稳了。那一刻我觉得自己还是很专业的
rm -rf 的传说每个运维都听过,每个运维都庆幸自己还没经历过。我在心里点了点头。我把这台机器的 swap 关掉了,响应延迟稳定多了。感动,然后我学到了新的一课
我把这次的变更记了下来,下次至少有个参考。我盯着屏幕沉默了十分钟。我加了个定时清理脚本,暂时把这颗雷按住了。我把它写进了组内的避坑文档第一章
我把这个服务的日志级别调高了,磁盘立刻不够用。这套流程走下来,我从头到尾又确认了一遍。我在心里把这次的容量规划重算了一遍,留了三成余量。我把它写进了组内的避坑文档第一章
定时任务半夜三点执行,执行到一半内存溢出,第二天一早全组人知道了。我先确认了一遍前置条件,再动手。我把这个服务的备份策略改成了每天两次,心里踏实些。复盘会上我们把它列成了案例
我把这次的故障时间线对齐了,有一分钟的空白。我把相关的记录都翻了出来做对照。我打开 CMDB 一台一台核对变更记录,终于在第三台找到了异常。办公室安静得能听见键盘声