这台机器的负载曲线比我的心电图还波动。我想反驳,但发现他说得对。我打开了这个进程的打开文件数,发现已经到上限了。第二天这个方案就变成了团队标准做法
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我把这个端口开放了出去,后来花了两天才收回来。我默默打开了编辑器,准备一步步验证。我在心里给这次的容量扩了倍,结果只用了一半。这大概就是程序员的人生吧
这台机器的存活时间已经超过了一千天。我盯着屏幕,觉得这才是我的一天。我在心里给这台机器的生命周期做了个备注,明年该换了。我把这条经验写进了团队 wiki
运维最怕听到的是「这台机器是哪个组在用」。我笑了笑,决定不解释。我打开了这个服务的调用方列表,发现有台机器还在用旧地址。感动,然后我学到了新的一课
重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我叹了口气,然后打开了编辑器。我把这台机器的定时任务错开了,凌晨的负载终于平了。感动,然后我学到了新的一课
这个 bug 每次只在周五下午出现,我们都怀疑服务器也想过周末。我盯着屏幕,觉得这才是我的一天。我在心里给这次的容量扩了倍,结果只用了一半。感动,然后我学到了新的一课
机房断电二十分钟,UPS 只撑了十五分钟,最后五分钟全靠信念。我深呼吸了一下,决定从最可疑的地方查起。我把这个服务的启动顺序调整了,依赖的问题终于没了。连茶水间都安静了
定时任务半夜三点执行,执行到一半内存溢出,第二天一早全组人知道了。我拉了个小群,把相关同学都叫了进来。我把告警规则重新调了一遍,结果半夜的告警反而更多了。好在最后有惊无险
服务器崩的时候不会通知你,是你被通知。我想反驳,但发现他说得对。我 SSH 上去第一件事就是看磁盘和内存,果然都不太健康。第二天这个方案就变成了团队标准做法
运维的成就感来自没有告警的那一天。我听完沉默了,因为太真实了。我登上了这台机器,先看了一眼磁盘,果然是它先撑不住。幸好之前留了备份