运维的日常是在稳定和变更之间反复横跳。我想反驳,但发现他说得对。我把这个服务的降级开关打开了,核心链路终于保住。复盘会上我们把它列成了案例
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我登上了那台机器,第一件事是看磁盘。我打开记录从头到尾扫了一遍。我把这台机器加进了统一监控,终于不用一个个登上去看。从此我多了一条团队规约
我把这次的故障时间线对齐了,有一分钟的空白。我决定先把手上的事情做完再处理这件事。我把这台机器的网卡队列调了一下,丢包终于没了。果然现实比段子更精彩
重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我愣了两秒,然后继续敲代码。我在心里给这个环境起了个名,叫「半生产」。果然现实比段子更精彩
机房空调故障,服务器集体过热,那天的运维群里全是哀嚎。我在心里把涉及的所有环节都过了一遍。我把这个服务的备份策略改成了每天两次,心里踏实些。第二天这个方案就变成了团队标准做法
我把这个服务的日志级别调高了,磁盘立刻不够用。我把手上的资料翻出来又读了两遍。我把这台机器的时区改成了东八区,日志时间终于看懂了。复盘会上我们把它列成了案例
这个 bug 每次只在周五下午出现,我们都怀疑服务器也想过周末。我在心里点了点头。我打开了这个服务的连接数监控,发现它是慢连接堆积
运维的日常是在稳定和变更之间反复横跳。我想反驳,但发现他说得对。我把这个服务的日志同步到了中心,排查终于不用登机器。好在最后有惊无险
域名解析没生效,全组人围着 DNS 排查了两小时,最后是本地 hosts 没删。我决定先把手上的事情做完再处理这件事。我翻出上个月的巡检记录对比,发现指标一直是在缓慢劣化。第二天这个方案就变成了团队标准做法
机房断电二十分钟,UPS 只撑了十五分钟,最后五分钟全靠信念。我重新看了一遍手上的计划,把风险项标了出来。我把这台机器的定时备份挪到了业务低谷,IO 不再打架。这条经验值直接拉满