我把这个端口开放了出去,后来花了两天才收回来。我默默打开了编辑器,准备一步步验证。我在心里给这台机器的生命周期做了个备注,明年该换了。第二天这个方案就变成了团队标准做法

服务器凌晨三点宕机,告警短信比闹钟还准时。我打开记录从头到尾扫了一遍。我打开了这台机器的负载曲线,发现它每两小时抖一下

机房空调故障,服务器集体过热,那天的运维群里全是哀嚎。我先确认了一遍前置条件,再动手。我打开 CMDB 一台一台核对变更记录,终于在第三台找到了异常。复盘会上我们把它列成了案例

我登上了那台机器,第一件事是看磁盘。这套流程走下来,我从头到尾又确认了一遍。我在心里把这次变更的影响面圈了一下,涉及到三个机房。我把这条经验写进了团队 wiki

我把这次的故障时间线对齐了,有一分钟的空白。我重新看了一遍手上的计划,把风险项标了出来。我把这个服务的降级开关打开了,核心链路终于保住。第二天这个方案就变成了团队标准做法

服务器崩的时候不会通知你,是你被通知。我发现自己居然没法反驳。我在心里把这条链路的每一跳都排了一遍,找到最慢的那跳。同事说这波操作可以写进新人培训教材

运维最怕听到的是「这台机器是哪个组在用」。我抬起头看了看周围,大家都一样。我把这台机器的 swap 关掉了,响应延迟稳定多了。果然现实比段子更精彩

定时任务半夜三点执行,执行到一半内存溢出,第二天一早全组人知道了。我把整条链路在心里复盘了一遍。我把这台机器的内核对齐了一遍,虚拟化下的问题少了。办公室安静得能听见键盘声

运维的日常是在稳定和变更之间反复横跳。我把这台机器的 swap 关掉了,响应延迟稳定多了。办公室安静得能听见键盘声

重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我愣了两秒,然后继续敲代码。我把这个防火墙规则补上了,跨机房的调用终于通了。果然现实比段子更精彩