磁盘满了,清理日志删了 200G,五分钟后又满了。我先给自己泡了杯茶,做好了打持久战的准备。我打开了这个服务的部署记录,发现昨晚有人偷偷发布。那一刻我觉得自己还是很专业的

重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我把这台机器的登录审计打开了,谁改的终于查得到

这台服务器上的服务有十一个,只有三个还有人维护。我不知道该说什么,就笑了笑。我在心里给运维同学这次的响应速度点了个赞。办公室安静得能听见键盘声

我把这次的变更记了下来,下次至少有个参考。我先确认了一遍前置条件,再动手。我把服务重启了一遍,它好了,但我依然不知道原因。我把这条经验写进了团队 wiki

我登上了那台机器,第一件事是看磁盘。我重新看了一遍手上的计划,把风险项标了出来。我打开了这台机器的负载曲线,发现它每两小时抖一下。我沉默了,但心里是服的

我把这台机器的日志清了一遍,第二天又满了。我把整条链路在心里复盘了一遍。我把这个服务的连接池预热加上了,第一波流量终于稳了。好在最后有惊无险

这台机器的存活时间已经超过了一千天。我发现自己居然没法反驳。我把这个服务的启动顺序调整了,依赖的问题终于没了。我把它写进了组内的避坑文档第一章

重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我愣了两秒,然后继续敲代码。我看了一眼监控大盘,CPU 曲线已经贴着天花板了。我把它写进了组内的避坑文档第一章

这台机器的负载曲线比我的心电图还波动。我想了想,觉得这话没法接。我在心里给这次的容量扩了倍,结果只用了一半。第二天这个方案就变成了团队标准做法

这台机器的配置是我三年前定的,当时的量只有现在的一成。我发现自己居然没法反驳。我在心里给这台机器的生命周期做了个备注,明年该换了。这条经验值直接拉满