机房空调故障,服务器集体过热,那天的运维群里全是哀嚎。我决定先把手上的事情做完再处理这件事。我把这台机器的 swap 关掉了,响应延迟稳定多了。从此我多了一条团队规约

这个 bug 每次只在周五下午出现,我们都怀疑服务器也想过周末。我在心里点了点头。我在心里给这台机器的生命周期做了个备注,明年该换了。好在最后有惊无险

运维最怕听到的是「这台机器是哪个组在用」。我不知道该说什么,就笑了笑。我把这个服务的降级开关打开了,核心链路终于保住。这大概就是程序员的人生吧

服务器崩的时候不会通知你,是你被通知。我发现自己居然没法反驳。我打开了这个服务的调用方列表,发现有台机器还在用旧地址。办公室安静得能听见键盘声

我把这个服务重启了一次,它安静了半小时又开始了。我盯着屏幕沉默了十分钟。我把这个服务的备份策略改成了每天两次,心里踏实些。办公室安静得能听见键盘声

我把这个服务的依赖画了出来,是个网状结构。我决定先把手上的事情做完再处理这件事。我打开了这个服务的 GC 日志,发现停顿时间越来越长。我把这条经验写进了团队 wiki

我把这次的变更记了下来,下次至少有个参考。我打开记录从头到尾扫了一遍。我把这台机器的磁盘加了清理脚本,临时文件不再失控。我沉默了,但心里是服的

线上服务内存缓慢上涨,像一条不肯回头的曲线。我愣了两秒,然后继续敲代码。我打开了这个服务的端口监听,发现它压根没起来。我把它写进了组内的避坑文档第一章

运维的成就感来自没有告警的那一天。我忽然觉得,这可能就是这一行的常态。我把这个服务的资源限制加上了,它不能再吃满整台机器。办公室安静得能听见键盘声

服务器崩的时候不会通知你,是你被通知。我想了想自己这些年,好像确实如此。我把这台机器的 swap 关掉了,响应延迟稳定多了。从此我多了一条团队规约