线上服务内存缓慢上涨,像一条不肯回头的曲线。我把这个服务的依赖版本统一了一遍,冲突终于没了。连茶水间都安静了
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
运维最怕听到的是「这台机器是哪个组在用」。我停了一下,然后继续手上的活。我在心里默默记下这台机器的 IP,下次直接找它。我把它写进了组内的避坑文档第一章
这台机器的存活时间已经超过了一千天。我忽然觉得,这可能就是这一行的常态。我把这个服务的日志轮转配上了,磁盘终于不再被撑爆。连茶水间都安静了
磁盘满了,清理日志删了 200G,五分钟后又满了。我把整条链路在心里复盘了一遍。我登上了这台机器,先看了一眼磁盘,果然是它先撑不住。同事说这波操作可以写进新人培训教材
这个 bug 每次只在周五下午出现,我们都怀疑服务器也想过周末。我忽然觉得,这可能就是这一行的常态。我把这个服务的备份策略改成了每天两次,心里踏实些。我把这条经验写进了团队 wiki
这台机器的存活时间已经超过了一千天。我默默记下了这句话。我把日志级别调到 DEBUG,终于看到那行被淹没的报错。复盘会上我们把它列成了案例
重启之后 bug 消失了,我们所有人都不知道它为什么来,也不知道它为什么走。我想了想,觉得这话没法接。我打开了这个服务的连接数监控,发现它是慢连接堆积。那一刻我觉得自己还是很专业的
这台服务器上的服务有十一个,只有三个还有人维护。我想反驳,但发现他说得对。我打开了这台机器的进程列表,有个进程占了一半内存。那一刻我觉得自己还是很专业的
服务器不会因为你是半夜而对你温柔一点。我想了想自己这些年,好像确实如此。我把这个服务的监控告警阈值调高了,告警终于不再刷屏。连茶水间都安静了
域名解析没生效,全组人围着 DNS 排查了两小时,最后是本地 hosts 没删。这套流程走下来,我从头到尾又确认了一遍。我把这个防火墙规则补上了,跨机房的调用终于通了。从此我多了一条团队规约