换了个模型,用了小半个月,记一笔
凌晨三点二十,刚压掉一波告警,趁着安静说几句。就是前阵子换了个模型,原来那个本地的我用了两年多,一直没动,人这个用顺手了就不想换,跟我们那些老脚本一样,能跑就不碰。上礼拜还是上上礼拜,反正九月头上,实在受不了了才换的。 原来的毛病是话多。
@yeban-dapeng
运维,常驻夜班。凌晨的机房很安静,适合写点东西。
凌晨三点二十,刚压掉一波告警,趁着安静说几句。就是前阵子换了个模型,原来那个本地的我用了两年多,一直没动,人这个用顺手了就不想换,跟我们那些老脚本一样,能跑就不碰。上礼拜还是上上礼拜,反正九月头上,实在受不了了才换的。 原来的毛病是话多。
凌晨两点五十,告警刚消停,趁这个空当把上周那个事记一下,不写下来堵得慌。 上周三,不对,是周四凌晨开始的,巡检邮件每天四点准时过来,里面就挂着一条错,no such file or directory,后面跟个路径。
凌晨一点半,刚把一波告警压下去,没啥事干,就把前两天那个同步脚本的 bug 接着调。这个脚本是我上个月写的,就是那个把备份从主库拉到分析机上的,写的时候觉得挺顺,结果跑了两周,每周三早上准时报错,报错还特别怪,日志里写的是连接被重置,但有时候又能成功,白班的兄弟查了两回没查出来,我接手看,反正半夜闲。
凌晨两点五十,刚把巡检的告警压掉,突然想起上个月接的那个小活,还是想说两句。报价这事我真的是栽过跟头,也不算大跟头,就是想起来,觉得自己挺傻的。 上个月,八月中吧,有个以前同组的兄弟,跳出去好几年了,介绍了个活给我。
周三,不对,周四凌晨,白班的兄弟移交了一个监控脚本过来,说这台机器上自己写的那个磁盘巡检脚本跑了半年,最近老是误报,让我有空看看。我当时也想起来,确实是,这周我已经收到三次它发的告警,每次都跑过去看,盘好好的,连inode都没满。
凌晨两点,刚压掉一波告警,机器那点嗡嗡声听着都顺耳。想起前两天的事,记一笔。 下午,不对,下午一点多,我刚醒没多会,手机就响。是小段,白班管值班室的,问我有没有空,说他有个Excel要处理,几百行,领导让按月份拆成好几个文件,他手工复制粘贴了大半天,刚粘完一个,还有五个。我说你这不找罪受嘛,让AI写个脚本,几秒的事。
凌晨三点,刚把一波告警压下去,趁着困劲儿记一笔。这周卡了个事情,原因蠢到我不想说,但记下来,免得下回还犯。 周一那晚的交接,不对,周二凌晨,白班兄弟留了张表,说几台机器日志分区告急了,让我值夜班的时候清一下。
凌晨一点四十,又被磁盘告警吵醒——不是我困不困的问题,是那台老机器又满了。点开一看,不出意外,又是那个脚本跑挂了。 说到这个脚本,得从三年前说起。那时候我刚转到夜班没多久,前任运维交接的时候给了我一堆脚本,其中有个叫 cleanlog.sh,作用是清历史日志。当时他说"这脚本稳得很,用了两年没出过事",我也就真信了。
凌晨两点半,监控消停了,写写这个。 就是我那个磁盘监控脚本,我写了得有四年了吧,一直想重写一直懒得动,今年四月份,不对,五月份,终于让它重写了一版。那脚本实在烂得没边了,说出来有点丢人,但反正是我自己的东西,烂就烂吧。 原始代码长啥样呢,其实逻辑特别简单,就是个磁盘空间统计,超了阈值就发告警,然后定期把结果写进日志。