导航栏 ×
你的位置: 范文 > 工作总结 > 导航

工作总结

发表时间:2026-04-26

[实用]一线运维工作总结。

干了八年运维,踩过的坑比写的文档多。今儿不说漂亮话,把过去一年我亲手处置的几桩烂事儿摊开揉碎,说说到底怎么把人、技术、流程拧成一股绳的。

一、凌晨三点,光模块烧了

某政务云平台,凌晨两点十七分,告警涌进来——“支付接口超时率15%”。我冲到现场时,网络组已经在console线上筛日志,存储组在扫iostat,业务开发那边有人吼:“防火墙策略谁改的?”说实话,这种开场白我听了不下二十遍,每次都觉得又好笑又无奈。

我蹲在机柜前,先干了两件小事:第一,在群里打了六个字——“所有人,报命令”。三十秒内,A报“show interface transceiver”,B报“ethtool -S eth0 | grep crc”,C报“检查后端存储时延”。碎片凑一块,我发现端口rx_crc_errors每秒涨30个,相邻端口是0。第二件,指定网络组长做唯一操手,其他人只许看,不许敲键盘——去年有一次,三个人同时往一台交换机发配置,直接把SSH锁死,那次真想把键盘摔了。

定位到是某业务分区突发流量导致光模块误码率飙升。换备件、切流量,十五分钟后恢复。但真正让我记到现在的不是抢修,是事后复盘那条匿名留言:“当时应该先查模块温度,而不是错包数。”这人说得对——温度异常才是前置指标。从此我们的应急卡牌上多了一行:“第一步,show environment temperature。”

二、磁盘写满,研发和运维差点打起来

那次是日志服务把共享存储打爆了,三个业务集群同时hang。我在研发部现场,把他们的写入模式实时画成折线图——每秒钟4000次随机写,而他们以为只有200次顺序写。开发经理脸都绿了,我也没好到哪去,因为监控阈值是我设的,根本没预警到这个量级。

吵了两个小时,最后签了一份《资源使用承诺书》,不是挂在墙上的文件,而是一个git仓库。里面放着每个服务的资源画像基线(比如“日志服务:峰值IOPS≤800,写放大因子≤1.2”)、压测报告和运维侧的硬件极限表。任何变更导致指标偏离基线超过20%,自动拉起一个“研发-运维”快速会话。今年确实没再因为资源滥用出过故障——但说实话,这条规矩是我们用三次停机换来的,每次都是血泪教训。

三、互备演练,第一次差点把LVM干废

我休过一次假,回来听说核心数据库行锁堵了四十分钟,值班的应用工程师连杀阻塞会话的权限都没有。那感觉就像你明明带了伞,结果伞是漏的。

回来我就做了一件“看起来荒唐”的事:每周五下午,随机抽两个人互换工位。第一次,做网络的同事去处理存储慢查询,他误敲了dd if=/dev/zero of=/dev/sdb,幸好目标盘是测试环境,但我们全都吓出一身冷汗。从此演练前多了一条铁律:“任何写操作,必须先lsblk确认设备名,两人复核。”半年之后,团队里任何一个人休假,剩下的都能顶上去。

故障卡牌也是那时候做的。我把过去三年四十多起真实故障写在扑克牌大小的卡片上,正面是现象和拓扑简图,背面是当年实际用的排查命令(比如ss -tan | grep :3306 | wc -l)和最终根因。新人入职第一个月就是打牌——抽五张,十五分钟内写出处置思路。有个新来的哥们抽到“MySQL连接数突增到5000”,他写了“重启数据库”,我说你看看背面——当年真正原因是连接池泄漏,重启只是掩盖。他愣了三秒,然后那周都在看连接池源码。

四、说说那些没法写进流程的东西

有一次跨部门协作,研发死活不肯加批量刷盘开关,理由是“改动太大,排期两个月”。我没办法,请对方组长下了班在楼下抽了根烟,把监控面板直接怼到他手机上——那个日志服务的写延迟曲线已经快成垂直线了。他看了半分钟,说“行,下周给你出一个实验性分支”。有时候,数据和面子都不好使,一根烟反而好使。

还有一次,变更新增了一条路由,按标准流程走完三问(能回滚吗?回滚步骤别人看得懂吗?有人站在变更点上喊cut吗?)结果上线后还是把隔壁网段搞瘫了。因为回滚脚本里少写了一句no ip route的完整版本号。那天晚上我蹲在机房门口啃着凉包子想:流程再细,也防不住一个标点符号的错误。后来我们在所有变更脚本里加了“语法检查并模拟执行”的钩子,强制跑一遍show | compare才允许提交。

五、几个越干越怕的信条

  • 故障复盘最怕“已解决”三个字。 我现在要求每个复盘报告必须回答:“如果再发生一次,能不能在五分钟内自动恢复?”不能的话,就去写自动化代码。
  • 文档是用来“跑通”的,不是用来“参考”的。 所有标准操作流程,新人照着做一遍,计时。超过十五分钟,必须拆分或写工具。上个月有篇防火墙配置文档,新人做了二十二分钟,我们硬是重写到八分钟。
  • 永远给自己留一根“退路”。 我现在做任何变更前都会先在测试环境跑一遍破坏性测试——把网线拔了、把电源拉了、把磁盘写满,看回滚脚本能不能活下来。活得下来才敢上生产。

说实话,我没什么绝招。无非是凌晨查线缆查到手指发黑,是跟研发拍桌子拍完又递烟,是把所有“我以为”换成“我验证过”。这份总结要是能让你记住一件事,那就是:别信什么全能大神,信流程,信配合,信那些被骂过、摔过、改过无数遍的细节。

    想了解更多工作总结的资讯,请访问:工作总结

文章来源://www.f215.com/gongzuozongjie/224127.html