杭州运维老炮分享:服务器日常维护到底要做哪些事
我在杭州做运维第六年,带过未来科技城一个八人小团队,手里管着三十多台机器。很多人以为服务器放那儿自己就会转,真出事才慌。下面说的都是我们每周实实在在干的事,不玄乎,照做就能少踩坑。
备份永远排第一
我们每天凌晨三点对数据库做全量备份,保留七天;代码仓库每小时增量一份。去年十一月一台物理机硬盘坏了,靠备份二十分钟恢复,没丢一条订单。别侥幸,没备份的运维等于裸奔。我们还把备份副本传到另一座城市的存储,防的就是机房整层断电。
补丁和监控不能拖
系统补丁固定在每周二上午十点统一打,避开业务高峰。监控用Prometheus,CPU超八十、磁盘超九十就发钉钉告警。踩过坑的人都知道,等用户打电话来说打不开,往往已经挂了半小时。告警接的是两个人,确保半夜总有一个人看见。
每月一次体检
每月底我们会跑一遍安全扫描,清掉三个月没登录的账号,把SSH换成密钥登录。这套排期跑满一年,团队负责的业务全年故障两次,每次恢复都在十五分钟以内。说白了,运维拼的不是技术多牛,是活儿细不细。细节漏一处,迟早出大事。
日志得有人看
很多公司装了监控却没人翻日志,等容量满了才发现。我们每周抽半小时看访问和错误日志,提前揪出慢接口和刷接口的机器人。滨江一家金融客户靠这习惯,在上线前拦下了一个会拖垮数据库的统计脚本,省了一次线上事故。
预案比手速重要
真出故障,慌没用。我们给每台机器写了重启、回滚、切流量的标准动作,新人照着做也不会乱。去年一次光缆被挖断,我们八分钟切到备用线路,用户几乎无感。别天真,没演练过的预案,关键时刻没人记得住步骤。我们每季度拿其中一台机器真断一次电,练手感,团队现在处理故障像肌肉记忆。
杭州本地的便利
在杭州做运维有个好处,阿里云工单响应快,未来科技城和滨江的机房工程师随叫随到,硬盘坏了两小时就能换上。我们团队每季度还去机房做一次实地巡检,顺手把积灰的机器清一遍。这种本地化服务,是外地云厂商给不了的踏实。这也是我们一直把核心机器留在杭州、不往外地迁的原因。