200多个微服务同时构建失败,线上发版卡死,开发堵在办公室门口骂娘。我盯着Jenkins那台破服务器,磁盘100%,内存飘红,连后台都进不去。那一刻我才真正明白:Jenkins不是装上就能用的,企业级的CI/CD,是一套体系,不是一个工具。装上Jenkins到用好Jenkins,中间隔着一百个...
为什么光会 strace 远远不够先说个大实话。很多刚入行的兄弟一提排查就上 strace,觉得这玩意儿万能。strace 确实好用,追系统调用和信号一把好手。可它有个致命毛病——性能开销太大了。你在一个每秒几万请求的高并发服务上直接 strace,好家伙,进程直接被你拖慢好几倍,本来没崩的可...
我把这两年折腾 Kafka 监控的经验整理出来,从 JMX 指标怎么暴露、Exporter 怎么选、Prometheus 怎么抓、Grafana 面板怎么配,到告警规则怎么写,全流程给你讲清楚。看完你照着搭一套,基本能覆盖 90% 的 Kafka 线上问题。建议先收藏,搭的时候对着看。先说清楚...
上个月某天凌晨,告警群里突然炸了:Kafka 集群某台 broker 磁盘使用率 95%,马上要撑爆。我赶紧爬起来处理,登上去一看,日志目录里堆了一堆 .log 文件,大的有几十 G,小的也有几个 G。当时心里挺懵的,Kafka 不是号称"高吞吐、零丢失"吗,怎么磁盘会爆?后来花了半宿才把问题...
凌晨2点,线上服务突然告警,业务反馈接口超时。监控显示服务正常,防火墙没动,配置也没改。你登服务器查了半天,越查越懵——网络明明是通的,业务就是跑不起来。这种场景我太熟悉了,ping、telnet、netstat 这些老伙计轮番上场,问题依旧悬而未决。最后往往是抓个包一看,才发现是某个TCP重...
热爱技术的云计算运维工程师,Python全栈工程师,分享开发经验与生活感悟。
欢迎关注我的微信公众号@运维躬行录,领取海量学习资料