凌晨一点多,新版订单服务刚上线,监控群就开始刷屏:接口超时、下单失败率上涨、客服反馈用户无法提交订单。更麻烦的是,新旧版本混在同一个 Deployment 里滚动更新。我想把流量切回旧版本,却发现旧 Pod 已经被逐渐替换,回滚镜像、拉起容器、等待探针,前后折腾了十几分钟。后来我把发布方式改成...
凌晨 2 点告警炸锅,线上数据库 Pod 挂了挂挂停停,手忙脚乱地把它挂在 Deployment 下面,以为配置完了就万事大吉。结果 Pod 重启后不仅数据找不到,集群网络还直接死锁,业务大面积报错。今天我把 Deployment 与 StatefulSet 的底层区别、生产选型和踩坑避坑讲透...
上午 10 点 18 分,入口 Nginx 的 499 占比从不足 0.1% 升到了 8.6%。应用 CPU 只有 42%,内存没有明显上涨,6 个 Pod 也全部处于 Running 状态。有人看到 499 后马上判断:“这是客户端主动断开,和服务端没关系。”但客服反馈,用户打开订单查询页面...
一个横跨前端、后端和数据库的需求突然插进来:新增接口、调整页面、补单元测试,还要检查权限风险。如果把整件事一次性交给 Codex,它需要先读项目结构,再定位业务逻辑,然后修改代码、补测试、运行构建,最后还要审查自己的改动。任务不是不能完成,问题是所有探索记录、错误日志、测试输出和修改细节都挤在...
晚上 10 点,监控突然报警:接口 5xx 错误率持续升高。浏览器访问域名,HTTPS 证书正常,页面却返回 502 Bad Gateway。后端服务明还活着,在宿主机上执行 curl http://127.0.0.1:8080 也能正常响应。有人怀疑证书续期失败,有人准备重启代理,还有人开始...
热爱技术的云计算运维工程师,Python全栈工程师,分享开发经验与生活感悟。
欢迎关注我的微信公众号@运维躬行录,领取海量学习资料