主题
故障排查案例
真实生产环境故障排查案例:每个案例包含现象、排查过程、根因与修复。另推荐《云平台运维实战》板块的 Cilium NodePort 端口重叠调查报告。
文档导读
- K8s Pod CPU Load 突刺排查实战
- Rancher 新建托管集群(uat1)节点注册失败排查与修复报告
- RKE2 集群检查与修复报告(192.168.122.20)
- [《K8s 节点 CPU 异常与宿主机假死深度排查实战》](./《K8s 节点 CPU 异常与宿主机假死深度排查实战》)
- 工作日报 - 2026-07-23
- K8s Work 节点上 Pod 无法启动或启动时间过长的排查手册
- K8s 跨内核版本网络互访最佳实践教材
- Rancher 控制节点添加失败排查文档(192.168.122.36 / szb122036)
- Rancher 下游集群节点不 Ready:Pod 解析 Rancher 域名超时(.local 搜索域 × libvirt dnsmasq 不应答)
- Rancher 新建托管集群节点注册失败:STRICT_VERIFY 中止 / 私有仓库 HTTP 误用 HTTPS / 节点缺 iptables
- RKE1 + Kubernetes 1.16.3 64 核 / 2048 GB 大内存节点拆分建议
- RKE1 + Kubernetes 1.16.3 大规格物理机节点拆分与容量规划建议
- RKE1 + Kubernetes 1.16.3 节点拆分后的集群规模与管理规划
- RKE1 + Kubernetes 1.16.3 节点 IP 使用情况检查文档
- RKE1 + Kubernetes 1.16.3 CoreDNS Pod 卡在 ContainerCreating 排查文档
- rke1-k8s1.16.3 exception 节点 Pod 分布不均分析结论
- rke1-k8s1.16.3 exception 节点 Pod 分布不均排查文档
- RKE1 + Kubernetes 1.16.3 kubelet PLEG 与 docker 超时分析文档
- RKE1 + Kubernetes 1.16.3 节点 UPDATE 事件频繁排查文档
- rke1-k8s1.16.3 szb13032 节点异常排查处理记录
- RKE2 三 control-plane 节点全部宕机后的集群灾后恢复记录
- RKE2 ingress-nginx-controller 一直 ContainerCreating 排查与修复
- RKE2 新增 master 节点失败:critical configuration value mismatch between servers
- RKE2 新增 master 节点失败:多节点同时加入触发 etcd learner 死锁(too many learner members)
- RKE2 新增 master 节点失败:iptables 防火墙拦截 RKE2/Calico 端口
- RKE2 新增 master 节点显示 NotReady:镜像导入耗时与无效配置项
- RKE2 Pod 无法访问 ClusterIP(no route to host):kube-ipvs0 接口 DOWN + iptables 默认 REJECT 规则