主题
故障排查案例
真实生产环境故障排查案例:每个案例包含现象、排查过程、根因与修复。另推荐《云平台运维实战》板块的 Cilium NodePort 端口重叠调查报告。
文档导读
- [《K8s 节点 CPU 异常与宿主机假死深度排查实战》](./《K8s 节点 CPU 异常与宿主机假死深度排查实战》)
- K8s Work 节点上 Pod 无法启动或启动时间过长的排查手册
- K8s 跨内核版本网络互访最佳实践教材
- Rancher 下游集群节点不 Ready:Pod 解析 Rancher 域名超时(.local 搜索域 × libvirt dnsmasq 不应答)
- Rancher 新建托管集群节点注册失败:STRICT_VERIFY 中止 / 私有仓库 HTTP 误用 HTTPS / 节点缺 iptables
- RKE2 三 control-plane 节点全部宕机后的集群灾后恢复记录
- RKE2 ingress-nginx-controller 一直 ContainerCreating 排查与修复
- RKE2 新增 master 节点失败:critical configuration value mismatch between servers
- RKE2 新增 master 节点失败:多节点同时加入触发 etcd learner 死锁(too many learner members)
- RKE2 新增 master 节点失败:iptables 防火墙拦截 RKE2/Calico 端口
- RKE2 新增 master 节点显示 NotReady:镜像导入耗时与无效配置项
- RKE2 Pod 无法访问 ClusterIP(no route to host):kube-ipvs0 接口 DOWN + iptables 默认 REJECT 规则