早上 9 点,你收到告警:K8s 集群有 3 个 Node 状态变成 Not Ready,上面运行的 47 个 Pod 被 Evicted。订单服务的 Pod 在其他节点重建后持续 CrashLoopBackOff。这不是简单的重启能解决的——Node 为什么 Not Ready?Pod 为什么被驱逐?重建后为什么起不来?本文带你完整排查 K8s 集群级故障。
一、Node Not Ready:原因全景与快速判断
1.1 Node 状态详解
# 查看所有 Node 状态
kubectl get nodes -o wide
# NAME STATUS ROLES AGE VERSION INTERNAL-IP
# worker-node-01 Ready <none> 120d v1.28.4 10.0.1.21
# worker-node-02 NotReady <none> 120d v1.28.4 10.0.1.22 ← 故障节点
# worker-node-03 NotReady <none> 120d v1.28.4 10.0.1.23 ← 故障节点
# worker-node-04 Ready <none> 90d v1.28.4 10.0.1.24
# 查看 NotReady 节点的详细信息
kubectl describe node worker-node-02
2026/7/3大约 17 分钟