Elasticsearch 集群红色/黄色状态、分片未分配、写入被拒——这些是 ES 运维中最棘手的问题。本文从集群状态排查、分片诊断到写入拒绝与熔断器,完整还原一次 ES 集群故障的全链路排查过程。
一、问题背景
某日志平台凌晨告警:Elasticsearch 集群状态从 green 变为 red,大量写入请求返回 429 错误,业务日志查询超时。
[告警] ES 集群状态: RED (正常: GREEN)
[告警] 未分配分片数: 15
[告警] 写入拒绝: EsRejectedExecutionException (rejected: 1280/5000)
[告警] Heap 使用率: 92% (阈值: 85%)
[告警] 查询延迟: P99 = 12s (正常: 200ms)
2026/7/3大约 13 分钟