生产环境消息积压是分布式系统中最常见的高频故障之一。本文从监控发现、根因定位、紧急处置到长期治理,完整还原一次消息队列积压的全链路排查过程,涵盖 RocketMQ 与 Kafka 两种主流 MQ 的排查差异。
一、问题背景
某电商平台大促期间,订单服务通过 RocketMQ 异步处理订单消息。大促开始后 10 分钟,监控系统连续告警:
[RocketMQ 消费延迟告警] Topic=OrderTopic, ConsumerGroup=OrderConsumerGroup
积压量: 1,250,000 条 (阈值: 100,000)
消费 TPS: 200 (正常: 2000)
生产 TPS: 5,000
2026/7/3大约 15 分钟