Prometheus remote_write 延迟持续升高:从队列积压到安全恢复的排查实践
适用场景 本文适用于 Prometheus 通过 remote_write 把指标发送到 Thanos Receive、Grafana Mimir、VictoriaMetrics 或其他远端存储的场景。典型问题是本地抓取仍然正常,Prometheus 查询近期数据也没有明显异常,但远端查询、告警或长期存储中的数据逐渐落
Tag
包含这个标签的文章。
适用场景 本文适用于 Prometheus 通过 remote_write 把指标发送到 Thanos Receive、Grafana Mimir、VictoriaMetrics 或其他远端存储的场景。典型问题是本地抓取仍然正常,Prometheus 查询近期数据也没有明显异常,但远端查询、告警或长期存储中的数据逐渐落
适用场景 本文适用于 Prometheus 根据错误率、延迟、资源使用率等指标触发告警,并通过 Alertmanager 发送通知的场景。典型问题是:指标在阈值附近波动,告警几分钟内反复触发和恢复;短暂采集缺口被误判为恢复;值班人员收到大量重复通知,却难以判断故障是否真正结束。 目标不是简单地“把告警调迟”,而是分别处
适用场景 本文适用于 Prometheus 运行一段时间后出现以下现象的场景: Prometheus 数据目录持续膨胀,磁盘空间很快被打满; prometheus_tsdb_head_series、prometheus_tsdb_head_chunks 持续上涨; 查询变慢,Prometheus 重启时间明显变长; 日