跳转至

[62] Prometheus:指标监控的事实标准(但别滥用标签)

  • 资料类型:官方文档/系统
  • 原始来源:https://prometheus.io/docs/introduction/overview/
  • 对应章节:第 17 章(部署与运维:监控)

一句话

能监控到趋势,才谈得上治理;Prometheus 负责把系统健康度变成时间序列数据。

你该从 Prometheus 带走什么

  • 指标口径要统一:延迟、错误率、QPS、队列长度、GPU 利用率,先定义清楚再采集。
  • 标签(label)是把双刃剑:高基数标签会把系统打爆(例如 user_id/prompt 原文)。
  • 与告警/门禁联动:指标不是看着爽,要能触发动作(告警、降级、回滚)。

在本书里怎么用

  • 第 12 章把成本/延迟/错误率三类指标落到 Prometheus 指标名与告警阈值。
  • 强调:记录模型版本/配置版本用于归因,但避免高基数字段。

常见误用

  • 把 user_id、请求全文等高基数内容当 label,导致内存爆炸。
  • 指标很多但没有告警与 runbook,出了事依然手忙脚乱。