[62] Prometheus:指标监控的事实标准(但别滥用标签)¶
- 资料类型:官方文档/系统
- 原始来源:https://prometheus.io/docs/introduction/overview/
- 对应章节:第 17 章(部署与运维:监控)
一句话¶
能监控到趋势,才谈得上治理;Prometheus 负责把系统健康度变成时间序列数据。
你该从 Prometheus 带走什么¶
- 指标口径要统一:延迟、错误率、QPS、队列长度、GPU 利用率,先定义清楚再采集。
- 标签(label)是把双刃剑:高基数标签会把系统打爆(例如 user_id/prompt 原文)。
- 与告警/门禁联动:指标不是看着爽,要能触发动作(告警、降级、回滚)。
在本书里怎么用¶
- 第 12 章把成本/延迟/错误率三类指标落到 Prometheus 指标名与告警阈值。
- 强调:记录模型版本/配置版本用于归因,但避免高基数字段。
常见误用¶
- 把 user_id、请求全文等高基数内容当 label,导致内存爆炸。
- 指标很多但没有告警与 runbook,出了事依然手忙脚乱。