跳转至

[76] SRE:Service Level Objectives(SLO):把可靠性写成可交易的预算

  • 原始来源:https://sre.google/sre-book/service-level-objectives/
  • 对应章节:第 9 章(后端架构)、第 17 章(部署与运维)、第 18 章(评测体系)

一句话摘要

SLO 的本质不是更稳定,而是把稳定性变成一份可讨论、可度量、可权衡的合同:你用错误预算(error budget)把上线速度与可靠性放到同一张桌子上裁决。

你应该从这里带走什么(面向产品)

  • 可靠性也是产品功能:当用户依赖你完成关键任务,稳定性就是体验的一部分;你必须把它写成指标与门槛,而不是写成我们会努力。
  • 用预算管理冲突:要么你永远在争论要快还是要稳,要么你用错误预算让系统自己告诉你还能不能冒险。

工程落地要点(可执行)

  • 先定义 SLI:你到底怎么测好用(延迟、成功率、正确率、可用性),口径要稳定可复跑。
  • 再写 SLO:目标阈值、统计窗口、分位数/百分比怎么取。
  • 把 error budget 接到流程里:预算健康 → 允许发布/实验;预算耗尽 → 停止变更、优先修复与回归。

常见误用提醒

  • 把 SLO 当 KPI:SLO 是对用户的承诺,不是用来惩罚团队的指标;否则大家会用掩盖替代改进。