[76] SRE:Service Level Objectives(SLO):把可靠性写成可交易的预算¶
- 原始来源:https://sre.google/sre-book/service-level-objectives/
- 对应章节:第 9 章(后端架构)、第 17 章(部署与运维)、第 18 章(评测体系)
一句话摘要¶
SLO 的本质不是更稳定,而是把稳定性变成一份可讨论、可度量、可权衡的合同:你用错误预算(error budget)把上线速度与可靠性放到同一张桌子上裁决。
你应该从这里带走什么(面向产品)¶
- 可靠性也是产品功能:当用户依赖你完成关键任务,稳定性就是体验的一部分;你必须把它写成指标与门槛,而不是写成我们会努力。
- 用预算管理冲突:要么你永远在争论要快还是要稳,要么你用错误预算让系统自己告诉你还能不能冒险。
工程落地要点(可执行)¶
- 先定义 SLI:你到底怎么测好用(延迟、成功率、正确率、可用性),口径要稳定可复跑。
- 再写 SLO:目标阈值、统计窗口、分位数/百分比怎么取。
- 把 error budget 接到流程里:预算健康 → 允许发布/实验;预算耗尽 → 停止变更、优先修复与回归。
常见误用提醒¶
- 把 SLO 当 KPI:SLO 是对用户的承诺,不是用来惩罚团队的指标;否则大家会用掩盖替代改进。