1. 为前端定义 SLO(如页面可用率/交互延迟达标率)的方法
如何为前端定义 SLO(服务水平目标)?页面可用率、交互延迟达标率等指标如何设定、度量与治理?
- SLI 的选择:可用性、延迟、错误率的可度量定义
- SLO 的设定方法:基线 → 目标 → 预算窗口
- SLO 的治理闭环:告警、错误预算与发布关联
定义 SLO 分四步:选 SLI——把用户体验转成可度量指标,如页面可用率(首屏成功渲染的比例,剔除网络不可达)、交互延迟达标率(INP P75 小于阈值的会话占比)、错误率(JS 异常率、请求失败率);定目标——先收集基线(当前 P75/P95 实测值),设定「跳一跳够得着」的目标(如 INP P75 < 250ms、可用率 99.5%),目标要能区分「真退化」与「噪声」;设窗口——SLO 在滚动窗口(如 28 天)内评估,容忍偶发抖动而不触发告警,只有持续违反才告警;建闭环——定义错误预算(100% - SLO),预算耗尽即冻结高风险发布,把 SLO 与发布节奏绑定。治理要点:SLO 必须有数据支撑的基线、可解释的度量口径(采样率、异常剔除规则),并定期评审(目标过紧导致告警疲劳、过松失去意义),保证 SLO 是「可执行的承诺」而非「文档里的数字」。
回答按「选指标 → 定目标 → 设窗口 → 建闭环」四步展开,强调基线驱动与错误预算机制,最后点出评审与防僵化,体现 SLO 是持续治理体系而非一次性设定。