Part VII. Reliability 운영
관찰한 데이터를 사람이 행동할 수 있는 운영 체계로 바꿉니다. page와 ticket을 구분하는 alert, 사용자 관점의 SLI/SLO, error budget 소진 속도, incident runbook, capacity planning과 postmortem을 다룹니다.
- 7.1 Alert 설계: 증상 중심 경보와 noise 억제
- 7.2 SLI/SLO/Error Budget: 목표와 burn rate 계산
- 7.3 Incident runbook: 탐지/완화/진단/복구 순서
- 7.4 Capacity와 postmortem: 추세 예측과 재발 방지