7.3 Disaster runbook과 감사
Disaster runbook은 담당자가 평소와 다른 환경에서도 실행할 수 있어야 합니다. 개인 기억이나 shell history에 의존하지 않습니다.
Runbook 필수 항목
- Incident commander와 승인권자
- RPO와 RTO 및 복구 우선순위
- Backup catalog, key, credential 접근 경로
- Infrastructure 생성과 network 격리
- Backup 선택, restore, PITR 명령
- Database와 application 검증 query
- Traffic 전환과 rollback 기준
- 고객과 내부 communication
- 임시 자원 정리와 사후 분석
Command에는 placeholder와 위험 표시를 넣고 production identifier를 기본값으로 두지 않습니다. 시간을 다루는 모든 단계에 timezone을 명시합니다.
감사 증거
- Backup과 archive job 결과와 변경 불가능한 log
- Repository access와 delete audit
- Encryption key rotation 기록
- Restore drill 날짜, 결과, 실제 RPO와 RTO
- 실패와 예외 승인
- Runbook review와 담당자 교육
Compliance checklist 통과와 복구 가능성은 같지 않습니다. 감사 자료에 실제 restore 결과와 business validation을 포함합니다. Runbook은 infrastructure, PostgreSQL major version, backup 도구 변경 때마다 재시험합니다.