본문으로 건너뛰기

7.3 Disaster runbook과 감사

Disaster runbook은 담당자가 평소와 다른 환경에서도 실행할 수 있어야 합니다. 개인 기억이나 shell history에 의존하지 않습니다.

Runbook 필수 항목

  1. Incident commander와 승인권자
  2. RPO와 RTO 및 복구 우선순위
  3. Backup catalog, key, credential 접근 경로
  4. Infrastructure 생성과 network 격리
  5. Backup 선택, restore, PITR 명령
  6. Database와 application 검증 query
  7. Traffic 전환과 rollback 기준
  8. 고객과 내부 communication
  9. 임시 자원 정리와 사후 분석

Command에는 placeholder와 위험 표시를 넣고 production identifier를 기본값으로 두지 않습니다. 시간을 다루는 모든 단계에 timezone을 명시합니다.

감사 증거

  • Backup과 archive job 결과와 변경 불가능한 log
  • Repository access와 delete audit
  • Encryption key rotation 기록
  • Restore drill 날짜, 결과, 실제 RPO와 RTO
  • 실패와 예외 승인
  • Runbook review와 담당자 교육

Compliance checklist 통과와 복구 가능성은 같지 않습니다. 감사 자료에 실제 restore 결과와 business validation을 포함합니다. Runbook은 infrastructure, PostgreSQL major version, backup 도구 변경 때마다 재시험합니다.