장애 대응 순서1. 탐지2. 영향도 판단3. 긴급 조치4. 원인 분석5. 후속 대응 및 재발 방지 장애 상황에서 가장 흔한 실수는 원인을 완전히 찾으려다가 복구 시점을 놓치는 것이다. 1단계 - 탐지: 모니터링 알람이 1분 내 발생했나, 슬랙에 자동 탐지 또는 통보 되었는가? - 임계치 기반 알람 (CPU, 블로킹 세션 수, 로그 사용률, replication lag)- 이상 탐지 (평소 대비 쿼리 응답시간 급증, 커넥션 수 급증)- Heartbeat/synthetic query (더미 쿼리로 응답성 체크) 2단계 - 영향도 판단: 실제 서비스 영향을 확인하여, 심각도를 분류한다. 커뮤니케이션 (등급 무관 공통)- 상태 업데이트는 일정 간격으로 선제적으로 (조용히 있으면 "방치"로 보임)- "원인 모름..