Goal
SLI·SLO로 어떤 상태를 판단할지 먼저 정한다.
메트릭·로그·트레이스·알림을 따로 수집하지 말고 한 장애에서 서로 이동할 수 있게 설계한다.
SLI·SLO로 어떤 상태를 판단할지 먼저 정한다.
추세·임계값·예산 소진으로 이상을 발견한다.
requestId·actor·error로 사건 문맥을 찾는다.
서비스와 DB span에서 지연 위치를 좁힌다.
담당자·심각도·대시보드·런북을 함께 보낸다.
완화·rollback 후 결과를 기록한다.
검수: 알림 하나에서 관련 대시보드, 로그, trace, 배포 버전, 첫 복구 행동까지 이동할 수 있어야 한다.