관측 신호는 발견에서 대응까지 한 경로로 이어져야 한다

메트릭·로그·트레이스·알림을 따로 수집하지 말고 한 장애에서 서로 이동할 수 있게 설계한다.

01

Goal

SLI·SLO로 어떤 상태를 판단할지 먼저 정한다.

02

Metrics

추세·임계값·예산 소진으로 이상을 발견한다.

03

Logs

requestId·actor·error로 사건 문맥을 찾는다.

04

Trace

서비스와 DB span에서 지연 위치를 좁힌다.

05

Alert

담당자·심각도·대시보드·런북을 함께 보낸다.

06

Action

완화·rollback 후 결과를 기록한다.

장애 회고에서 목표·계기판·알림을 다시 조정한다

검수: 알림 하나에서 관련 대시보드, 로그, trace, 배포 버전, 첫 복구 행동까지 이동할 수 있어야 한다.