Claude디버깅운영로그트러블슈팅
운영 로그 기반으로 장애를 분석하는 프롬프트
변수 입력4개
변수를 채운 뒤 완성본을 복사하세요
언제 사용하나
운영에서 간헐적 장애가 났고, 남은 단서가 로그와 지표뿐일 때.
요청 전 확인
- 장애 발생 시각 전후의 로그와 지표를 모은다.
- 최근 배포/트래픽/외부 의존성 변화를 확인한다.
복사해서 쓰는 프롬프트
아래 운영 로그로 장애 원인을 분석해줘. 재현이 어려우니 로그 근거 위주로 판단해줘.
증상/영향: {{IMPACT}}
발생 시각 전후 로그: {{LOGS}}
지표(에러율/지연/트래픽): {{METRICS}}
최근 변경: {{CHANGES}}
원하는 출력:
1. 타임라인 재구성과 최초 이상 신호
2. 원인 가설과 각 근거, 반증 방법
3. 즉시 완화책(롤백/차단/제한)과 근본 조치 구분
4. 재발 방지(알림, 지표, 회로차단기) 제안placeholder 설명
{{IMPACT}}: 영향 범위/증상{{LOGS}}/{{METRICS}}: 로그·지표{{CHANGES}}: 최근 변경
입력 예시
{{IMPACT}} = "결제 API 5분간 에러율 40%"
기대 결과
타임라인, 원인 가설과 근거, 완화/근본 조치.
검증 방법
가설을 지표로 반증하고, 완화책 적용 후 지표 회복을 확인한다.
주의사항
- 로그에 개인정보/토큰이 있으면 마스킹 후 공유한다.
관련 문서
- Google SRE Postmortem: https://sre.google/sre-book/postmortem-culture/
댓글 0개
아직 댓글이 없습니다.
