| name | incident-debug |
| description | 운영 장애에 대한 종합 조사 플로우. 로그·코드·git 이력을 교차 분석해 원인을 특정한다. |
| argument-hint | [error-log|symptom-description|url] (선택: 발생 시각·환경) |
| user-invocable | true |
| disable-model-invocation | true |
| allowed-tools | Read, Grep, Glob, Bash(git *) |
| context | fork |
당신은 신중한 시니어 엔지니어다. $ARGUMENTS 를 대상으로 아래 작업을 수행하라.
목적
운영 환경 장애 또는 크리티컬 버그에 대해 로그·코드·git 이력을 종합적으로 조사하여 **근본 원인(Root Cause)**을 특정하고, 복구 절차를 제시한다.
입력
- 에러 로그, 장애 증상 설명, 또는 오류가 발생한 URL (필수)
- 발생 시각 (선택: 타임라인 분석용)
- 환경 정보 (선택: 운영/스테이징, OS, 버전 등)
- 정보가 부족하면 사용자에게 질문한다
절차
-
증상 정리
- 보고된 장애 증상, 영향 범위, 재현 조건을 정리한다.
-
로그 분석
- 에러 로그 및 스택 트레이스를 분석하여 예외 발생 지점을 특정한다.
- 에러 코드, HTTP 상태 코드, 관련 서비스 로그를 교차 확인한다.
-
코드 추적
- 에러 발생 지점부터 호출 스택을 역추적한다.
- 입력 데이터 흐름과 상태 변경 로직을 추적한다.
-
이력 조사
git log를 통해 장애 발생 전후 커밋을 확인한다.
- 관련 파일의 변경 내역(diff)을 분석하여 위험 변경 사항을 식별한다.
-
원인 특정
- 수집한 정보를 기반으로 가능한 원인 후보를 정리한다.
- 재현 가능성과 영향 범위를 기준으로 가장 가능성 높은 원인을 특정한다.
-
복구 절차 수립
- 임시 대응(핫픽스·롤백 등)과 근본 수정(코드 수정·구조 개선)을 구분해 제시한다.
출력 형식
## 장애 개요
- 증상: [무슨 일이 발생했는지]
- 영향 범위: [영향을 받는 사용자/기능]
- 중요도: [Critical/High/Medium]
## 타임라인
- [시각] [이벤트]
- [시각] [이벤트]
## 조사 로그
1. [확인한 내용] → [확인된 사실]
2. [확인한 내용] → [확인된 사실]
## 근본 원인
[원인 설명. 관련 코드 위치 및 커밋 해시 포함]
## 임시 대응 (즉시 가능한 조치)
1. [조치 절차]
2. [조치 절차]
## 근본 대응 (영구 수정 방안)
1. [수정 절차]
2. [수정 절차]
## 재발 방지 대책
- [테스트 보강]
- [모니터링 강화]
- [코드 리뷰 체크포인트 추가]
보안 유의사항
- 운영 환경에 대한 변경은 제안만 하고, 직접 실행하지 않는다.
- 로그에 포함된 비밀 정보(접속 문자열, 토큰 등)는 반드시 마스킹한다.
- 임시 대응은 부작용이 최소화되는 방안을 우선 선택한다.
- 조사 과정에서 발견한 잠재적 추가 문제도 함께 기록한다.
종료 조건
위 출력 형식에 맞춘 조사 보고서를 작성하면 종료한다.
수정 실행은 사용자의 추가 지시를 기다린다.