| name | self-improving-loop |
| description | Langfuse production trace를 관찰하고 품질 regression·비용 이상·실패 패턴을 자동 분석한 뒤 prompt·skill 수정안을 PR draft 형태로 제안한다. Observe → Analyze → Propose → PR 4단계 루프를 실행하며 self-improving-agent-loop ADR의 자동화 경계(Rollout/Score/Filter까지만 자동, Train/Deploy는 사람 승인)를 강제한다. |
| argument-hint | [which agent/skill to analyze?] |
| user-invocable | true |
| model | claude-opus-4-7 |
| allowed-tools | Read,Grep,Bash,mcp__cloudwatch,mcp__prometheus,mcp__langfuse__query_traces,mcp__langfuse__get_observations,mcp__langfuse__list_scores |
| ontology | {"consumes":["Skill","Agent"],"references":["Deployment"]} |
| loop-interface | {"accepts-from":["continuous-eval.report"],"emits-to":["autopilot-deploy.artifact"],"emits-signals":[]} |
When to Use
다음 상황에서 본 skill을 실행합니다.
- 특정 agent/skill의 성능 regression이 관측되었고 원인 분석과 개선안 도출이 필요할 때
- 주간/격주 정기 품질 리뷰 cadence에서 trace 샘플 기반 지속 개선이 필요할 때
continuous-eval이 faithfulness 5%p 하락 또는 user_feedback 부정 비율 임계 초과를 보고했을 때
incident-response가 SEV2/3 이벤트의 root cause를 "prompt 품질" 또는 "도구 호출 누락"으로 분류했을 때
다음 상황에서는 사용하지 않습니다.
- 폐쇄형 관리 모델(Bedrock Claude/Nova, OpenAI GPT-4.1, Gemini 2.5 등)의 weight 개선 — weight 접근 불가. prompt/라우팅 개선만 가능.
- Train/Deploy 단계 자동 실행 — ADR에 따라 사람 승인 필수이며 본 skill은 제안(PR draft)까지만 담당합니다.
Prerequisites
- Langfuse v3.x self-hosted 또는 cloud 인스턴스 (OMA가 제공하지 않음 — 외부 prerequisite) AND trace 조회 MCP 서버가
profile.yaml의 observability.trace_mcp에 등록되어 있어야 합니다. Skill은 mcp__<server_name>__* (기본 mcp__langfuse__*) 도구로 호출합니다. 미설정 시 skill은 "trace MCP not configured" 안내와 함께 종료합니다.
- Prometheus (AMP 또는 self-hosted) — latency, error_rate, token_usage 메트릭 수집.
- CloudWatch Logs — Agent 실행 로그, tool invocation 로그.
- awslabs.cloudwatch-mcp-server==0.0.25, awslabs.prometheus-mcp-server==0.2.15 MCP 서버가 설정된 상태 (공급망 보안을 위해
@latest 대신 PyPI 버전 pin 필수).
- Git 저장소에 대한 write 권한 (PR draft 생성을 위함).
- 개선 대상 agent/skill의 baseline 평가 점수가
continuous-eval로 최근 24시간 내 생성되어 있어야 합니다.
4-Stage Loop
본 skill은 engineering-playbook의 self-improving-agent-loop.md 5-Stage 설계에서 Rollout·Score·Filter 3단계를 자동화하고, Train/Deploy 2단계는 PR 승인·사람 트리거로 분리합니다. 즉 skill 내부 루프는 4단계입니다.
Stage 1: Observe — Langfuse trace 수집
개선 대상 agent/skill의 최근 trace를 시간·품질·비용 차원으로 그룹화합니다.
MCP 도구 mcp__langfuse__query_traces를 호출하여 trace를 조회합니다 (설정된 observability.trace_mcp 서버를 통해):
{
"name": "$TARGET_AGENT",
"from": "2026-05-27T00:00:00Z",
"limit":