| license | Apache-2.0 |
| name | skill-logger |
| description | Logs and scores skill usage quality, tracking output effectiveness, user satisfaction signals, and improvement opportunities. Expert in skill analytics, quality metrics, feedback loops, and continuous improvement. Activate on "skill logging", "skill quality", "skill analytics", "skill scoring", "skill performance", "skill metrics", "track skill usage", "skill improvement". NOT for creating skills (use agent-creator), skill documentation (use skill-coach), or runtime debugging (use debugger skills). |
| allowed-tools | Read,Write,Edit,Bash,Grep,Glob |
| category | Productivity & Meta |
| tags | ["logging","analytics","metrics","quality","improvement"] |
| pairs-with | [{"skill":"automatic-stateful-prompt-improver","reason":"Data for prompt optimization"},{"skill":"skill-coach","reason":"Quality tracking feeds coaching"}] |
Skill Logger
Track, measure, and improve skill quality through systematic logging and scoring.
Decision Points
Skill Category → Logging Signals Priority
Skill Category Analysis:
├─ Code Generation Skills
│ ├─ IF output type = "code" → Priority: syntax_correctness, test_pass_rate, user_edits
│ ├─ IF includes tool calls → Track: tool_success_rate, retry_count
│ └─ ELSE → Standard completion signals
│
├─ Analysis/Advisory Skills
│ ├─ IF output is recommendations → Priority: follow_up_rate, acceptance_rate
│ ├─ IF research-heavy → Track: source_quality, comprehensiveness
│ └─ ELSE → Focus on user_satisfaction, edit_ratio
│
├─ Creative/Content Skills
│ ├─ IF artistic output → Priority: user_acceptance, revision_requests
│ ├─ IF writing/documentation → Track: readability_score, user_edits
│ └─ ELSE → Standard quality metrics
│
└─ Meta/System Skills
├─ IF affects other skills → Priority: downstream_impact, system_health
├─ IF automation focused → Track: execution_success, error_recovery
└─ ELSE → Completion rate, efficiency metrics
Quality Signal Collection Strategy
Signal Availability Decision Tree:
├─ Real-time signals available?
│ ├─ YES → Collect: completion_rate, token_efficiency, tool_success
│ └─ NO → Skip to delayed collection
│
├─ User interaction possible?
│ ├─ YES → Request: thumbs_up/down, edit_ratio measurement
│ └─ NO → Infer from: retry_requests, follow_up_questions
│
├─ Output testable?
│ ├─ Code → Run: syntax_check, basic_execution
│ ├─ Data → Validate: format_compliance, completeness
│ └─ Text → Check: length_appropriateness, structure
│
└─ Delayed validation available?
├─ YES → Schedule: outcome_tracking, revert_detection
└─ NO → Mark as: immediate_signals_only
Scoring Model Selection
Based on skill usage context:
IF high_stakes_usage (production, important decisions):
→ Use strict scoring: require 90+ for "good", weight errors heavily
ELIF experimental_usage (testing, learning):
→ Use lenient scoring: 70+ acceptable, focus on learning signals
ELIF routine_usage (daily workflow):
→ Use balanced scoring: standard thresholds, efficiency emphasis
ELSE (unknown context):
→ Default to balanced scoring with conservative error handling
For the detailed multi-dimensional scoring model with specific component weights and calculation formulas, see references/scoring-rubric.md.
Failure Modes
Token Inflation Anti-Pattern
Symptoms: Skill produces unnecessarily verbose outputs, token usage 2x+ expected baseline
Detection: IF tokens_output > baseline_tokens * 2.0 AND user_edit_ratio > 0.6
Diagnosis: Skill optimizing for completeness over conciseness
Fix: Add explicit length constraints, example-based training on concise outputs