name mlopsReview description Use when: reviewing ML code or experiment plans for data leakage, bias, reproducibility, and serving risk. type reference version 1.0 license MIT
mlopsReview
Skill metadata: version "1.0"; tags [mlops, review, safety]; recommended tools [].
Use this skill when reviewing ML code, notebooks, pipeline definitions, or model deployment PRs.
When to use
Reviewing ML code, notebooks, pipeline definitions, or model deployment PRs
When NOT to use
When reviewing non-ML source code — prefer devopsReview or secureReview
When reviewing documentation — prefer docsReview
Tier 1 — Safety blockers (block merge)
No training data or model weights committed to git (check for .pkl, .pt, .h5, .onnx, .csv > 1 MB).
No data leakage: transformers fitted only on training split, not on validation or test data.
No test set evaluation during model selection — test set is reserved for final evaluation only.
Random seeds set for all stochastic operations (random, numpy, framework-specific).
No hardcoded absolute file paths (/home/, /Users/, C:\).
No API keys, credentials, or tokens in notebooks, configs, or pipeline scripts.
Tier 2 — Reproducibility risk (block merge for production-facing changes)
Tier 3 — Hygiene (suggest)
Data leakage checklist
Flag any of these patterns:
Pattern Risk scaler.fit(X) before train_test_splitLeaks test statistics into training Same file used as both input and ground truth Label leakage Time-series data split randomly (not by time) Future data leaks into training fillna(df.mean()) applied before splitLeaks global statistics Feature derived from target variable Target leakage
Bias and fairness flags
When the model makes decisions affecting people, flag for review:
Review comment format
Prefix Meaning leakage:Data leakage detected — must fix reproducibility:Cannot reproduce this result — must fix bias:Potential fairness or bias concern — requires review data:Data versioning or pipeline discipline issue hygiene:Non-blocking improvement nit:Minor style preference
Verify