| license | Apache-2.0 |
| name | fine-tuning-dataset-curator |
| description | Prepare high-quality datasets for LLM fine-tuning with filtering, deduplication, augmentation, and RLHF data formatting. Activate on: fine-tuning data, training data curation, RLHF dataset, data quality filtering, SFT dataset. NOT for: model training infrastructure (ai-engineer), prompt engineering without fine-tuning (prompt-engineer). |
| allowed-tools | Read,Write,Edit,Bash(python:*,pip:*,npm:*,npx:*) |
| category | AI & Machine Learning |
| tags | ["fine-tuning","dataset-curation","rlhf","data-quality","sft"] |
| pairs-with | [{"skill":"ai-engineer","reason":"Fine-tuned models deploy through AI engineer pipelines"},{"skill":"data-pipeline-engineer","reason":"Large-scale data extraction and transformation before curation"},{"skill":"llm-evaluation-harness","reason":"Evaluate fine-tuned model quality on curated test sets"}] |
Fine-Tuning Dataset Curator
Prepare, filter, deduplicate, and format high-quality datasets for supervised fine-tuning (SFT), RLHF, and DPO training of language models.
Activation Triggers
Activate on: "fine-tuning dataset", "training data preparation", "RLHF data", "DPO pairs", "SFT data", "data quality filtering", "dedup training data", "curate instruction dataset", "preference data"
NOT for: Model training loop implementation (ai-engineer), prompt optimization without fine-tuning (prompt-engineer), or general ETL pipelines (data-pipeline-engineer)
Quick Start
- Define the task — What behavior should the fine-tuned model exhibit? Write 10 gold-standard examples by hand first.
- Collect raw data — Scrape, export from logs, use existing datasets, or generate synthetic examples with a stronger model.
- Filter and clean — Remove duplicates, low-quality entries, PII, and off-topic examples. Target quality over quantity.
- Format for training — Convert to the target format: chat-ml for SFT, chosen/rejected pairs for DPO, reward signals for RLHF.
- Validate — Hold out 10-15% for evaluation, verify distribution balance, run a small training test before full fine-tune.
Core Capabilities
| Domain | Technologies | Notes |
|---|
| Quality Filtering | fasttext classifiers, perplexity scoring, regex rules | Remove noise before it poisons the model |
| Deduplication | MinHash (datasketch), exact hash, SimHash | Near-dedup critical for training stability |
| Augmentation | LLM-generated paraphrases, backtranslation, persona variation | 3-5x dataset size with diversity |
| Format Conversion | chat-ml, Alpaca, ShareGPT, OpenAI JSONL | Match target training framework |
| PII Removal | presidio, regex, spaCy NER | Legal requirement for most training data |
| RLHF/DPO Prep | Preference pair generation, reward model labeling | Chosen/rejected pairs with margin scoring |
Architecture Patterns
Pattern 1: SFT Data Curation Pipeline
Raw Sources ──→ [Extract] ──→ [Filter] ──→ [Dedup] ──→ [Augment] ──→ [Format] ──→ [Validate]
│ │ │ │ │ │ │
logs, docs parse to quality MinHash paraphrase chat-ml hold-out
APIs, CSVs instruction/ scoring near-dedup via LLM or JSONL eval set
response remove < persona distribution
pairs threshold variation check