| name | transformers-docs |
| description | USE THIS SKILL WHEN working with HuggingFace Transformers: loading/fine-tuning pretrained models, Pipeline API, text generation, tokenizers, chat templates, quantization (GPTQ/AWQ/bitsandbytes/GGUF), distributed training (FSDP/DeepSpeed), inference optimization, Trainer API, or vLLM/SGLang integration. Triggers on: transformers, AutoModel, AutoTokenizer, from_pretrained, pipeline(), generate(), Trainer, BitsAndBytesConfig, chat_template. |
HuggingFace Transformers Documentation
Reference for the Transformers library โ the model-definition framework for state-of-the-art ML models across text, vision, audio, video, and multimodal tasks.
CRITICAL: grep references/ for detailed docs before answering. Individual model API docs (443 models) are NOT included โ refer users to the model doc index for specific model APIs.
Quick Start
from transformers import pipeline
pipe = pipeline("text-generation", model="meta-llama/Llama-3-8B-Instruct")
result = pipe("Hello, how are you?", max_new_tokens=100)
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3-8B-Instruct")
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3-8B-Instruct", device_map="auto")
from transformers import TrainingArguments, Trainer
args = TrainingArguments(output_dir="./output", num_train_epochs=3, per_device_train_batch_size=8)
trainer = Trainer(model=model, args=args, train_dataset=dataset)
trainer.train()
Core Concepts
| Concept | Description |
|---|
| Pipeline | High-level inference API for 30+ tasks |
| Auto Classes | AutoModel, AutoTokenizer, AutoConfig โ auto-detect model type |
| from_pretrained | Load any model/tokenizer from Hub or local path |
| Trainer | Training loop with mixed precision, distributed, callbacks |
| generate() | Text generation with multiple decoding strategies |
| Chat Templates | Jinja2 templates for chat model formatting |
| Quantization | GPTQ, AWQ, bitsandbytes, GGUF, torchao, and more |
Key Topics
Inference
references/llm_tutorial.md โ Text generation with LLMs
references/pipeline_tutorial.md โ Pipeline API tutorial
references/generation_strategies.md โ Decoding methods (greedy, beam, sampling)
references/chat_templating.md โ Chat templates
references/conversations.md โ Chat/tool use patterns
Optimization
references/attention_interface.md โ Attention backends (FlashAttention, SDPA)
references/llm_tutorial_optimization.md โ Getting the most out of LLMs
references/continuous_batching.md โ Continuous batching
references/kv_cache.md โ KV cache strategies
references/torchcompile.md โ torch.compile integration
Training
references/trainer.md โ Trainer overview
references/training.md โ Fine-tuning guide
references/deepspeed.md โ DeepSpeed integration
references/fsdp.md โ FSDP distributed training
references/accelerate.md โ Accelerate integration
Quantization
references/quantization/overview.md โ Quantization overview
references/quantization/bitsandbytes.md โ bitsandbytes (4/8-bit)
references/quantization/gptq.md โ GPTQ
references/quantization/awq.md โ AWQ
references/quantization/gguf.md โ GGUF format
Models & Preprocessors
references/custom_models.md โ Customizing models
references/fast_tokenizers.md โ Tokenizer overview
references/image_processors.md โ Image processors
references/how_to_hack_models.md โ Monkey patching models
Serving & Ecosystem
references/serve-cli/ โ Serve CLI
references/community_integrations/vllm.md โ vLLM integration
references/community_integrations/sglang.md โ SGLang integration
references/community_integrations/llama_cpp.md โ llama.cpp integration
References
references/ โ 146 doc files covering guides, API classes, quantization, serving, and ecosystem integrations
references/main_classes/ โ Core API (Trainer, Pipeline, Configuration, Tokenizer, etc.)
references/quantization/ โ 27 quantization method docs
references/community_integrations/ โ Ecosystem (vLLM, SGLang, TRL, Axolotl, etc.)