Skip to main content

optimizing-attention-flash

Optimizes transformer attention with Flash Attention for 2-4x speedup and 10-20x memory reduction. Use when training/running transformers with long sequences (>512 tokens), encountering GPU memory issues with attention, or need faster inference. Supports PyTorch native SDPA, flash-attn library, H100 FP8, and sliding window attention.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
davila7/claude-code-templates
آخر نشاط في المصدر
٨ يناير ٢٠٢٦ في ١٤:٢٤
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٣٠٬٢٢٩
التفرعات
٣٬٣٩٤

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.