Skip to main content

cuda-attention-kernel-patterns

Patterns and pitfalls for the ONNX domain Attention operator (opset 23/24) CUDA implementation. Use when modifying the dispatch cascade in core/providers/cuda/llm/attention.cc, writing mask/bias CUDA kernels, debugging attention test routing, or adding features to the ONNX Attention op. NOT for contrib domain MultiHeadAttention/GroupQueryAttention.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
microsoft/onnxruntime
آخر نشاط في المصدر
٢١ أغسطس ٢٠٢٦ في ٠١:٠٤
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٢١٬٦٨١
التفرعات
٤٬١٨٩

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.