Skip to main content

qwen38-hga-optimization

Diagnose, benchmark, and optimize the repository's HGA Qwen3.8-27B inference path on 16 GB NVIDIA GPUs, especially VRAM residency, graph reuse, speculative decoding, and split-FFN streaming. Use for performance regressions or deployment tuning in Inference/Qwen3_8_27B_VRAM16GB; do not use for unrelated models or generic llama.cpp tuning.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
vfedosov77/HierarchicalGlobalAttention
آخر نشاط في المصدر
٣٠ أغسطس ٢٠٢٦ في ٠٩:٣٠
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٧
التفرعات
٠

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.