Skip to main content

vllm-ascend

vLLM Ascend plugin for LLM inference serving on Huawei Ascend NPU. Use for offline batch inference, API server deployment, quantization inference (with msmodelslim quantized models), tensor/pipeline parallelism for distributed serving, and OpenAI-compatible API endpoints. Supports Qwen, DeepSeek, GLM, LLaMA models with Ascend-optimized kernels.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
ascend-ai-coding/awesome-ascend-skills
آخر نشاط في المصدر
١٨ مايو ٢٠٢٦ في ١٢:٣٩
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
١٦٦
التفرعات
٥٦

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.