Skip to main content

model-serving

LLM and ML model deployment for inference. Use when serving models in production, building AI APIs, or optimizing inference. Covers vLLM (LLM serving), TensorRT-LLM (GPU optimization), Ollama (local), BentoML (ML deployment), Triton (multi-model), LangChain (orchestration), LlamaIndex (RAG), and streaming patterns.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
ancoleman/ai-design-components
آخر نشاط في المصدر
٩ ديسمبر ٢٠٢٥ في ٢١:٠٢
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٥١٦
التفرعات
٧٣

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.