Skip to main content

vllm-serving-setup

Design, deploy, and tune vLLM v0.18.2 inference serving on EKS with PagedAttention v2, Multi-LoRA, FP8 KV Cache, Chunked Prefill, and Continuous Batching. Produces Helm values.yaml, PodMonitor, HPA, and kubectl validation steps for production agentic workloads.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
aws-samples/sample-oh-my-aidlcops
آخر نشاط في المصدر
٢ مايو ٢٠٢٦ في ٠٧:١١
لغة SKILL.md المكتشفة
الكورية
النجوم
١٩
التفرعات
٥

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.