Skip to main content

tensorrt-llm

Optimizes LLM inference with NVIDIA TensorRT for maximum throughput and lowest latency. Use for production deployment on NVIDIA GPUs (A100/H100), when you need 10-100x faster inference than PyTorch, or for serving models with quantization (FP8/INT4), in-flight batching, and multi-GPU scaling.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
math-inc/OpenGauss
آخر نشاط في المصدر
١٩ مارس ٢٠٢٦ في ١٧:٥٨
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
١٬٢٥٦
التفرعات
١١٦

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.