Skip to main content

benchmark-model-kernels

Inspect Hugging Face decoder layers on meta tensors and plan or run per-rank BF16, FP8, and NVFP4 GEMM or fused-MoE microbenchmarks with the bundled scripts and a local FlashInfer checkout. Use when choosing a model, GPU, TP, EP, or M/token-concurrency sweep; deriving common fused QKV and gate/up shapes without loading checkpoint weights; or using FlashInfer benchmark utilities. Do not use for end-to-end server throughput or request latency.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
NVIDIA/Model-Optimizer
آخر نشاط في المصدر
١٢ أغسطس ٢٠٢٦ في ١٦:٣٣
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٣٬٤٧٦
التفرعات
٥٥٣

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.