Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

llm-inference-batching-scheduler

النجوم١٢٣
التفرعات٢٦
آخر تحديث٨ أبريل ٢٠٢٦ في ٠٢:٥٣

Guidance for implementing batching schedulers for LLM inference systems with compilation-based accelerators. This skill applies when optimizing request batching to minimize cost while meeting latency thresholds, particularly when dealing with shape compilation costs, padding overhead, and multi-bucket request distributions. Use this skill for tasks involving batch planning, shape selection, generation-length bucketing, and cost-model-driven optimization for neural network inference.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly