Skip to main content

ai-inference-token-capacity-planning

스타12
포크13
업데이트2026년 7월 2일 09:09

Use when a user asks to plan AI inference token capacity, token budget, supply plans, SLA commitments, QoS targets, or cost boundaries. Covers token modeling, GPU resource mapping, phased rollout, QoS/SLA design, availability, latency, throughput, quota allocation, and pricing strategy. Also use for Chinese requests like 推理服务 SLA 怎么设计、Token 容量规划、年度 Token 预算、 供给计划、成本边界、可用性/延迟/吞吐承诺、SLA 违约补偿. Example prompts include "18 billion Tokens next year", "how to split N tokens into supply/cost/SLA", "AI inference budget planning", and "token quota allocation".

설치

Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.

SKILL.md
readonly