Skip to main content

ai-inference-token-capacity-planning

星标12
分支13
更新时间2026年7月2日 09:09

Use when a user asks to plan AI inference token capacity, token budget, supply plans, SLA commitments, QoS targets, or cost boundaries. Covers token modeling, GPU resource mapping, phased rollout, QoS/SLA design, availability, latency, throughput, quota allocation, and pricing strategy. Also use for Chinese requests like 推理服务 SLA 怎么设计、Token 容量规划、年度 Token 预算、 供给计划、成本边界、可用性/延迟/吞吐承诺、SLA 违约补偿. Example prompts include "18 billion Tokens next year", "how to split N tokens into supply/cost/SLA", "AI inference budget planning", and "token quota allocation".

安装

用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。

SKILL.md
readonly