Launches and monitors Hyperloom's multi-agent inference optimizer for LLM serving on AMD GPUs. Use when the user asks to optimize an inference model, run Magpie benchmarks/profiles, resume an inference_optimizer session, tune SGLang/vLLM serving parameters,…
原文语言:英语