在 Manus 中运行任何 Skill
一键导入
一键导入
一键在 Manus 中运行任何 Skill
开始使用spark-load
星标7
分支1
更新时间2026年5月1日 02:28
Load a model into vLLM on dual DGX Spark
安装
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
SKILL.md
readonly菜单
Load a model into vLLM on dual DGX Spark
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
Run vLLM benchmark on dual DGX Spark and record results
Start DGX Spark containers and Ray cluster for distributed inference
Check status of DGX Spark infrastructure (containers, Ray, vLLM)
Stop vLLM, Ray, and containers on dual DGX Spark
| name | spark-load |
| description | Load a model into vLLM on dual DGX Spark |
| argument-hint | model-name [--enforce-eager] [--gpu-mem 0.7] |
| allowed-tools | Bash(ssh *) Bash(curl *) Bash(source *) Read |
Arguments: $ARGUMENTS (e.g., "Qwen/Qwen3-235B-A22B-GPTQ-Int4 --enforce-eager")
Source the environment configuration:
source playbooks/dual-dgx-spark-setup/.env
Parse model name and options from $ARGUMENTS
--enforce-eager, --gpu-mem <value>Start vLLM server with log capture:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME bash -c 'python -m vllm.entrypoints.openai.api_server \
--model <MODEL> \
--tensor-parallel-size 2 \
--distributed-executor-backend ray \
--gpu-memory-utilization $DEFAULT_GPU_MEM \
--max-model-len $DEFAULT_MAX_MODEL_LEN \
--host 0.0.0.0 \
--port 8000 \
[OPTIONS] > /tmp/vllm.log 2>&1 &'"
Wait for server to be ready by checking /v1/models endpoint:
curl -s http://$SPARK1_HOST:8000/v1/modelsIf issues occur, check logs:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME tail -50 /tmp/vllm.log"
Report model loaded and ready
/v1/models endpoint is more reliable than /health for detecting readiness