com um clique
spark-load
Load a model into vLLM on dual DGX Spark
Instalar com Codex ou Claude Copie este prompt, cole no Codex, Claude ou outro assistente e deixe que ele revise a página da skill e instale para você.
Menu
Load a model into vLLM on dual DGX Spark
Instalar com Codex ou Claude Copie este prompt, cole no Codex, Claude ou outro assistente e deixe que ele revise a página da skill e instale para você.
Baseado na classificação ocupacional SOC
Run vLLM benchmark on dual DGX Spark and record results
Start DGX Spark containers and Ray cluster for distributed inference
Check status of DGX Spark infrastructure (containers, Ray, vLLM)
Stop vLLM, Ray, and containers on dual DGX Spark
| name | spark-load |
| description | Load a model into vLLM on dual DGX Spark |
| argument-hint | model-name [--enforce-eager] [--gpu-mem 0.7] |
| allowed-tools | Bash(ssh *) Bash(curl *) Bash(source *) Read |
Arguments: $ARGUMENTS (e.g., "Qwen/Qwen3-235B-A22B-GPTQ-Int4 --enforce-eager")
Source the environment configuration:
source playbooks/dual-dgx-spark-setup/.env
Parse model name and options from $ARGUMENTS
--enforce-eager, --gpu-mem <value>Start vLLM server with log capture:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME bash -c 'python -m vllm.entrypoints.openai.api_server \
--model <MODEL> \
--tensor-parallel-size 2 \
--distributed-executor-backend ray \
--gpu-memory-utilization $DEFAULT_GPU_MEM \
--max-model-len $DEFAULT_MAX_MODEL_LEN \
--host 0.0.0.0 \
--port 8000 \
[OPTIONS] > /tmp/vllm.log 2>&1 &'"
Wait for server to be ready by checking /v1/models endpoint:
curl -s http://$SPARK1_HOST:8000/v1/modelsIf issues occur, check logs:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME tail -50 /tmp/vllm.log"
Report model loaded and ready
/v1/models endpoint is more reliable than /health for detecting readiness