con un clic
spark-load
Load a model into vLLM on dual DGX Spark
Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.
Menú
Load a model into vLLM on dual DGX Spark
Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.
Basado en la clasificación ocupacional SOC
Run vLLM benchmark on dual DGX Spark and record results
Start DGX Spark containers and Ray cluster for distributed inference
Check status of DGX Spark infrastructure (containers, Ray, vLLM)
Stop vLLM, Ray, and containers on dual DGX Spark
| name | spark-load |
| description | Load a model into vLLM on dual DGX Spark |
| argument-hint | model-name [--enforce-eager] [--gpu-mem 0.7] |
| allowed-tools | Bash(ssh *) Bash(curl *) Bash(source *) Read |
Arguments: $ARGUMENTS (e.g., "Qwen/Qwen3-235B-A22B-GPTQ-Int4 --enforce-eager")
Source the environment configuration:
source playbooks/dual-dgx-spark-setup/.env
Parse model name and options from $ARGUMENTS
--enforce-eager, --gpu-mem <value>Start vLLM server with log capture:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME bash -c 'python -m vllm.entrypoints.openai.api_server \
--model <MODEL> \
--tensor-parallel-size 2 \
--distributed-executor-backend ray \
--gpu-memory-utilization $DEFAULT_GPU_MEM \
--max-model-len $DEFAULT_MAX_MODEL_LEN \
--host 0.0.0.0 \
--port 8000 \
[OPTIONS] > /tmp/vllm.log 2>&1 &'"
Wait for server to be ready by checking /v1/models endpoint:
curl -s http://$SPARK1_HOST:8000/v1/modelsIf issues occur, check logs:
ssh $SPARK1_HOST "docker exec $CONTAINER_NAME tail -50 /tmp/vllm.log"
Report model loaded and ready
/v1/models endpoint is more reliable than /health for detecting readiness