| name | use-gpu |
| description | 通过 `gpu` 命令从本开发机在共享 GPU 容器中执行命令。需要运行 CUDA/PyTorch 检查、GPU 测试、训练、推理、`nvidia-smi` 或任何依赖 GPU 容器环境的命令时使用。 |
使用 GPU
在项目目录中给普通命令加上 gpu 前缀。共享文件系统会让远端直接看到当前
代码、数据和输出目录:
gpu nvidia-smi
gpu python train.py --config configs/train.yaml
gpu pytest tests/test_cuda.py
默认使用远端 daemon 环境,不自动复制本机环境变量。按需显式传递:
gpu -e CUDA_VISIBLE_DEVICES=0 python train.py
gpu -e HF_TOKEN python train.py
远端管道或重定向必须放进一个带引号的完整字符串:
gpu 'python train.py 2>&1 | tee train.log'
后台运行和任务管理:
job_id=$(gpu -d python train.py)
gpu job logs "$job_id" -f
gpu job status "$job_id"
gpu job cancel "$job_id" --wait
多个节点存在时,可先查看节点,再按标签或节点选择:
gpu node list
gpu --require h200 python train.py
gpu --node h200-main python train.py
GPU-Bridge 不自动分配 GPU。远端命令默认看到容器暴露的全部 GPU,并发任务
可能互相争用设备;需要隔离时显式设置 CUDA_VISIBLE_DEVICES。