| name | autodl-compute |
| description | 通过 AutoDL GPU 算力跑代码、复现论文、加速实验。当用户需要「上 GPU 跑一段代码/脚本」「在云端 GPU 复现论文」「创建/管理 AutoDL 实例」「把本地仓库传到 GPU 机器上跑」「保存 GPU 环境为镜像」时使用。触发词:AutoDL、上 GPU 跑、云端复现、GPU 实例、跑训练、nvidia-smi、复现论文。 |
AutoDL 算力 Skill
用 p101-autodl CLI 把代码送上 AutoDL 的 GPU 跑。控制面(实例生命周期)+ 数据面(SSH 执行/上传)。
前置
确认已安装并配置 token:
p101-autodl gpus >/dev/null 2>&1 || echo "需要先 pip install -e . 并 export AUTODL_TOKEN=<token>"
- token 缺失时命令会直接报
AUTODL_TOKEN 未设置 并非零退出,按提示设置即可。
- 使用 Pro API 需 AutoDL 账号已完成实名/企业认证。
标准工作流
-
选规格:先看可用 GPU 与镜像 ID,不要凭空猜。
p101-autodl gpus
常用:--gpu pro6000-p(PRO6000-96G)、--gpu h800(H800-80G);PyTorch 2.0 镜像 base-image-l2t43iu6uk(cuda11.8)。
-
一站式跑(推荐):创建实例→上传本地代码→跑命令(实时日志)→收尾。
p101-autodl run \
--gpu pro6000-p --image base-image-l2t43iu6uk --cuda 118 \
--upload-dir ./repo --remote-dir /root/workspace \
--command "cd /root/workspace && pip install -r requirements.txt && python train.py" \
--on-finish power_off
--cuda 是驱动 CUDA 版本下限:118=cuda>=11.8、113=cuda>=11.3。
- 退出码 0 表示命令成功;非 0 会原样返回并以非零码退出。
-
要复用环境:跑完保存镜像,下次直接用该镜像创建。
p101-autodl run ... --save-image my-env --on-finish release
p101-autodl image ls
分步操作(需要精细控制时)
p101-autodl instance create --gpu h800 --image base-image-l2t43iu6uk --cuda 118
p101-autodl instance status pro-xxxx
p101-autodl upload pro-xxxx ./repo /root/workspace/repo
p101-autodl exec pro-xxxx "cd /root/workspace/repo && nvidia-smi && python main.py"
p101-autodl instance off pro-xxxx
成本红线(务必遵守)
- 实例一旦开机就计费。任务结束后必须
power_off(停止 GPU 计费)或 release(彻底删除)。
run 默认 --on-finish power_off,失败/取消时也会尽力自动关机。
release 不可恢复,执行前确认数据已保存(必要时先 image save)。
出错处理
- 不要伪造结果或跳过失败步骤。命令失败时把真实报错(含
request_id)展示给用户。
- SSH 连接信息缺失通常是实例还没
running,先查 instance status。
- 释放失败先确认是否已关机(释放前需先关机)。