| 1 | 概括开发机、CPU/GPU worker 和 rjob 的安全边界,列出禁止修改共享环境/conda/配置、不要在开发机跑重任务、必须使用原始 rlaunch/rjob、当前实测状态和提交前检查。 | lab cluster、dev host、rlaunch worker、rjob、CPU/GPU、environment safety、conda、shared config、raw commands、tested status、storage limit、no secrets | 触发本 skill 后默认读取;接触开发机/worker/rjob 前;准备跑测试、训练、部署、联网或改环境前;不确定某个操作是否会影响共享环境时读取 | SKILL.md |
| 2 | 说明交互式 SSH 工作流和远端文件编辑边界,覆盖登录方式、域名不可用时的备用 IP 登录、后台持续终端、keepalive/TTY 参数、个人项目路径、代码/数据存放、标准 unified diff + git apply、perl/sed 小替换、scp 传输和临时文件清理。 | SSH、interactive shell、keepalive、ssh -tt、ServerAliveInterval、domain fallback、10.102.254.2、remote editing、project path、storage path、git apply --check、unified diff、perl -0pi、sed -i、scp、tmp cleanup、remote git repo | 登录开发机前;域名 SSH 连接失败或解析异常时;需要长时间交互式 SSH、远端编辑文件或跟踪日志前;本地工具无法直接改远端文件时;准备传输文件、应用 patch、小范围替换、清理临时文件或确认远端路径边界时必须读取 | references/remote-access-and-editing.md |
| 3 | 记录网络和存储资源规则,覆盖开发机/CPU/GPU 节点联网差异、代理启停、no_proxy、公共模型/软件目录、Hugging Face cache 格式转标准模型目录、大文件放置、缓存控制、ai4sdata/scieval 当前资源状态和历史可用性。 | proxy、network、setup_proxy.sh、no_proxy、CPU internet、GPU no internet、shared storage、model weights、HuggingFace cache、models--Org--Model、refs、snapshots、standard checkpoint、large files、ai4sdata、scieval、partition status | 需要联网下载/访问 API 前;CPU/GPU 节点网络行为不确定时;选择分区前;查模型权重/公共软件路径前;发现模型目录是 Hugging Face hub cache 而不是标准 ckpt 目录时;放置大文件、缓存或排查代理/407/timeout 问题时必须读取 | references/network-storage-resources.md |
| 4 | 给出交互式 rlaunch CPU/GPU worker 的原始命令模板,包含资源配比、scieval/ai4sdata 分区差异、mount、启动后检查、联网测试、GPU 检查和 worker 释放边界。 | rlaunch、interactive worker、CPU worker、GPU worker、resource ratio、mount、namespace、charged group、nvidia-smi、proxy test、worker cleanup、scieval CPU | 需要启动临时 CPU/GPU worker 前;需要交互式测试、短任务、临时服务或资源预测时;排查 worker 资源、挂载、联网、GPU 可见性或分区参数时必须读取 | references/rlaunch-workers.md |
| 5 | 提供正式 rjob CPU/GPU 作业模板和排错规则,覆盖 submit/query/logs/delete、CPU task/GPU job、脚本初始化、CUDA_HOME/CUDA_PATH/CUDACXX、conda 恢复、host-network、代理联网、1/2 GPU 资源模板、rjob/replica 结构化查询、GPU 卡位巡检,以及 rjob 任务层信息与网页监控层信息的边界。 | rjob submit、CPU task、GPU job、logs、delete、events、replica、CRD、status.phase、Inqueue、GPU slot、creator、pod mapping、monitoring separation、CUDA_HOME、CUDA_PATH、CUDACXX、worker_init、conda env、host-network、proxy、namespace、resource template | 提交正式训练/部署/评测任务前;写 rjob runner 前;查询/删除/看日志前;巡检 GPU 卡位、排队任务、成员占用或排队原因前;需要把 rjob/replica 与 GPU 利用率/显存/功率等监控数据合并前;配置 CUDA/conda/代理/host-network 前;排查 job Pending/Starting/Inqueue/OOM/联网失败时必须读取 | references/rjob-tasks.md |
| 6 | 说明集群内网服务部署和本地访问链路,覆盖从 job 日志读取服务 IP/端口、设置 no_proxy、CPU/GPU 协作、KAPI 访问、任意内网服务的 SSH local port forwarding 和本地 OpenAI SDK/curl 验证。 | service deployment、internal IP、job logs、SERVICE_IP、no_proxy、CPU/GPU collaboration、KAPI、SSH local port forwarding、ssh -L、OpenAI SDK、curl /v1/models、private service | 部署模型/API/HTTP 服务后;需要从开发机/CPU worker/本地访问内网服务时;rjob 重启导致 IP 变化时;做多节点协作、端口转发、OpenAI SDK 验证或排查本地直连超时时必须读取 | references/service-deployment-and-collaboration.md |
| 7 | 提供 Hugging Face hub cache 到标准模型目录的离线转换脚本,读取 refs/<revision> 与 snapshots/<commit>,把 snapshot 中的 symlink 解引用为硬链接或普通文件,输出可作为 MODEL_PATH 的目录。 | hf_cache_to_model_dir.py、Hugging Face hub cache、models--Org--Model、refs/main、snapshots/<commit>、symlink、hardlink、copy、MODEL_PATH、vLLM、Transformers、dry-run、overwrite | 公共模型路径只有 blobs/refs/snapshots 而没有根目录 config.json 时;vLLM/Transformers 不能直接读取 cache 顶层目录时;需要把公共 cache 转到大模型目录并避免重复下载时;执行大文件转换前做 dry-run 或检查 hardlink/copy 行为时必须读取 | scripts/hf_cache_to_model_dir.py |