一键导入
lab-cluster-1
当需要在 lab cluster 1 / PJLAB 上使用开发机、rlaunch worker 或 rjob 任务时使用;覆盖交互 SSH、安全边界、路径规范、代理、CPU/GPU 分区、训练/部署、服务访问和排错,并要求使用原始 rlaunch/rjob 命令。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
当需要在 lab cluster 1 / PJLAB 上使用开发机、rlaunch worker 或 rjob 任务时使用;覆盖交互 SSH、安全边界、路径规范、代理、CPU/GPU 分区、训练/部署、服务访问和排错,并要求使用原始 rlaunch/rjob 命令。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
将 arXiv、旧会议、旧期刊或自定义 LaTeX 论文工程迁移到目标会议/期刊投稿模板;用于模板 A 到模板 B 的 LaTeX class/style/bibliography/单双栏转换、全匿名投稿检查、页数约束、图表公式排版、PDF 可视化检查、文本/图片/表格/公式守恒、模板标准文件守恒和最终压页。
当需要部署或训练 LLM/VLM 时使用;覆盖 vLLM OpenAI-compatible 服务、多模态输入限制、Qwen3.5 工具调用、thinking/reasoning 控制、CUDA Graph 策略,以及 ms-swift SFT/DPO/GRPO full training、Megatron 长序列训练、messages loss/loss_scale、数据校验、显存排错和训练检查。
Use when installing, configuring, running, embedding, deploying, or debugging InternScience ResearchHarness as a lightweight tool-using LLM agent runtime, including CLI runs, local frontend UI, OpenAI-compatible API server, Python API, tool selection, workspaces, traces, compaction, tests, and read-only source inspection.
Use when configuring or debugging the context-overlay OpenAI-compatible proxy for deterministic prompt/context injection, prompt patching, rule matching, request routing, rejection rules, skill_dir retrieval, streaming forwarding, and local or tunneled proxy validation.
当需要用 structai.read_pdf 将 PDF 文档解析成本地 Markdown、抽取图片资源,并处理 MinerU 解析缓存或代理重试问题时使用。
Use when building, testing, or debugging LLM applications with the StructAI Python toolkit, including LLMAgent calls, structured outputs, LLM judging, batch concurrency, file/PDF utilities, text parsing, private-IP no_proxy handling, and timeout wrappers.
| name | lab-cluster-1 |
| description | 当需要在 lab cluster 1 / PJLAB 上使用开发机、rlaunch worker 或 rjob 任务时使用;覆盖交互 SSH、安全边界、路径规范、代理、CPU/GPU 分区、训练/部署、服务访问和排错,并要求使用原始 rlaunch/rjob 命令。 |
| 序号 | 文件内容概览 | 关键词 | 触发时机 | 文件路径 |
|---|---|---|---|---|
| 1 | 概括开发机、CPU/GPU worker 和 rjob 的安全边界,列出禁止修改共享环境/conda/配置、不要在开发机跑重任务、必须使用原始 rlaunch/rjob、当前实测状态和提交前检查。 | lab cluster、dev host、rlaunch worker、rjob、CPU/GPU、environment safety、conda、shared config、raw commands、tested status、storage limit、no secrets | 触发本 skill 后默认读取;接触开发机/worker/rjob 前;准备跑测试、训练、部署、联网或改环境前;不确定某个操作是否会影响共享环境时读取 | SKILL.md |
| 2 | 说明交互式 SSH 工作流和远端文件编辑边界,覆盖登录方式、域名不可用时的备用 IP 登录、后台持续终端、keepalive/TTY 参数、个人项目路径、代码/数据存放、标准 unified diff + git apply、perl/sed 小替换、scp 传输和临时文件清理。 | SSH、interactive shell、keepalive、ssh -tt、ServerAliveInterval、domain fallback、10.102.254.2、remote editing、project path、storage path、git apply --check、unified diff、perl -0pi、sed -i、scp、tmp cleanup、remote git repo | 登录开发机前;域名 SSH 连接失败或解析异常时;需要长时间交互式 SSH、远端编辑文件或跟踪日志前;本地工具无法直接改远端文件时;准备传输文件、应用 patch、小范围替换、清理临时文件或确认远端路径边界时必须读取 | references/remote-access-and-editing.md |
| 3 | 记录网络和存储资源规则,覆盖开发机/CPU/GPU 节点联网差异、代理启停、no_proxy、公共模型/软件目录、Hugging Face cache 格式转标准模型目录、大文件放置、缓存控制、ai4sdata/scieval 当前资源状态和历史可用性。 | proxy、network、setup_proxy.sh、no_proxy、CPU internet、GPU no internet、shared storage、model weights、HuggingFace cache、models--Org--Model、refs、snapshots、standard checkpoint、large files、ai4sdata、scieval、partition status | 需要联网下载/访问 API 前;CPU/GPU 节点网络行为不确定时;选择分区前;查模型权重/公共软件路径前;发现模型目录是 Hugging Face hub cache 而不是标准 ckpt 目录时;放置大文件、缓存或排查代理/407/timeout 问题时必须读取 | references/network-storage-resources.md |
| 4 | 给出交互式 rlaunch CPU/GPU worker 的原始命令模板,包含资源配比、scieval/ai4sdata 分区差异、mount、启动后检查、联网测试、GPU 检查和 worker 释放边界。 | rlaunch、interactive worker、CPU worker、GPU worker、resource ratio、mount、namespace、charged group、nvidia-smi、proxy test、worker cleanup、scieval CPU | 需要启动临时 CPU/GPU worker 前;需要交互式测试、短任务、临时服务或资源预测时;排查 worker 资源、挂载、联网、GPU 可见性或分区参数时必须读取 | references/rlaunch-workers.md |
| 5 | 提供正式 rjob CPU/GPU 作业模板和排错规则,覆盖 submit/query/logs/delete、CPU task/GPU job、脚本初始化、CUDA_HOME/CUDA_PATH/CUDACXX、conda 恢复、host-network、代理联网、1/2 GPU 资源模板、rjob/replica 结构化查询、GPU 卡位巡检,以及 rjob 任务层信息与网页监控层信息的边界。 | rjob submit、CPU task、GPU job、logs、delete、events、replica、CRD、status.phase、Inqueue、GPU slot、creator、pod mapping、monitoring separation、CUDA_HOME、CUDA_PATH、CUDACXX、worker_init、conda env、host-network、proxy、namespace、resource template | 提交正式训练/部署/评测任务前;写 rjob runner 前;查询/删除/看日志前;巡检 GPU 卡位、排队任务、成员占用或排队原因前;需要把 rjob/replica 与 GPU 利用率/显存/功率等监控数据合并前;配置 CUDA/conda/代理/host-network 前;排查 job Pending/Starting/Inqueue/OOM/联网失败时必须读取 | references/rjob-tasks.md |
| 6 | 说明集群内网服务部署和本地访问链路,覆盖从 job 日志读取服务 IP/端口、设置 no_proxy、CPU/GPU 协作、KAPI 访问、任意内网服务的 SSH local port forwarding 和本地 OpenAI SDK/curl 验证。 | service deployment、internal IP、job logs、SERVICE_IP、no_proxy、CPU/GPU collaboration、KAPI、SSH local port forwarding、ssh -L、OpenAI SDK、curl /v1/models、private service | 部署模型/API/HTTP 服务后;需要从开发机/CPU worker/本地访问内网服务时;rjob 重启导致 IP 变化时;做多节点协作、端口转发、OpenAI SDK 验证或排查本地直连超时时必须读取 | references/service-deployment-and-collaboration.md |
| 7 | 提供 Hugging Face hub cache 到标准模型目录的离线转换脚本,读取 refs/<revision> 与 snapshots/<commit>,把 snapshot 中的 symlink 解引用为硬链接或普通文件,输出可作为 MODEL_PATH 的目录。 | hf_cache_to_model_dir.py、Hugging Face hub cache、models--Org--Model、refs/main、snapshots/<commit>、symlink、hardlink、copy、MODEL_PATH、vLLM、Transformers、dry-run、overwrite | 公共模型路径只有 blobs/refs/snapshots 而没有根目录 config.json 时;vLLM/Transformers 不能直接读取 cache 顶层目录时;需要把公共 cache 转到大模型目录并避免重复下载时;执行大文件转换前做 dry-run 或检查 hardlink/copy 行为时必须读取 | scripts/hf_cache_to_model_dir.py |
git apply、远端编辑器、sed/perl 小替换、scp 传输替换和清理。rlaunch、rjob、日志和清理。ssh 'command' 只用于健康检查、只读查询、dry-run 这类简单一次性任务。rjob、持续查看日志、启动/管理 rlaunch worker 或服务。不要为这类任务反复发送独立 ssh 命令。rlaunch 和 rjob submit 命令。不要依赖远端 .bashrc 中的 gpu、cpu、pred、proxy_on、openai_on 等函数或 alias。rlaunch 申请到的 CPU/GPU 交互节点称为 worker,适合临时调试、短测试和临时服务部署。worker 可能因长时间无操作或长时间占用被释放,不适合正式长期任务。rjob submit。setup_proxy.sh、no_proxy、env | grep -i proxy 和联网测试。.bashrc、/etc/profile、conda 全局配置、系统 PATH、CUDA 软链接、代理脚本、集群 CLI 配置或其他长期生效的环境设置。/root、系统目录、公共共享目录或他人项目目录中写入持久配置,除非用户明确要求并说明影响范围。/mnt/shared-storage-user/xuwanghan/projects。代码、脚本、普通数据、日志和项目局部产物默认都放在该目录下的具体项目目录中,不要放到其他位置。/mnt/shared-storage-gpfs2/sciprismax2/xuwanghan/ 下的合适子目录,避免占满项目目录、开发机本地盘、worker 本地盘或临时目录。/tmp、/var/tmp、worker 本地盘或默认 ~/.cache。临时文件必须用后清理,避免 tmp、.cache 等目录无限增长。/mnt/shared-storage-gpfs2/sciprismax2/xuwanghan/ 下的合适子目录。conda activate agent。llmv2;llm 也用于 LLM 训练/部署但较旧,默认推荐 llmv2。以下结果包含 2026-05-20 实测、2026-05-22 更新和 2026-06-05 scieval CPU task 更新。不要把“已提交但未调度运行”的 GPU 功能描述成已完整跑通。
已完整跑通:
rlaunch 位于 /kubebrain/rlaunch,rjob 位于 /usr/local/bin/rjob。/mnt/shared-storage-user/xuwanghan/projects 创建测试文件、备份、用 sed -i 编辑、diff -u 校验、内容验证、删除测试文件和备份,清理检查通过。perl 与 sed 同属小范围机械替换工具,适用边界见下文。.tmp/change.patch,执行 git apply --check 和 git apply,内容验证通过,随后删除 patch、.tmp 和整个临时测试目录,清理检查通过。scp 传输流程:本地创建小测试文件,scp 到远端个人项目根目录,远端 grep 验证后删除远端测试文件,本地测试文件也已删除,清理检查通过。rlaunch --help、rjob submit --help。rjob 在非交互 shell 中需要先执行 source /etc/profile.d/ssh-init.sh 2>/dev/null || true。rlaunch CPU worker:2026-06-05 使用 scieval_cpu_task + --namespace=ailab-scieval 申请 4 CPU 成功,调度到 lg-cmc-h-cpu-0084.host.h.pjlab.org.cn,worker 内 nproc=4,四个共享挂载检查通过,worker 自动退出并删除 podGroup。历史上 ai4sdata 4 CPU、ai4sdata 8 CPU、scieval 8 CPU 也曾跑通;2026-06-05 当前不要把 ai4sdata 当默认可用分区。rlaunch CPU worker 外网代理:2026-06-05 在 scieval 4 CPU worker 内执行 source /jobutils/scripts/worker_init.sh、source <(curl ...setup_proxy.sh),curl -I -L https://www.google.com 返回 HTTP/1.0 200 OK 和 HTTP/2 200,wget --spider 返回 200 OK。rjob CPU 短任务:2026-06-05 使用 scieval_cpu_task + --namespace=ailab-scieval 提交 1 CPU 最小任务成功,调度到 lg-cmc-h-cpu-0065.host.h.pjlab.org.cn,任务状态 Succeeded,日志包含 nproc=1、mount_xuwanghan_ok 和 scieval_cpu_rjob_done,测试 job 已删除。2026-05 ai4sdata CPU rjob 也曾跑通;2026-06-05 当前 ai4sdata 没有 CPU/GPU 可用资源,因此 ai4sdata CPU rjob 模板只作为历史已验证模板保留。rjob CPU 外网代理:2026-06-05 scieval CPU rjob 使用 --host-network=false,job 启动后 sleep 5,再执行 setup_proxy.sh,curl -I -L https://www.google.com 返回 HTTP/1.0 200 OK 和 HTTP/2 200,wget --spider 返回 200 OK,测试 job 已删除。2026-05 ai4sdata CPU rjob 外网代理也曾跑通,测试 job codex-skill-cpu-net-nohost-1779424506 保留给运维排查;2026-06-05 当前 ai4sdata 无 CPU 资源时只作为历史验证结果。rjob GPU 短任务:ai4sdata/scieval 均已真实提交并运行到 nvidia-smi,日志可读,测试后 job 已删除。rjob submit --dry-run true:历史上 ai4sdata CPU 模板、ai4sdata/scieval GPU 常规模板均可生成 YAML;1 GPU 模板也已 dry-run 通过,资源为 --gpu=1 --cpu=22 --memory=230000。dry-run 只证明语法和资源字段可生成,不证明当前分区有可用资源。rjob host-network 服务访问:2026-05 在 ai4sdata CPU rjob 内启动 python3 -m http.server,开发机通过内网 IP 访问成功,返回 codex_service_ok,job 已删除;2026-06-05 当前 ai4sdata 无 CPU 资源时只作为历史验证结果。huggingface/hub、huggingface/zskj-hub、soft、soft-pkg、大模型目标目录和 rclone v1.68.2 均存在;find ... "*Qwen3-VL-4B*" 可找到公共模型目录。当前不可用或未完整跑通:
rlaunch GPU worker:ai4sdata 1 GPU、ai4sdata 2 GPU、scieval 1 GPU 都可执行调度命令,但当前资源不足或 pending unschedulable,未进入 GPU worker。关键边界:
--host-network=false。--host-network=true 下代理访问外网返回 407 Proxy Authentication Required,不要用于 CPU rjob 外网任务。rlaunch CPU worker 优先使用 scieval_cpu_task + --namespace=ailab-scieval。scieval_cpu_task + --namespace=ailab-scieval;查询、日志和删除时使用 KUBEBRAIN_NAMESPACE=ailab-scieval。rlaunch worker 或提交 rjob 前,先向用户说明会占用的 CPU/GPU/memory 和预计持续时间。rlaunch,正式任务用 rjob submit。scieval_cpu_task + --namespace=ailab-scieval;查询、日志和删除 scieval rjob 时加 KUBEBRAIN_NAMESPACE=ailab-scieval;ai4sdata CPU/GPU 当前不作为默认提交目标;GPU rjob 可用 ai4sdata 或 scieval,scieval 加 --namespace=ailab-scieval。command.sh 是否位于共享存储,且没有硬编码 secret。/mnt/shared-storage-user/xuwanghan/projects/<project>。/mnt/shared-storage-gpfs2/sciprismax2/xuwanghan/ 的合适子目录。/tmp、/var/tmp、worker 本地盘或默认 ~/.cache 存放长期内容。trap 'rm -rf "$RUN_TMP"' EXIT。0.0.0.0,端口是否和客户端 URL 一致。rlaunch 测试命令必须自动退出,除非用户明确要求进入交互 worker。rjob 测试任务结束后必须用 rjob delete 清理。gpu: command not found 或 cpu: command not found:不要修 .bashrc,直接使用本 skill 中的原始 rlaunch 命令。.bashrc 常见写法会在非交互 shell 中提前 return。rlaunch 申请失败:先跑对应资源的 rlaunch --predict-only,再降低 CPU/memory/GPU 或换分区。unknown charged-group 或 namespace 相关错误:核对分区矩阵;scieval 的 rlaunch CPU worker 和 CPU rjob 使用 scieval_cpu_task 且必须带 --namespace=ailab-scieval;scieval rjob 查询、日志和删除需要临时前缀 KUBEBRAIN_NAMESPACE=ailab-scieval;ai4sdata 通常不带 namespace,但 2026-06-05 当前无 CPU/GPU 可用资源。flashinfer、ninja、CUDA extension build、nvcc not found、CUDA_HOME not set 报错:不要只看开发机或 submit host 的 CUDA 路径。进入 rjob 日志或 worker 内检查 echo "$CUDA_HOME"、echo "$CUDA_PATH"、echo "$CUDACXX"、test -x "$CUDACXX"、which nvcc、nvcc --version。如果脚本 source 了 /jobutils/scripts/worker_init.sh,确认之后又恢复了 CUDA_HOME、CUDA_PATH、CUDACXX、PATH 和 conda env。--host-network=true;外网任务改用 --host-network=false,job 内 sleep 5 后再配置代理。0.0.0.0、端口是否开放、URL 是否用了正确 worker id 或私网 IP、私网地址是否在 no_proxy。rlaunch 不适合长期运行;改用 rjob submit。