원클릭으로
bulk-add-model
为 dcu-inference-cookbook 批量新增模型部署文档。适用于用户要求参照指定已有模型记录,生成多个目标模型记录的场景,例如“参照 A 生成 B/C/D”。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
为 dcu-inference-cookbook 批量新增模型部署文档。适用于用户要求参照指定已有模型记录,生成多个目标模型记录的场景,例如“参照 A 生成 B/C/D”。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
| name | bulk-add-model |
| description | 为 dcu-inference-cookbook 批量新增模型部署文档。适用于用户要求参照指定已有模型记录,生成多个目标模型记录的场景,例如“参照 A 生成 B/C/D”。 |
编辑部署文档前,必须先加载并遵守同级目录中的 ../add-model/SKILL.md。
本 skill 只负责“批量派生”的编排:把“参照 A,生成 B/C/D”拆成多个符合 add-model 的新增模型任务。不要替代、弱化或复制 add-model 的规则。若本 skill 与 add-model 冲突,以 add-model 为准。
当用户只说“用 bulk-add-model”“批量加模型”“参照已有模型生成新模型”等,但没有给完整信息时,必须原样输出下面这个固定模板,不要马上开始编辑。后续凡是需要向用户呈现批量新增输入格式,也必须逐字使用同一个固定模板:
请按这个格式告诉我:
参照 <参考模型ID或名称> 的 <框架> <版本>,
生成 <目标模型1>、<目标模型2>、<目标模型3>。
可选:
- 硬件:不写则继承参考模型已有硬件
- 量化:不写则继承参考模型量化方式
- 部署方式:不写则继承参考模型已有部署方式
- 启动命令:没有现成命令 / 我会提供命令
示例:
参照 Qwen/Qwen3.5-27B 的 vLLM 0.18,
生成 Qwen3.5-2B、Qwen3.5-4B,
没有现成命令,硬件和量化继承参考模型。
如果用户已经给出参考模型、框架版本和目标模型,则不要重复展示完整引导,只补问缺失且无法通过继承规则确认的信息;模型 ID 需要用户确认时按下文规则处理。
即使用户没有重复说明,也必须默认执行以下规则:
add-model 的显存余量和硬件拓扑规则处理。不能因为复制了参考命令,就沿用参考模型的 TP / 卡数;若用户提供的命令或参考命令里的 TP 与目标模型按规则计算的结果不一致,直接按规则修改命令和表格卡数,不需要再让用户确认。只有缺少模型规模、量化方式或硬件信息导致无法计算时才询问用户。add-model 执行。执行批量新增时,用户指定什么参考模型和目标模型,就只处理什么模型。
当目标模型或本次要写入文档的量化方式属于量化模型(例如 INT8 W8A8、FP8 W8A8、INT4 W4A8、AWQ、模型名含 W8A8/INT8/FP8/INT4 等)时,必须执行以下规则。参考模型只作为当前仓库已有记录和命令模板来源,不因其发布方不是 Hygon 而阻断批量新增:
hygon/ 组织发布的模型。https://www.modelscope.cn/organization/hygon 范围内查找量化模型候选;不要去其他组织、个人页、全站搜索结果、镜像或搬运页里找替代量化模型。hygon/,不要自行替换成别的模型;先停下来说明“写入文档的量化模型必须使用 Hygon 发布的模型”,并请用户提供 hygon/ 精确 ID。参考模型可以是当前仓库中已存在的非 Hygon 记录。hygon/ 模型 ID。提示示例:
这是量化模型,规则要求只能使用 Hygon 发布的模型。
我不能用其他组织的量化版本替代。请提供 hygon/<模型ID>;
如果你确认候选 hygon/<可能ID> 正确,我再继续新增文档。
当用户没有显式填写以下信息时,按参考模型继承,而不是追问:
量化方式:继承参考模型在相同框架、相同版本、相同部署方式下的量化方式。
Qwen/Qwen3.5-27B vLLM 0.18 的 BF16 记录时,目标 Qwen3.5-2B、Qwen3.5-4B 默认也使用 BF16。硬件平台:继承参考模型在相同框架、相同版本、相同部署方式下已有的硬件平台。
BW1000 记录,则目标模型只生成 BW1000,不要自动扩展到 BW1100 或 K100_AI。BW1100、BW1000、K100_AI,且用户没有指定硬件,则目标模型继承这三种硬件。部署方式:用户没写时,继承参考模型已有的部署方式。若参考模型同时有 IFB 和 PD/xPyD,且用户没有指定,要先问用户。
继承只决定“要生成哪些记录”和“使用哪种量化方式”。TP / 卡数仍必须按目标模型重新计算。
当参考模型或目标模型不是完整模型 ID(例如用户写 Qwen3.5-2B)时,按以下规则查找:
Qwen/Qwen3.5-27B,则可优先提出 Qwen/ 命名空间下的目标模型候选。add-model 执行。解析用户的批量请求,提取:
vLLM 或 SGLangIFB 或 xPyD;用户没写时按“继承规则”处理只询问 add-model 必需但当前缺失、且不能通过继承规则确认的信息。
hygon/ 被阻断。若目标模型只写 qwen3.5-2b 这类简称,先按“用户指定模型强约束”和“ModelScope 官方链接查找规则”在确定的发布方/命名空间内查找;如果能确定唯一官方候选,可直接使用该完整 ID,不必再询问用户;如果查不到、存在多个候选或无法判断发布方,才让用户提供或确认精确 ID。hygon/ 量化目标模型,也不能扩大范围查找替代品。参考模型不受此限制。0.15 或 0.18;SGLang 只接受 0.5.10。按 add-model 的文件命名规则定位目标系列文件。
docs/model-deployment/vllm/qwen3.5.md。add-model 规则要求拆分。查找参考表格行和启动命令章节。
对每个目标模型创建独立的 add-model 子任务。
add-model 的显存余量和硬件拓扑规则确定 TP / 卡数;量化方式和硬件若由参考模型继承,也必须在计算中使用继承后的目标值。add-model 保留命令参数、环境变量、缩进、命令块结构、表格语法、anchor 和 API 示例格式。### 启动命令章节必须同步插入,并保持相同相对顺序。README.md 支持矩阵。完成前做批量校验。
当一次请求包含很多模型,或模型简称较多时,可以使用 scripts/make_batch_plan.py 生成只读任务清单和 TP 初筛估算。该脚本不修改文件;最终 TP / 卡数仍必须按 add-model 规则重新计算并直接写入,不需要用户确认。
示例:
python .claude/skills/bulk-add-model/scripts/make_batch_plan.py \
--reference Qwen/Qwen3.5-27B \
--targets Qwen/Qwen3.5-2B,Qwen/Qwen3.5-4B \
--framework vLLM \
--version 0.18 \
--hardware BW1100,BW1000,K100_AI \
--quantization BF16
如果目标模型不是完整模型 ID,必须按“用户指定模型强约束”在确定发布方/命名空间内定位精确 ID;能确定唯一官方候选时可直接使用,不必再询问用户。写入文档的量化目标模型还必须按“Hygon 量化模型规则”限制在 Hygon 发布模型内。参考模型只用当前仓库已有记录定位,不要求因非 Hygon 重新确认,也不要为了参考模型做外部搜索或发布方校验。只有目标模型查不到、存在多个候选或无法判断发布方时,才先询问用户再编辑部署文档。
当用户想要一个可复用中文 prompt,或需要再次呈现批量新增输入格式时,必须逐字给出这个固定模板:
请按这个格式告诉我:
参照 <参考模型ID或名称> 的 <框架> <版本>,
生成 <目标模型1>、<目标模型2>、<目标模型3>。
可选:
- 硬件:不写则继承参考模型已有硬件
- 量化:不写则继承参考模型量化方式
- 部署方式:不写则继承参考模型已有部署方式
- 启动命令:没有现成命令 / 我会提供命令
示例:
参照 Qwen/Qwen3.5-27B 的 vLLM 0.18,
生成 Qwen3.5-2B、Qwen3.5-4B,
没有现成命令,硬件和量化继承参考模型。
完成后说明:参考了哪些已有章节/命令、每个目标模型的 TP / 卡数如何按 add-model 规则确定、修改了哪些文件。