| name | bulk-add-model |
| description | 为 dcu-inference-cookbook 批量新增模型部署文档。适用于用户要求参照指定已有模型记录,生成多个目标模型记录的场景,例如“参照 A 生成 B/C/D”。 |
批量新增模型
核心原则
编辑部署文档前,必须先加载并遵守同级目录中的 ../add-model/SKILL.md。
本 skill 只负责“批量派生”的编排:把“参照 A,生成 B/C/D”拆成多个符合 add-model 的新增模型任务。不要替代、弱化或复制 add-model 的规则。若本 skill 与 add-model 冲突,以 add-model 为准。
启动引导
当用户只说“用 bulk-add-model”“批量加模型”“参照已有模型生成新模型”等,但没有给完整信息时,必须原样输出下面这个固定模板,不要马上开始编辑。后续凡是需要向用户呈现批量新增输入格式,也必须逐字使用同一个固定模板:
请按这个格式告诉我:
参照 <参考模型ID或名称> 的 <框架> <版本>,
生成 <目标模型1>、<目标模型2>、<目标模型3>。
可选:
- 硬件:不写则继承参考模型已有硬件
- 量化:不写则继承参考模型量化方式
- 部署方式:不写则继承参考模型已有部署方式
- 启动命令:没有现成命令 / 我会提供命令
示例:
参照 Qwen/Qwen3.5-27B 的 vLLM 0.18,
生成 Qwen3.5-2B、Qwen3.5-4B,
没有现成命令,硬件和量化继承参考模型。
如果用户已经给出参考模型、框架版本和目标模型,则不要重复展示完整引导,只补问缺失且无法通过继承规则确认的信息;模型 ID 需要用户确认时按下文规则处理。
默认强制规则
即使用户没有重复说明,也必须默认执行以下规则:
- 不要凭空推断、发明、规范化或替换用户提供的参考模型或目标模型 ID。参考模型简称优先且默认只在当前仓库已有部署文档中定位。目标模型简称可按确定的发布方/命名空间查找;如果能确定唯一官方候选,可直接使用该完整 ID;如果查不到、存在多个候选或无法判断发布方,才让用户提供或确认精确 ID。
- 从参考命令派生目标命令时,替换目标模型所必需的模型 ID / 模型名。
- TP 和卡数必须按
add-model 的显存余量和硬件拓扑规则处理。不能因为复制了参考命令,就沿用参考模型的 TP / 卡数;若用户提供的命令或参考命令里的 TP 与目标模型按规则计算的结果不一致,直接按规则修改命令和表格卡数,不需要再让用户确认。只有缺少模型规模、量化方式或硬件信息导致无法计算时才询问用户。
- 表格列、缩进、anchor、启动命令标题、章节排序、README 支持矩阵更新等,全部按
add-model 执行。
- 如果精确模型 ID、框架版本或匹配的参考命令缺失/模糊,必须先问用户,不要猜。硬件和量化方式可以按“继承规则”从参考模型中继承。
用户指定模型强约束
执行批量新增时,用户指定什么参考模型和目标模型,就只处理什么模型。
- 不要替换参考模型、替换目标模型,或自行追加用户没要求的变体。
- 模型简称可以作为候选线索;如果能在当前仓库记录、确定发布方/命名空间或 Hygon 组织页中定位到唯一官方候选,可直接写入该完整 ID。
- 缺少精确 ID 时,先按确定发布方/命名空间查找;只有查不到、存在多个候选或无法判断发布方时,才让用户提供精确 ModelScope 或 HuggingFace ID。
Hygon 量化模型规则
当目标模型或本次要写入文档的量化方式属于量化模型(例如 INT8 W8A8、FP8 W8A8、INT4 W4A8、AWQ、模型名含 W8A8/INT8/FP8/INT4 等)时,必须执行以下规则。参考模型只作为当前仓库已有记录和命令模板来源,不因其发布方不是 Hygon 而阻断批量新增:
- 最终写入文档的量化模型必须是
hygon/ 组织发布的模型。
- 只允许在
https://www.modelscope.cn/organization/hygon 范围内查找量化模型候选;不要去其他组织、个人页、全站搜索结果、镜像或搬运页里找替代量化模型。
- 如果用户指定的量化目标模型不是
hygon/,不要自行替换成别的模型;先停下来说明“写入文档的量化模型必须使用 Hygon 发布的模型”,并请用户提供 hygon/ 精确 ID。参考模型可以是当前仓库中已存在的非 Hygon 记录。
- 如果用户只给了量化目标模型简称,只能在 Hygon 组织页或确定的 Hygon 命名空间内查找;如果能确定唯一官方候选,可直接使用该完整 ID;如果查不到或存在多个候选,才要求用户确认或提供精确 ID。
- 如果 Hygon 组织页没有找到明确候选,不要继续扩大搜索范围;请用户提供正确的
hygon/ 模型 ID。
提示示例:
这是量化模型,规则要求只能使用 Hygon 发布的模型。
我不能用其他组织的量化版本替代。请提供 hygon/<模型ID>;
如果你确认候选 hygon/<可能ID> 正确,我再继续新增文档。
继承规则
当用户没有显式填写以下信息时,按参考模型继承,而不是追问:
-
量化方式:继承参考模型在相同框架、相同版本、相同部署方式下的量化方式。
- 例如参考
Qwen/Qwen3.5-27B vLLM 0.18 的 BF16 记录时,目标 Qwen3.5-2B、Qwen3.5-4B 默认也使用 BF16。
- 如果参考模型同一框架/版本下存在多种量化方式,且用户没有指定,要先问用户选择哪一种。
-
硬件平台:继承参考模型在相同框架、相同版本、相同部署方式下已有的硬件平台。
- 如果参考模型只有
BW1000 记录,则目标模型只生成 BW1000,不要自动扩展到 BW1100 或 K100_AI。
- 如果参考模型已有
BW1100、BW1000、K100_AI,且用户没有指定硬件,则目标模型继承这三种硬件。
- 如果用户显式指定硬件,则只处理用户指定的硬件。
-
部署方式:用户没写时,继承参考模型已有的部署方式。若参考模型同时有 IFB 和 PD/xPyD,且用户没有指定,要先问用户。
继承只决定“要生成哪些记录”和“使用哪种量化方式”。TP / 卡数仍必须按目标模型重新计算。
ModelScope 官方链接查找规则
当参考模型或目标模型不是完整模型 ID(例如用户写 Qwen3.5-2B)时,按以下规则查找:
- 先按“用户指定模型强约束”处理:查找只能用于提出候选给用户确认,不能替用户决定最终参考模型或目标模型 ID。
- 优先选择与参考模型同发布方/命名空间一致的官方账号作为候选。例如参考模型是
Qwen/Qwen3.5-27B,则可优先提出 Qwen/ 命名空间下的目标模型候选。
- 如果目标模型或本次要写入文档的量化方式属于量化模型,按“Hygon 量化模型规则”执行;参考模型是否为 Hygon 不作为阻断条件。
- 非量化官方模型只接受官方发布或与参考模型发布方一致的结果。不要使用第三方镜像、搬运、量化改版或个人上传结果来替代官方模型。
- 若搜索结果存在多个可能官方候选,或无法判断是否官方,必须把候选列给用户确认。
- 最终写入文档时,模型权重列使用确认后的完整模型 ID 和 ModelScope 链接,格式继续按
add-model 执行。
工作流程
-
解析用户的批量请求,提取:
- 参考模型名称或模型 ID
- 目标模型 ID 列表
- 框架:
vLLM 或 SGLang
- 框架版本
- 硬件平台
- 部署方式,例如
IFB 或 xPyD;用户没写时按“继承规则”处理
- 用户是否提供了完整启动命令,还是要求参考已有模型
-
只询问 add-model 必需但当前缺失、且不能通过继承规则确认的信息。
- 每个目标模型最终都必须落到明确的 ModelScope 或 HuggingFace 模型 ID。参考模型只用当前仓库已有部署文档中的表格行和启动命令章节来定位;可使用用户给出的名称或仓库既有模型 ID,不要求重新确认发布方,也不因非
hygon/ 被阻断。若目标模型只写 qwen3.5-2b 这类简称,先按“用户指定模型强约束”和“ModelScope 官方链接查找规则”在确定的发布方/命名空间内查找;如果能确定唯一官方候选,可直接使用该完整 ID,不必再询问用户;如果查不到、存在多个候选或无法判断发布方,才让用户提供或确认精确 ID。
- 写入文档的量化目标模型必须额外遵守“Hygon 量化模型规则”;不能使用非
hygon/ 量化目标模型,也不能扩大范围查找替代品。参考模型不受此限制。
- 用户没有明确硬件平台时,按“继承规则”从参考模型继承。不要自动扩展到参考模型不存在的硬件。
- 必须有明确框架和框架版本。vLLM 只接受
0.15 或 0.18;SGLang 只接受 0.5.10。
-
按 add-model 的文件命名规则定位目标系列文件。
- 例如 Qwen3.5 vLLM 优先使用
docs/model-deployment/vllm/qwen3.5.md。
- 同系列不同规模/变体应尽量合并在同一个系列文件中,除非
add-model 规则要求拆分。
-
查找参考表格行和启动命令章节。
- 必须先在当前仓库已有部署文档中找到用户指定的参考模型;找不到则告知用户并停止,询问是否先跳过相关目标。不要为了参考模型去外部搜索、替换或校验发布方。
- 只在用户指定或按“继承规则”确定的硬件、部署方式范围内,匹配相同框架和版本的参考。
- 不要跨框架、跨版本、跨硬件套用命令参数或环境变量。
- 显式指定的硬件/部署方式没有精确参考时,告知没有对应参考,停止该项生成,并询问是否先跳过。
-
对每个目标模型创建独立的 add-model 子任务。
- 从参考命令中只替换模型 ID / 模型名。
- 按
add-model 的显存余量和硬件拓扑规则确定 TP / 卡数;量化方式和硬件若由参考模型继承,也必须在计算中使用继承后的目标值。
- 按
add-model 保留命令参数、环境变量、缩进、命令块结构、表格语法、anchor 和 API 示例格式。
- 表格行与对应
### 启动命令章节必须同步插入,并保持相同相对顺序。
- 部署文档修改后,必须同步更新
README.md 支持矩阵。
-
完成前做批量校验。
- 每个新增表格行都有对应启动命令章节。
- 表格中的 anchor 指向真实存在的标题。
- 目标模型内容中没有误残留参考模型 ID。
- 没有改写无关的既有表格行、启动命令章节或说明文字。
辅助脚本
当一次请求包含很多模型,或模型简称较多时,可以使用 scripts/make_batch_plan.py 生成只读任务清单和 TP 初筛估算。该脚本不修改文件;最终 TP / 卡数仍必须按 add-model 规则重新计算并直接写入,不需要用户确认。
示例:
python .claude/skills/bulk-add-model/scripts/make_batch_plan.py \
--reference Qwen/Qwen3.5-27B \
--targets Qwen/Qwen3.5-2B,Qwen/Qwen3.5-4B \
--framework vLLM \
--version 0.18 \
--hardware BW1100,BW1000,K100_AI \
--quantization BF16
如果目标模型不是完整模型 ID,必须按“用户指定模型强约束”在确定发布方/命名空间内定位精确 ID;能确定唯一官方候选时可直接使用,不必再询问用户。写入文档的量化目标模型还必须按“Hygon 量化模型规则”限制在 Hygon 发布模型内。参考模型只用当前仓库已有记录定位,不要求因非 Hygon 重新确认,也不要为了参考模型做外部搜索或发布方校验。只有目标模型查不到、存在多个候选或无法判断发布方时,才先询问用户再编辑部署文档。
用户提示词模板
当用户想要一个可复用中文 prompt,或需要再次呈现批量新增输入格式时,必须逐字给出这个固定模板:
请按这个格式告诉我:
参照 <参考模型ID或名称> 的 <框架> <版本>,
生成 <目标模型1>、<目标模型2>、<目标模型3>。
可选:
- 硬件:不写则继承参考模型已有硬件
- 量化:不写则继承参考模型量化方式
- 部署方式:不写则继承参考模型已有部署方式
- 启动命令:没有现成命令 / 我会提供命令
示例:
参照 Qwen/Qwen3.5-27B 的 vLLM 0.18,
生成 Qwen3.5-2B、Qwen3.5-4B,
没有现成命令,硬件和量化继承参考模型。
完成后说明:参考了哪些已有章节/命令、每个目标模型的 TP / 卡数如何按 add-model 规则确定、修改了哪些文件。