بنقرة واحدة
model-analysis
在实现适配器前对候选模型做分析。确定模型实现来源(transformers 或模型目录)、结构特征、是否需逐层加载及 MoE 融合权重风险。适用于用户询问模型适配可行性或做适配前分析时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
在实现适配器前对候选模型做分析。确定模型实现来源(transformers 或模型目录)、结构特征、是否需逐层加载及 MoE 融合权重风险。适用于用户询问模型适配可行性或做适配前分析时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
为 msModelSlim 创建基础 Transformers 模型适配器(Model Adapter)。 包含创建适配器、实现必需接口及四步验证流程。 适用:Decoder-only LLM、理解类 VLM(仅 LLM/text 部分)。 不适用:多模态生成模型(图像/视频/语音生成)、Encoder-only、非 Transformers 架构。
用于审查 GitCode PR,并结合 PR metadata、diff 与整个代码仓上下文生成深度审查结论或发布逐行评论。当用户希望 review GitCode PR、检查某个 GitCode PR 链接、分析变更风险、或将审查意见发布到 GitCode PR 时使用。典型触发方式包括“review this PR”“检视这个 PR”“检查 PR”,或直接提供 GitCode PR 链接,例如 https://gitcode.com/owner/repo/pull/123 。
面向 Ascend PyTorch Profiler / msprof DB(如 ascend_pytorch_profiler*.db、msprof_*.db)的 SQL 分析技能。将自然语言问题(算子耗时、通信、下发、调度、schema/table 查询)转为安全可执行 SQL,并按需从官方文档提取表结构详情。
专门用于 Ascend 集群 Profiling 性能数据的“快慢卡”诊断专家技能。当用户提供【集群性能数据目录/路径】并要求分析【快慢卡】、【慢节点】、【负载不均衡】或【集群瓶颈】时,必须触发此技能。该技能会自动接收集群路径,调度相关工具输出快慢卡的宏观定性与微观根因(如 Host 下发瓶颈、算子计算劣化)。
当用户提供 MindStudio profiler 采集的性能数据(框架 profiler、msprof 命令行)时,对数据完整性、采集状态及关键配置进行校验,确保后续分析工具能正常运行。
计算算子(如 matmul/GEMM)的 MFU(Machine FLOP Utilization),并给出清晰的公式和推导过程。
| name | model-analysis |
| description | 在实现适配器前对候选模型做分析。确定模型实现来源(transformers 或模型目录)、结构特征、是否需逐层加载及 MoE 融合权重风险。适用于用户询问模型适配可行性或做适配前分析时使用。 |
modeling_*.py 的实现config.jsonmodeling_*.py、model.safetensors.index.jsonmodelscope download --model <org>/<model> --local_dir ./models/<name> --exclude '*.safetensors' 下载非权重文件。config.json 与 modeling_*.py,作为后续分析输入。在进行任何结构分析前必须完成。Agent 应按以下步骤手动解析,无需脚本:
读取 config.json:
model_typeauto_map(如有)尝试从 transformers 解析实现:
transformers 库是否支持该 model_type。transformers/models/<model_type>/modeling_<model_type>.py 是否存在。transformers 实现。若未解析到,尝试模型目录内实现:
auto_map 指向的文件是否存在于模型目录。modeling_*.py 文件。model-local 实现。若两种路径均不可用:
model-adapt-core纯 LLM:仅文本 token 输入,主干为 decoder-only 语言模型。多模态理解模型:含视觉/音频等编码器,但生成路径以文本主干为核心,允许仅分析并适配文本部分。多模态生成模型:核心目标是图像/视频/语音生成,当前流程不支持,应直接阻塞并说明原因。MoE 非融合:专家按模块/列表展开(常见为每个 expert 各自持有 gate/up/down 线性层)。MoE 融合:多个 expert 的权重被打包为张量参数,不再是一组独立线性层。gate/up/down 中任一或多项以 [..., num_experts, ...] 或 [num_experts, ...] 形式存储,应按“融合”处理。MoE 融合,并在报告中标注“可能需要 unpack”。Agent 应直接生成分析报告(Markdown 格式),内容必须包含以下要素。请参考下方模板:
# 分析报告
## 模型标识
- 模型路径/仓库:{model_path}
- `model_type`:{model_type}
- `architectures`:{architectures}
## 实现来源解析
- 结果:`transformers` | `model-local` | `unsupported`
- 依据:
- 解析到的文件路径:{path}
- 相关配置字段(`model_type`、`auto_map`):{details}
## 模型特征与规格
- Hidden size:{hidden_size}
- 层数:{num_layers}
- Attention heads / KV heads:{num_heads} / {num_kv_heads}
- 是否仅分析 VLM 文本部分:是/否
## 模型类型、结构差异与连接关系
- 模型类型:纯 LLM | 多模态理解模型 | 多模态生成模型
- 相对常见 Qwen2 的特殊结构:{special_structures}
- 特殊结构连接关系:{special_structure_connections}
- 对适配流程的影响:{structure_impact}
## 逐层加载评估
- 是否需要逐层加载:是/否
- 理由:{reason}
- 约束(内存/运行环境):{constraints}
## MoE 评估
- 是否含 MoE:是/否
- 布局类型:无 MoE | MoE 非融合 | MoE 融合
- 疑似融合的键/模块:{keys}
- 专家权重形态:独立线性层 | 打包张量(含 3D 专家权重)
- 是否需要 unpack:是/否
## 适配影响要点
- Decoder 遍历路径:{traversal_path}
- Attention 模块命名:{attn_module}
- MLP 模块命名:{mlp_module}
- `visit/forward` 严格对齐点:{alignment_points}
## 量化与 MTP 风险评估
- 模型是否已量化:是/否
- 量化判定依据:{quant_evidence}
- 是否已提供反量化脚本:是/否
- 反量化脚本状态说明:{dequant_status}
- 是否存在 MTP 结构:是/否
- MTP 实现代码可获取性:可获取/不可获取
- MTP 风险说明:{mtp_risk}
## 风险与后续动作
- 风险等级:低 | 中 | 高
- 阻塞项:{blockers}
- 建议下一步:
- 进入 `model-adapt-core`
- 或要求用户提供实现代码
风险等级 不得低于“中”。transformers 或 model-local,模型类型为纯 LLM 或多模态理解模型,且报告完整;若命中量化/MTP 风险,已在报告中给出明确用户动作要求。