بنقرة واحدة
rl-consistency-analysis
训练与推理数据不一致的端到端根因分析。当模块映射/值比较不足以定位问题时使用,可追踪首个可信的分歧边界,过滤融合或结构性误报,遵循生产者-消费者链,并生成包含具体假设和证据的根因报告。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
训练与推理数据不一致的端到端根因分析。当模块映射/值比较不足以定位问题时使用,可追踪首个可信的分歧边界,过滤融合或结构性误报,遵循生产者-消费者链,并生成包含具体假设和证据的根因报告。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
当用户需要部署 msmodeling optix 服务化自动寻优工具时使用。负责安装与验证。
当首次使用 msmodeling optix 的用户需要根据硬件、模型、负载和优化目标推荐 MindIE/vLLM 寻优参数、搜索范围、benchmark 侧字段或 config.toml 片段时使用。
指导并自动化完成昇腾 NPU 上 MindSpeed-LLM 训练的 Profiling 数据采集。支持配置并运行带 Profiling 的模型训练,包括 CPU 采集、内存采集、不同采集级别(level0/level1/level2)和自定义 step 范围。生成的 Profiling 数据可用 MindStudio Insight 进行性能分析。当用户需要在模型训练中采集 Profiling 数据、进行训练性能分析、或执行 性能数据采集/Profiling采集 时触发。触发关键词:profiling、性能分析、性能数据采集、Profiling采集、训练框架profiling、MindSpeed-LLM profiling。
指导并自动化完成昇腾 NPU 上 MindSpeed-MM 模型训练的 Profiling 数据采集。通过识别训练脚本,自动找到配置文件并启用内置 Profiler,支持静态采集(指定起止 step)和动态采集(运行时动态开关),支持 Megatron 引擎(tools.json)和独立 FSDP2 引擎(YAML)两种配置方式。生成的 Profiling 数据可用 MindStudio Insight 进行性能分析。当用户需要在多模态模型训练中采集 Profiling 数据、进行训练性能分析、或执行 性能数据采集/Profiling采集 时触发。触发关键词:profiling、性能分析、性能数据采集、Profiling采集、多模态训练profiling、MindSpeed-MM profiling。
Skill for analyzing communication performance bottlenecks and detecting slow/fast rank issues in Ascend NPU systems. Use this skill whenever you need to analyze communication efficiency, data transfer bottlenecks, or identify slow/fast rank problems using profiling data.
用于分析Ascend NPU系统中计算性能瓶颈的技能,专注于算子效率和计算优化
| name | rl-consistency-analysis |
| description | 训练与推理数据不一致的端到端根因分析。当模块映射/值比较不足以定位问题时使用,可追踪首个可信的分歧边界,过滤融合或结构性误报,遵循生产者-消费者链,并生成包含具体假设和证据的根因报告。 |
使用此技能的场景:
<output_dir>/output_0_key_mapping.json,如果 <output_dir> 不存在,先创建,其中key是训练的key, value是推理的keyscripts/run_root_cause_analysis.py 脚本生成 output_1 到 output_5module_priority_rank 为 1 和 2 的候选进行排序output_5_root_cause_report.json 获取机器可读的证据references/report_template.md 获取最终 Markdown 报告结构references/manual_case_pattern.md 获取必要时的专家推理模式output_5_root_cause_report.md:
<output_dir> 下的 output_5_root_cause_report.md 是否真实存在output_5_root_cause_report.md 缺失,则任务不能视为完成:需要按需重新运行固定脚本,并在当前轮次重新写出该 Markdown 报告,不能仅依赖 thread 中的历史记忆module_priority_rank 为 1 和 2 的候选act_fnsiluswiglugelumulactivationpython3 "<skill_root>/scripts/run_root_cause_analysis.py" \
--train "<train_dump_json_path>" \
--rollout "<rollout_dump_json_path>" \
--mapping_key "<mapping_key_json_path>" \
--out-dir "<output_dir>"
<skill_root> 是此技能目录的路径。
output_0_key_mapping.jsonoutput_1_key_mapping.*output_2_mapping.*output_3_value_compare.*output_4_module_analysis.*output_5_root_cause_report.jsonoutput_5_root_cause_report.md(由 Agent 基于模板编写,非脚本生成)output_5_root_cause_report.md 是任务完成的必需交付物。如果回答时该文件不存在,Agent 必须先补生成或重写,再声明“报告已保存”。
structural_false_positive(结构性误报)
missing_or_extra_op_between_aligned_boundary(对齐边界之间存在缺失或多余操作)
parameter_or_checkpoint_issue(参数或检查点问题)
in_module_impl_difference(模块内部实现差异)
upstream_propagation(上游传播)
如果报告识别出在对齐的上游模块和不匹配的下游模块之间有额外的推理侧激活,请调查训练侧是否缺少相同的激活,或者是否使用了不同的激活实现/配置。
有关此技能背后的具体推理模式,请阅读:
references/manual_case_pattern.mdreferences/report_template.md