Skip to main content

ZhangXin8069/PyQCU

SkillsMP a collecté 40 skills depuis ZhangXin8069/PyQCU. Ouvrez un skill pour examiner sa source et ses détails.

Dernière activité source enregistrée
Catalogue SkillsMP mis à jour
skills collectés
40
Étoiles GitHub
3
Forks GitHub
0

Skills dans ce dépôt

classification en attente

Affichage de 40 skills collectés sur 40.

métier
non classé
description

PyQCU 性能基准 skill:覆盖 examples/benchmark 的通用基准,以及 dev87 strict MultiGrid 对 QUDA 的可复现公平计时与显存口径。

Langue du texte source : anglais

mis à jour
métier
non classé
description

pyqcu.cuda 目录的完整生成 skill:C++ CUDA 后端(libqcu.so)的 Cython 桥接包;含 strict QUDA-style MultiGrid、params/argv/set_ptrs 参数协议与显存生命周期约束。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

cpp/cuda/qcu/include 目录的完整生成 skill:26 个模板化 CUDA 头文件(内核内联),define.h 须镜像 pyqcu/cuda/define.py。

Langue du texte source : chinois

mis à jour
métier
non classé
description

cpp/cuda/qcu/python 目录的 C API 维护 skill:同步 pyqcu.h、qcu_api.pxd、qcu.pyx/qcu.pyi,以及 Strict MultiGrid ABI。

Langue du texte source : chinois

mis à jour
métier
non classé
description

cpp/cuda/qcu 目录的完整生成 skill:PyQCU 主 C++ CUDA 后端(hand-tuned CUDA 内核 + MPI halo 交换),含 strict QUDA-style MultiGrid、参数协议与显存生命周期不变量。

Langue du texte source : anglais

mis à jour
métier
non classé
description

pyqcu.solver 目录的完整生成 skill:BiCGStab(l)、FGMRES 与 legacy/strict QUDA-style MultiGrid,含奇偶边界、Galerkin 层级和 CUDA 持久显存约束。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

cpp/cuda/qcu/src 目录的完整生成 skill:.cu 内核源文件(include 对应头 + 模板实例化 + 启动封装)。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

pyqcu.testing 目录的完整生成 skill:全组件集成测试与 strict MultiGrid 三级快速闸门,含参考数据、CUDA/MPI、显存稳定性和日志约定。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/pyquda 目录的完整生成 skill:PyQCU 与 PyQuda-0.3.2(QUDA 1.1.0)双进程隔离对比套件——Wilson/Clover dslash、BiCGStab/CG 求解的结果与性能对比(残差/逐迭代残差/耗时/作图),含维度排布转换(pyqcu 切 t vs pyquda 切 x)与归一化锚定(m+4=1/(2κ))。

Langue du texte source : chinois

mis à jour
métier
non classé
description

pyqcu.cann 目录的完整生成 skill:Ascend NPU 的 torch 兼容层,将复数算子分解为实/虚部;含 force_use_npu 全局标志与 einsum 组合分解算法。

Langue du texte source : anglais

mis à jour
métier
non classé
description

cpp/cann 目录的完整生成 skill:昇腾 CANN C++ 后端容器目录(占位)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/cpu 目录的完整生成 skill:纯 Python 后端的 CPU 专用测试。

Langue du texte source : chinois

mis à jour
métier
non classé
description

cpp/cuda 目录的完整生成 skill:CUDA 后端容器目录,真实现位于 qcu/。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/data 目录的完整生成 skill:测试验证参考 HDF5 文件(with_data=True 时使用)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/dcu 目录的完整生成 skill:AMD DCU / ROCm (HIP) 测试。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/debug 目录的完整生成 skill:逐轮调试/修复日志(fix-log*.md),完成后升级为 logs/fix-report-*.md。

Langue du texte source : anglais

mis à jour
métier
non classé
description

logs/test76 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化,测试 MultiGpuMultigrid(pyqcu/cuda/_multi_gpu.py)相对多线程 BiStabCG 的正确性与加速比(P100×2 多线程 + V100 单线程大格子)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/dev78_1 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化,测试 MultiGpuMultigrid(pyqcu/cuda/_multi_gpu.py)相对多线程 BiStabCG 的正确性与加速比(P100×2 多线程 + V100 单线程大格子)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/dev78_2 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化 + 全求解器迭代残差图(conv/conv_plots 子命令:MG 实测 CONVERGENCE_HISTORY + 参考 BiStabCG Python 复现,逐配置/逐格子/汇总全采集)。测试…

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/test78 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化,测试 MultiGpuMultigrid(pyqcu/cuda/_multi_gpu.py)相对多线程 BiStabCG 的正确性与加速比(P100×2 多线程 + V100 单线程大格子)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/dev80、dev80_2、dev80_3 系列的完整生成 skill:大格子 MultiGrid 攻坚三代——sm_60+sm_70 fat-binary、HierarchicalCache VRAM→RAM→DISK offload(22.97GB 大格子可跑)、BatchedLocalSchur W=10 stencil 提速 12×。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/qcu/dev84 目录的完整生成 skill:16×32×32×48 MultiGrid 真实加速比攻坚套件(CUDA Graph 段回放/零拷贝标量/守卫标量内核/粗空间诊断 ρ_V),报告 dev84_report.md。

Langue du texte source : chinois

mis à jour
métier
non classé
description

pyqcu.dslash 目录的完整生成 skill:Wilson/Clover 狄拉克算子(hoping/sitting/operator 三类),含 MPI halo 交换、奇偶预处理、Galerkin 粗网格投影与反模式清单。

Langue du texte source : anglais

mis à jour
métier
non classé
description

cpp/dtk 目录的完整生成 skill:DCU/ROCm (HIP) C++ 后端容器目录(占位)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/gpu 目录的完整生成 skill:通用 GPU 测试占位(当前为空)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

pyqcu.lattice 目录的完整生成 skill:gamma/Gell-Mann 矩阵、SU(3) 检查、规范场生成与 Ward 负索引约定。

Langue du texte source : anglais

mis à jour
métier
non classé
description

cpp/cuda/qcu/logs 目录的完整生成 skill:CUDA 后端本地运行日志目录(gitignored),正式报告存放于仓库根 logs/。

Langue du texte source : anglais

mis à jour
métier
non classé
description

cpp/maca 目录的完整生成 skill:Maca C++ 后端容器目录(占位)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/npu 目录的完整生成 skill:昇腾 NPU 测试(可用 force_use_npu 在 CPU 上测 NPU 路径)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

examples/profiler 目录的完整生成 skill:torch.profiler 性能剖析,导出 Chrome trace 供 Perfetto 可视化。

Langue du texte source : chinois

mis à jour
métier
non classé
description

examples/pyqcu 目录的完整生成 skill:纯 Python 算子/求解器主测试套件(conftest 入口 + 各 conftest.*.py 变体)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

examples/qcu 目录的完整生成 skill:经 Cython 桥测 C++ CUDA 后端;含 dev73_5 多重网格性能基准套件(clean/bench/verify/collect/mktable/plots)。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

logs/results 目录的完整生成 skill:最终/剩余修复报告(权威记录)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

logs/session-2026-08-24 的完整生成 skill:bug31–37 无人值守会话验证资产(8 脚本 + README,15/15 PASS;覆盖基线/求解器族/MPI/Wuppertal/stencil/Galerkin/等价性)与确定性参考数据再生器。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

pyqcu.smear 目录的完整生成 skill:stout smearing(Morningstar-Peardon SU(3) 投影)与 Wuppertal 高斯模糊,含数值稳定性处理与 MPI 支持。

Langue du texte source : Plusieurs langues

mis à jour
métier
non classé
description

logs/test12 目录的完整生成 skill:dev74*(dev74 + dev74_1)整合测试套件 test11 的优化版 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/,测试 CUDA C++ MultiGrid 求解器性能(正确性/干净测量/参数扫描/大格子预算/加速比图表)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/test13 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化,测试 MultiGpuMultigrid(pyqcu/cuda/_multi_gpu.py)相对多线程 BiStabCG 的正确性与加速比(P100×2 多线程 + V100 单线程大格子)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

logs/test14 目录的完整生成 skill:多线程版(一线程一卡)CUDA C++ MultiGrid 求解器测试套件 — 单文件 main.py 子命令入口 + 版本化产物目录 v<ts>/ + 全部 h5py 持久化,测试 MultiGpuMultigrid(pyqcu/cuda/_multi_gpu.py)相对多线程 BiStabCG 的正确性与加速比(P100×2 多线程 + V100 单线程大格子)。

Langue du texte source : chinois

mis à jour
métier
non classé
description

examples/tilelang 目录的完整生成 skill:TileLang JIT 内核测试(CUDA)。

Langue du texte source : anglais

mis à jour
métier
non classé
description

pyqcu.tools 目录的完整生成 skill:MPI 网格/奇偶分割/维度重排/HDF5 I/O/线性代数/多重网格转移/TileLang JIT 工具集。

Langue du texte source : anglais

mis à jour
Affichage de 40 skills collectés sur 40.