ソース情報
- リポジトリ
- ZhangXin8069/PyQCU
- ソースの最終更新活動
- 2026年8月31日 02:55
- 検出された SKILL.md の言語
- 複数言語
- スター
- 3
- フォーク
- 0
インストール方法
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
ソースファイルを確認
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
メニュー
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
直接コマンドでは確認用 Prompt が省略されます。実行前にソースを確認してください。
npx skills add https://github.com/ZhangXin8069/PyQCU --skill srcコマンドは1行のまま表示されます。コピー前に横へスクロールして全体を確認してください。
ローカルで確認しますか?SkillsMP が現在取得できるファイルをダウンロードできます。
PyQCU 性能基准 skill:覆盖 examples/benchmark 的通用基准,以及 dev87 strict MultiGrid 对 QUDA 的可复现公平计时与显存口径。
pyqcu.cuda 目录的完整生成 skill:C++ CUDA 后端(libqcu.so)的 Cython 桥接包;含 strict QUDA-style MultiGrid、params/argv/set_ptrs 参数协议与显存生命周期约束。
cpp/cuda/qcu/include 目录的完整生成 skill:26 个模板化 CUDA 头文件(内核内联),define.h 须镜像 pyqcu/cuda/define.py。
SKILL.md を表示中
| name | src |
| description | cpp/cuda/qcu/src 目录的完整生成 skill:.cu 内核源文件(include 对应头 + 模板实例化 + 启动封装)。 |
CUDA kernel source files. Each .cu file #includes the corresponding header from ../include/ and provides template instantiations and kernel launch wrappers.
| File | Purpose |
|---|---|
apply_init.cu / apply_end.cu | Memory allocation/free lifecycle |
apply_dslash.cu | Dslash dispatch (Wilson or Clover based on plan) |
wilson_dslash.cu | Wilson dslash kernel |
clover_dslash_single.cu / clover_dslash_multi.cu / clover_dslash_comm.cu | Clover dslash: single-GPU, multi-GPU, halo exchange |
apply_wilson_bistabcg.cu / apply_wilson_bistabcg_dslash.cu | Wilson BiStabCG solver + its dslash |
apply_wilson_cg.cu / apply_wilson_cg_dslash.cu | Wilson CG solver + its dslash |
apply_clover_bistabcg.cu / apply_clover_bistabcg_dslash.cu | Clover BiStabCG solver + its dslash |
apply_multigrid.cu | MG restrict/prolong/coarse-dslash |
apply_clover_multigrid.cu | Clover multigrid solver entry (C API bridge) |
apply_multigrid_strict.cu | Strict full-coarse X/Y/Yhat, MATPC、prepare/reconstruct、逐层 full-coarse R/P、持久递归 V-cycle 与 fused right-FGMRES |
lattice_mpi.cu | MPI halo exchange helpers |
lattice_cuda.cu | CUDA utility functions |
2026-08-24 存档:gauss_gauge 非 verbose 路径 OOB write(分配 _LAT_S_ 却写 32 元素)与
device_random_8dtzyx 显存泄漏(cudaFreeAsync)均已修复(logs/fix-report-2026-07-28.md §7.1/§7.4)。
apply_multigrid_strict.cu 直接包含 ../include/qcu.h 与 ../python/pyqcu.h,
并导出 pyqcu.h 中的 Strict C ABI。它验证 c64/c128、单 rank、偶数 fine geometry
和可整除 block;target_parity=1、start_level=1 是 fused fine solve 的固定值。
Fine 端用物理 Gauge 与 Clover even/odd/inverse 做 odd-Schur/MATPC;每个 coarse
level 用 full-lattice X/Yhat 算子,R/P 只跨 compact fine parity 与 full coarse
field,不对 coarse geometry 再做 checkerboard。
Strict init 分配并持有递归 hierarchy/V-cycle arena;fused FGMRES 的外层 arena
在首次 solve 懒分配、按相同 geometry/restart 复用,end 释放两者。其 exact 外层
字节数为 (2*m+5)*B_f + 2*B_c;返回的 allocated_bytes 只涵盖 C++ 自有 arena,
不能替代全设备显存账本。