用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/HorizonRobotics/OE-Skills --skill lightcompress-batch-quantize命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
基于 SOC 职业分类
| name | lightcompress-batch-quantize |
| version | 2.0.3 |
| description | 批量执行 LightCompress 量化实验并生成对比表。 |
批量执行 = 循环调用 lightcompress-quant-explore skill。本 skill 只负责编排,不重复实现单实验逻辑。
将用户输入展开为实验的笛卡尔积:models x methods x configs。
示例输入:
对 Qwen3-0.6B、Qwen2.5-7B 跑 RTN W8A8 和 GPTQ W4A8 量化
展开为 4 个实验:
调用 quant-accuracy-cache skill 查询每个实验是否已有结果。
匹配规则:model.name + quant.method + quant.w_bit + quant.a_bit。
对待执行列表中的每个实验:
lightcompress-quant-explore skill 启动实验
nvidia-smi 确认显存占用上升)自动回答子 skill 的交互问题:
| 子 skill 问题 | 预设答案 |
|---|---|
| 开始实验 / 取消 | 开始实验 |
| 保存到缓存 / 跳过 | 保存到缓存 |
| 缓存冲突处理 | 保留两者 |
所有实验完成后,汇总为对比表:
| 模型 | 方法 | 配置 | Pretrain PPL | Fake Quant PPL | PPL 变化 | 来源 |
|------|------|------|--------------|----------------|----------|------|
| Qwen3-0.6B | RTN | W8A8 | 21.30 | 22.15 | +0.85 | 实验 |
| Qwen2.5-7B | GPTQ | W4A8 | 7.00 | 7.45 | +0.45 | 缓存 |
调用 quant-accuracy-cache 保存新产生的实验结果。
| Skill | 关系 | 说明 |
|---|---|---|
lightcompress-quant-explore | 依赖 | 单实验执行引擎,负责 GPU 选择、配置生成、实验运行 |
quant-accuracy-cache | 协作 | 实验前查询缓存跳过重复,实验后保存结果 |