| name | scheme-recommendation |
| description | 为已适配模型推荐第一轮量化方案(方案推荐卡:目标/位宽/dtype/algos/粒度 + 理由/风险/升级/回退)。触发场景:用户想先拿量化方案参考 / 基于 casebook 选直转起点 / 实验前定候选方案与风险回退。不适用于:跑量化实验、产出 ppl/delta、误差定位、下最终最优结论(执行→ $quant-run,判读→ $direct-quant-eval)。 |
量化方案推荐
概述
为已适配模型推荐第一轮量化方案(只推荐、不跑实验):回答“第一枪先量哪些模块 / 用什么 dtype·bits·algos·granularity / 为什么这么起步 / 失败先缩哪里查哪里”。不负责:跑量化实验、产出 ppl_bf16·ppl_quant·delta、误差定位、下“最终最优方案”结论。
用户调用格式
先读哪些文件
按顺序:
.agents/docs/casebook/... 对应系列 README.md
- 已有个案再读最相近
<series>/<case>.md
- 确认能力边界读 ../../../docs/repo-map.md
- 确认量化口径读 ../references/metrics-and-thresholds.md
- 特殊结构(MoE / MLA / 混合 attention)定制方案读 ../references/network-strategies.md
固定流程
- 先明确当前任务口径:
- 模型名称 / 系列
- 结构标签:
dense / moe / packed-expert / special-attn
- 评测集、指标、
seq_len、granularity
- 时间预算、算力预算、是否优先保守
- 先查现有结果:
- 系列
casebook 是否已有默认起步方案
outputs/ 或日志里是否已有相同口径的量化结果
- 当前模型和历史案例是否足够相似
- 按相似度筛选参考经验,优先级是:
- 至少给出 2 到 3 个候选方案:
- 从候选中选一个“首推方案”,并明确理由:
- 用最终保留模块填写风险点、升级条件和回退路径。
- 输出“量化方案推荐卡”,卡片内容以最终保留方案为准。
边界规则
- 这是起步方案推荐,不是全仓最优方案搜索。
- 不要按全仓平均经验直接推荐,要优先参考同系列、同结构案例。
- 如果评估依据不足,要明确写“弱推荐”或“待验证”,不要装作确定。
- 如果用户已经明确给了量化方案,停止推荐,转到评测或验证流程。
- 如果模型还没适配完成,停止推荐,回到
$model-adapter。
- 如果当前仓库里已有同口径、同模型、同目标的稳定结论,优先复用,不重复发明方案。
- 当前推荐卡主字段按模块级表达,不强制做子算子级拆分。
- 除非有稳定 casebook 佐证,不要把结构经验写成“已验证结论”。
- 引用仓库内代码、脚本和文档路径时,一律使用仓库相对路径;不要写绝对路径。
输出要求
结束时必须给出一张“量化方案推荐卡”,至少包含下面字段:
当前模型
任务口径
相似案例
候选方案
首推方案
推荐理由
风险点
升级条件
回退方案
证据强度
量化方案推荐卡
# 量化方案推荐卡
## 当前模型
- 模型名称:
- 模型系列:
- 结构标签:
- 关键结构特征:
## 任务口径
- 数据集:
- 指标:
- `seq_len`:
- `granularity`:
- 时间预算:
- 算力预算:
- 特殊约束:
## 相似案例
- 案例 1:来源 / 相似原因 / 采用方案 / 结果摘要
- 案例 2:来源 / 相似原因 / 采用方案 / 结果摘要
## 候选方案
- 候选方案 A(保守):量化模块 / `quant_dtype` / `a_bits / w_bits` / `algos` / 预期成本 / 预期风险
- 候选方案 B(首推):量化模块 / `quant_dtype` / `a_bits / w_bits` / `algos` / 预期成本 / 预期风险
- 候选方案 C(激进):量化模块 / `quant_dtype` / `a_bits / w_bits` / `algos` / 预期成本 / 预期风险
## 首推方案
- 量化模块 / `quant_dtype` / `a_bits / w_bits` / `algos` / `granularity`
## 推荐理由
- 同系列经验 / 结构相似性 / 成本与收益平衡 / 失败后是否容易定位
## 风险点
- 风险 1 / 风险 2 / 风险 3
## 升级条件
- 保持当前方案的条件 / 进入误差定位的条件 / 进入 PTQ 的条件
## 回退方案
- 回退路径 1 / 回退路径 2 / 回退路径 3
## 证据强度
- 强 / 中 / 弱 + 判断理由