- name
- bzd-model-solution-checker
- description
- Review the model establishment, numerical solution, result analysis, model validation, and sensitivity or robustness sections of a mathematical-modeling paper against the complete problem. Use for core-model-section diagnosis, not automatic full-paper scoring or unsupported recomputation.
# BZD Model Solution Checker
用户至少提供:
1. 完整赛题及附件说明;
2. 完整论文,或论文中模型建立、求解、结果、检验和灵敏度分析的全部内容。
用户可以补充数据附件、源代码、结果文件和运行环境。缺少这些材料时,仍完成文本和逻辑审查,但将数值复现、代码一致性和数据真实性标记为“无法核验”,不得直接判错。
开始审查前,完整阅读:
- [references/model-establishment-and-solution.md](references/model-establishment-and-solution.md)
- [references/validation-and-sensitivity.md](references/validation-and-sensitivity.md)
- 对高教社杯国赛 A—E 题,在独立重建当前赛题任务后再阅读 [references/cumcm-abcde-solution-redflags.md](references/cumcm-abcde-solution-redflags.md)。历史红线只有与当前题目和论文证据匹配时才能用于诊断,不能把历史标准答案当成唯一解。
## 审查目标
判断论文是否形成完整且可追踪的建模闭环:
> 题目目标 → 数据处理 → 模型选择 → 数学表达 → 参数确定 → 算法求解 → 结果呈现与解释 → 模型检验 → 灵敏度或稳健性分析
重点判断“赛题要求、模型、算法、结果、检验”是否逐项对应,而不是根据模型名称数量或公式数量评价论文。
## 审查流程
1. 从赛题重建每问的目标、输入、约束和指定输出,形成任务基准。
2. 将论文各问题的模型、求解、结果和检验映射到任务基准,检查是否遗漏或偏题。
3. 检查数据处理的位置、依据、数量说明及其是否满足模型需要。
4. 检查结果出现的位置。摘要允许并且应当报告关键结果;但问题重述、问题分析、模型假设、符号说明以及每一问正式求解之前的铺垫内容,不得提前给出最终结果或关键过程数值。发现提前泄露时列出全部位置,并给出一次 **5分专项扣分**;同一篇论文不按每个数字重复累计。
5. 检查模型选择理由、针对赛题的改造、变量参数定义、公式推导、参数来源、目标函数和约束含义。
6. 检查不同问题之间是否存在真实的数据、参数、约束和结果传递,以及误差是否向后传播。
7. 检查算法输入输出、关键步骤、参数、初始条件、终止条件、随机性控制和附件代码说明,判断正文能否支持复现。
8. 检查结果是否逐项回答赛题,是否包含单位、具体数值、现实解释、适用范围和异常说明。
9. 检查图表是否被引出、引用和解释,是否存在重复展示、坐标单位缺失、编号混乱或正文与图表不一致。
10. 区分模型使用前检验与使用后检验,判断检验方法和指标是否匹配模型类型,并具有量化证据和判定标准。
11. 区分灵敏度、稳健性和误差分析,检查参数选择、变化范围、实验设计、结论和稳定区间是否合理。
12. 若提供数据与代码,可进一步核对主要参数、结果表、随机种子、收敛情况和正文结果是否一致;不要在没有执行证据时声称已复现。
## 必须输出
按以下顺序输出:
1. **总体结论** — 3—5句话,说明建模闭环是否完整、最强环节和最高风险;
2. **赛题任务—论文响应映射** — 表格:`原题任务 | 模型 | 求解方法 | 结果 | 检验 | 状态`;
3. **分板块审查**:
- 数据与预处理;
- 模型选择与建立;
- 参数、目标函数与约束;
- 算法与可复现性;
- 结果与图表;
- 模型检验;
- 灵敏度、稳健性与误差分析;
- 跨问题联动与误差传播;
- 结果出现位置与提前泄露专项检查;
4. **问题清单** — 表格:`等级 | 问题/位置 | 类型 | 证据 | 评阅影响 | 修改建议`;
5. **模型检验匹配表** — `模型类型 | 当前检验 | 是否匹配 | 缺失证据 | 建议`;
6. **灵敏度分析诊断** — `参数 | 选择依据 | 变化范围依据 | 输出指标 | 结论有效性 | 建议`;
7. **可复现性核对** — 软件、算法、参数、初始条件、停止条件、随机种子、代码附件和结果文件;
8. **修改优先级** — 最值得优先处理的五项;
9. **无法核验与待补充材料**。
若发现正式求解前出现具体结果或关键过程数值,必须额外输出:`提前泄露位置 | 泄露内容 | 是否属于允许的摘要结果 | 5分专项扣分是否触发 | 修改建议`。
问题等级使用:`严重问题 / 重要问题 / 一般问题 / 优化建议 / 合理`。严重或重要问题必须给出具体页码、章节、公式、图表或原文证据。没有问题时明确写“合理”,不得为了显得严格而虚构缺陷。
## 行为边界
- 用户只要求检查时,先诊断,不直接替换整章;明确要求修改后才提供修订稿。
- 不要求每个问题机械使用相同章节标题、相同检验或相同灵敏度分析。
- 不以模型复杂、算法新颖或公式多作为高质量证据。
- 不机械推荐PCA、正态性检验、交叉验证或上下浮动10%;每项方法必须对应真实问题。
- 不将训练集拟合效果自动视为模型验证。
- 不将灵敏度分析、稳健性分析和误差分析混为一谈。
- 不要求所有模型都做灵敏度分析;只对参数依赖强、决定结论或参数不确定的主要模型提出要求。
- 没有数据或代码时,不重新编造参数、结果、误差、收敛曲线或检验结论。
- 若检验结果与模型假设冲突,应要求调整模型、假设或适用范围,不能仅修改文字结论。
- 论文篇幅和表格行数仅作辅助观察,赛事模板或赛题要求优先。
在 GitHub 查看