- name
- cumcm-c-problem
- description
- 专门用于全国大学生数学建模竞赛(CUMCM)本科组 C 题的选题判断、数据分析、模型设计、算法求解、创新设计、可视化、论文写作、LaTeX 成稿与评委视角终检。用于用户要求解决或复盘国赛 C 题、根据附件建立 C 题模型、设计 72 小时方案、撰写/修改 C 题论文、生成完整 LaTeX+代码工程、评估 C 题论文竞争力时。只服务 C 题;不要将 A/B/D/E 题套路机械迁入。
# CUMCM C Problem Workflow
## 0. 总原则
始终按以下优先级工作:
1. 当前赛题原文、附件与当年官方规则。
2. 数学正确性、数据生成机制与结果可复现性。
3. 论文叙事、结构组织与视觉呈现。
4. 当前题型对应的国赛常用模型与算法。
5. 2018–2025 C 题优秀论文、专家讲评和往年评审经验。
专家讲评、历史评分点、优秀论文结构是**高优先级建议**,不是必须照搬的硬规则。若与当前题目的数据机制或数学结构冲突,以当前题目为准。
不要为了“高级”堆算法。不要把机器学习、元启发式、深度学习或贝叶斯模型当作创新本身。高级方法只能在基础方法出现明确瓶颈时进入,并说明为什么值得增加复杂度。
## 1. 开始新 C 题前必须做的事
1. 获取并完整阅读赛题、附件、数据字典和官方说明。
2. 若允许联网,先检索当年 CUMCM 官网的:参赛规则、论文格式规范、AI 工具规定、支撑材料要求。旧规则只能作参考。
3. 把每问拆成:研究对象、输入数据、目标输出、关键困难、约束、评价指标、与上一问的继承关系。
4. 画“问题依赖草图”,确定哪一问建立地基、哪一问推广、哪一问优化、哪一问处理现实不确定性。
5. 再选择模型。禁止“看到数据先跑十个算法”。
需要历史背景时读取:
- `references/c-problem-evolution.md`
- `references/expert-review-guidance.md`
- `references/source-index.md`
## 2. C 题的默认建模思想
C 题近年以数据驱动实际问题为主,常见主线是:
**数据理解与清洗 → 结构/规律识别 → 参数估计或预测 → 决策/优化 → 不确定性与稳健性 → 可执行结论。**
但必须根据新题判断是否属于:
- 描述统计/画像/聚类型;
- 关联关系/机制解释型;
- 分类判别型;
- 时间序列/预测型;
- 评价排序型;
- 运筹决策/资源配置型;
- 统计推断与风险决策型;
- 多模块混合型。
模型选择细则见 `references/modeling-toolbox.md`。
## 3. 算法选择规则
优先级遵循“**解释力与适配性 > 可复现性 > 精度增益 > 算法新颖度**”。
优先考虑国赛常用且透明的方法:
- 描述统计、箱线图、分布检验、相关分析;
- PCA/因子分析、聚类、判别分析;
- 线性/非线性/Logistic/Poisson 等回归;
- 灰色预测、指数平滑、ARIMA、状态空间;
- 决策树、随机森林、SVM、XGBoost(有明确预测任务时);
- 最小二乘、规划模型、动态规划、整数规划、网络流;
- 熵权/TOPSIS/AHP 仅在评价结构真的需要时使用;
- Monte Carlo、Bootstrap、交叉验证作为验证或不确定性工具。
高级方法只在关键处使用,例如:
- 复杂非凸搜索需要 SA/GA/PSO/DE;
- 数据存在重复测量、删失、异质性时需要混合效应、生存分析或层次模型;
- 明显存在尾部风险时使用 CVaR/鲁棒优化;
- 模型选择不确定性会改变最终决策时使用贝叶斯或信息价值。
每引入一个复杂模型,都回答三句话:
1. 基础方法哪里失效?
2. 新方法具体修复什么?
3. 复杂度增加后得到什么可量化收益?
## 4. 创新规则
全篇优先寻找 1–3 个真正可见的创新,不追求每问都“创新”。
创新优先级:
1. **数学对象或指标重定义**:让指标更符合题意或数据机制。
2. **结构化简**:证明支配关系、降维、分层、分区、递推,把大问题变小。
3. **模型升级**:从理想模型 M0 到现实修正 M1,明确触发条件。
4. **一般化**:从题给特例推广为可复用的一般模型。
5. **不确定性传播**:从参数误差传播到预测、排名或决策误差。
6. **独立验证**:解析法与仿真、不同算法、外部标准或合成数据互证。
7. **数据与机制融合**:预测模型受实际机制或业务约束约束。
不要把“用了某个新算法”单独写成创新点。
## 5. 每问的固定写作微结构
除非题目结构明显不适合,每一问按以下顺序写:
1. **本问困难与建模动机**:为什么不能直接计算;为什么选择当前方法。
2. **定义与数据口径**:变量、指标、样本、时间/空间单位。
3. **数据特征或机制证据**:用一张最合适的图/表证明后续模型必要性。
4. **基础关系推导**:先给可解释关系,不急着上算法。
5. **完整模型建立**:目标、约束、概率关系、状态转移或损失函数。
6. **模型总括**:推导完后,将核心目标函数与约束用一个大括号/boxed 方程组集中展示。
7. **求解方法**:说明算法如何服务模型,只写关键步骤。
8. **结果呈现**:优先用图表展示规律,再给关键数值。
9. **结果解释**:解释变化趋势、异常、决策含义,不复述表格。
10. **验证/敏感性/稳健性**:就地验证,不把所有验证拖到最后。
11. **本问小结与下一问接口**:明确本问输出如何成为下一问输入。
重要模型的最终形式默认采用:
```latex
\begin{equation}
\boxed{
\left\{
\begin{aligned}
\min_{\boldsymbol{x}}\quad & F(\boldsymbol{x}),\\
\text{s.t.}\quad & g_i(\boldsymbol{x})\le 0,\\
& h_j(\boldsymbol{x})=0,\\
& \boldsymbol{x}\in\Omega.
\end{aligned}
\right.
}
\end{equation}
```
先逐式解释来源,再总括。不要一上来甩巨大方程组,也不要让核心约束散落数页。
## 6. 论文固定结构
严格学习优秀 C 题论文的结构稳定性,但只模仿**章节组织、证据顺序、图表节奏和学术叙事**,不得复制原句、原图、原公式或大段表达。
默认结构:
1. 摘要与关键词
2. 问题重述
3. 问题分析
4. 模型假设
5. 符号说明
6. 模型的建立与求解
- 问题一
- 问题二
- 问题三
- 问题四(按实际题量调整)
7. 综合验证/灵敏度/稳健性(若不适合就地完成时)
8. 模型评价与推广
9. 参考文献
10. 附录与支撑材料文件清单
不设置目录。
章节写法详见 `references/paper-structure.md`。
## 7. 摘要硬规范
摘要是评委读取成本最低、权重最高的页面之一,必须单独优化。
硬要求:
- 电子版第 1 页只容纳**标题、摘要、关键词**;问题重述必须从第 2 页开始。
- 关键词不超过 **5 个**。
- 亮点模型、关键算法或真正关键的最终指标可用 `\textbf{}` 加粗,但每段只突出最值得记住的 1–2 处。
- 不使用“问题一——”式破折号结构;使用“针对问题一,……”。
- 不在摘要里堆公式、全量结果、所有模型名和软件名。
摘要顺序:
1. 2–4 句指出实际矛盾、数据特点与全文总目标。
2. 针对问题一:**为什么这样建模** + 核心方法 + 一项最关键结果/验证。
3. 针对问题二:与上一问的继承关系 + 方法 + 核心结果。
4. 其余问题同样处理。
5. 最后一两句可概括模型链的统一价值,不强制。
摘要内容优先级:**动机 > 模型为什么合适 > 关键做法 > 核心结果 > 验证**。
## 8. 页数与内容密度
在当年官方规则允许的情况下,默认把**主论文(摘要页、正文、参考文献;不含附录)控制在 25–28 页**,优先 26–27 页。
不得通过放大图片、调大字号、拉大行距、重复叙述或塞代码凑页数。篇幅应来自:
- 数据特征与模型动机;
- 必要的公式推导;
- 一般模型;
- 结果解释;
- 验证、不确定性与稳健性;
- 高信息密度图表。
若当年官方页数限制与本默认目标冲突,官方规则优先。
## 9. 图表是核心论证,不是装饰
在模型设计阶段就规划图表。每张重要图都回答:“评委看完这张图,应该立刻发现什么?”
优先图表角色:
- **问题总览图**:展示四问的变量、数据、模型和结果如何传递,不画粗糙 Q1→Q2 方框。
- **数据诊断图**:分布、异常、缺失、相关、时间趋势、空间格局。
- **机理/结构图**:变量关系、状态转移、网络/DAG、决策流程。
- **核心规律图**:展示参数 → 指标、因素 → 结果的主规律。
- **策略相图/决策区域图**:用颜色区域直接展示不同参数下最优策略切换。
- **最优方案图**:最终排程、种植、补货、路线、分类边界等必须“看得见”。
- **验证图**:理论 vs 仿真、预测 vs 实测、残差、误差分布、Bootstrap 区间、收敛曲线。
- **不确定性图**:置信带、扇形图、风险前沿、敏感性热力图。
颜色要求:低饱和、专业、2–4 个主色;颜色必须有语义。避免全黑白灰,也避免彩虹色、荧光色和商业 PPT 风。
完整规则见 `references/visualization-playbook.md`。
## 10. LaTeX 排版规则
必须大幅度沿用用户提供的 `cumcmthesis` 模板:
- 不自行重设正文字体、字号、页边距、标题字号与编号体系;
- 保留三线表、figure/subfigure、公式编号、交叉引用的模板习惯;
- 电子版使用模板对应的 `withoutpreface` 方式;
- 使用 XeLaTeX;
- 不加目录;
- 表格优先 `booktabs` 三线表;
- 图题、表题、公式和正文引用统一;
- overview 图与关键结构图需要专门设计,不允许自动布局导致重叠。
模板和骨架位于 `assets/template/`;细则见 `references/latex-template-guide.md`。
## 11. 验证成熟度
验证至少达到与问题风险相匹配的层级:
- L1:边界、数量级、单调性或极端情形检查。
- L2:误差指标、残差、拟合优度、混淆矩阵等模型内验证。
- L3:独立方法/仿真交叉验证。
- L4:参数扰动、Bootstrap、交叉验证、情景分析、鲁棒性。
- L5:参数不确定性传播到最终预测/策略;合成数据恢复、外部标准或可辨识性验证。
C 题若最终输出是“决策”,不要只验证预测精度,还要分析预测误差是否改变决策。
## 12. 评委视角
牢记官方评奖核心标准:合理假设、建模创造性、结果正确性、文字表述清晰。评阅前会围绕赛题、评阅要点与可能思路形成可操作细则;全国一等奖论文会由多位评委独立评阅,突出创新点会被特别关注。
因此把创新做成**可被快速发现的证据**:
- 摘要点明;
- 问题分析说明为什么需要;
- 模型章节给出结构;
- 图表证明收益;
- 验证证明不是偶然。
终检使用 `references/quality-gates.md`。
## 13. 实战执行顺序
完整 72 小时流程见 `references/72h-workflow.md`。默认:
1. 读题与数据审计。
2. 确定模型主线与最小可行解。
3. 先完成问题一地基模型。
4. 按问题依赖关系逐问推进;边算边写。
5. 在第一轮结果出来后设计最终图表,而不是最后补图。
6. 第二天完成主模型、创新与验证。
7. 第三天集中做叙事、排版、图表、参考文献、附录与复现。
8. 使用 `scripts/validate_project.py` 自动检查结构,再人工做评委视角终检。
## 14. 交付工程
生成完整论文时,至少交付:
```text
project/
├── figures/
├── code/
├── data/ # 自主收集/处理的数据;赛题原始附件按规则处理
├── support/ # 较大中间结果、AI说明等支撑文件
├── example.tex
├── example.pdf
├── example.aux
├── example.log
├── example.out
├── example.synctex.gz
└── README.md
```
代码必须与论文结果一致,并能从 README 或统一入口脚本复现关键表和关键图。
## 15. 资料使用边界
官方优秀论文与专家讲评用于学习结构、建模思想与评阅偏好。部分官方展示页明确限制下载或转载,因此不要把原始论文/PPT批量复制到输出仓库。使用 `references/source-index.md` 中的官方索引复核原文,并输出自己的总结。
View on GitHub