Skip to main content

bzd-paper-aigc-auditor

对数学建模竞赛论文进行两层AI痕迹审计——第一层9维检测(语言层面60%:连接词/排比/拔高词/被动句/段落规律/文本复杂度;事实层面40%:引文验证/数值一致性/术语一致性),第二层模型合理性深度审查。严格判分+一票否决+问题标红。输出分层HTML报告。

Jump to install

Source facts

Repository
BZDmathclub/bzd-math-modeling-skills
Last source activity
September 3, 2026 at 17:00
Detected SKILL.md language
Chinese
Stars
372
Forks
17

Install options

The review-first prompt is selected by default. You can switch to a direct command or download a local copy.

Review the source files

Read SKILL.md and any companion files shown by SkillsMP before deciding whether to install.

File Explorer
13 files

Showing SKILL.md

SKILL.md
Source instructions · Read-only preview
name
bzd-paper-aigc-auditor
description
对数学建模竞赛论文进行两层AI痕迹审计——第一层9维检测(语言层面60%:连接词/排比/拔高词/被动句/段落规律/文本复杂度;事实层面40%:引文验证/数值一致性/术语一致性),第二层模型合理性深度审查。严格判分+一票否决+问题标红。输出分层HTML报告。
# BZD 数学建模论文AI痕迹审计工具 v2.2 ## 融合nature-AIGC检测方法 · 严格判分版 ## 核心原理 **两层递进式检查 + 9维融合检测**: 1. **第一层:增强的9维框架**(100分制) - **语言层面**(权重60%):融合nature-detector的统计特征分析 * 维度1: 高频连接词(Humanizer-zh) * 维度2: 排比/同构句式识别 * 维度3: 拔高词与修饰词(5级分类) * 维度4: 被动句占比与语态分析 * 维度5: 段落结构规律性 * 维度6: 文本复杂度(熵值、n-gram、TTR) - **事实层面**(权重40%):融合nature-detector的事实验证 * 维度7: 引文验证(L1-L3三层检查) * 维度8: 数值一致性追踪(参数溯源) * 维度9: 术语一致性检测 2. **第二层:数学建模逻辑审查**(100分制) - 2.1 模型常用性判断:对标数模竞赛常用模型库 - 2.2 复杂度vs收益评估:识别过度工程化 - 2.3 华而不实识别:五大AI特征检查 - 2.4 模型选择"三问法":逻辑论证验证 - 2.5 建模路径风格:区分人主导的渐进建模与AI式复杂化倾向 **最终评分** = (第一层 + 第二层) / 2 → 风险等级 → HTML分层报告 **新增能力**: - ✨ 引文真实性验证(相比v2.0的"只是检查格式") - ✨ 数值参数追踪与一致性检查(发现虚构或计算错误) - ✨ 文本复杂度的科学度量(TTR、熵值、n-gram频率) - ✨ 段落结构规律性检测(识别模板堆砌) - ✨ 术语使用一致性追踪(发现概念混乱) --- ## 使用场景 ✓ **参赛队员自检**:快速诊断版,定位问题,按优先级改进 ✓ **指导老师评审**:简洁版+完整版,全面了解论文问题 ✓ **社团评委存档**:完整版,逐部分详细分析,存档决策 ✓ **论文盲审**:用两层评分表判断是否涉及AI拼装 --- ## 输入要求 **最低输入**:完整数学建模论文(PDF或Word格式) **增强输入**(提高置信度): - 赛题及附件说明 - 代码和中间结果文件 - 参考文献清单 - 问间对接说明 --- ## 执行流程(9步) ### 第一阶段:五维基础框架评分 1. **识别论文结构** 标记摘要、问题重述、问题分析、假设、符号、模型建立(Q1-Q5)、求解、结果、检验、灵敏度、评价、参考文献、附录 2. **阅读五维评分标准** 参考 [references/audit-framework.md](references/audit-framework.md),理解五个维度的0-100分评分规则 ### 第二阶段:第一层 - 增强的9维检测框架(权重60%语言 + 40%事实) > **v2.2 严格化说明**:以下阈值较 v2.1 全面收严约 5–10 个百分点, > 且引入"扣分项累加"机制。评审倾向:**宁可标红后经人工复核撤销, > 不可漏标**。任何一项落入 🟠 及以上,报告中必须标红呈现并给出证据位置。 **3. 语言层面检测(6维,权重60%)** **3.1 高频连接词检测**(维度1,权重20%)— 融合Humanizer-zh - 扫描全文,统计高频连接词密度(综上所述、此外、进一步、显然、具有特性等) - 计算: 密度 = (高频词总数) / (全文总句数) - 检查相同词的重复间隔(是否<5句) - 新增:检查"具有XX特性""相对而言""显然"等AI特化高频词 - **判分(收严)**: * `<8%` → 100分 🟢 * `8-12%` → 85分 🟢 * `12-16%` → 60分 🟡(原15-20%才扣,现提前) * `16-20%` → 35分 🟠 **标红** * `20-25%` → 15分 🔴 **标红** * `>25%` → 0分 ⛔ **标红** - **附加扣分**:同一高频词在3页内出现>2次,每处额外 −5 分(下限0) **3.2 排比与同构句式识别**(维度2,权重12%) - 标记三项以上的排比句,检查排比后是否有量化数据 - 检查排比项的来源说明(赛题给出/推导/约束) - 标记"动词+宾语"结构相同的连续句子,检查是否标注了章节/对象 - **判分(收严)**: * 全部为L3安全排比(有数据+有来源) → 100分 🟢 * L3为主,个别L2 → 80分 🟢 * L2为主(有数据但无来源说明) → 55分 🟡 * 存在1处L1(抽象形容词堆砌) → 30分 🟠 **标红** * 存在2处及以上L1 → 0分 🔴 **标红** - **附加扣分(v2.2新增)**:同一组织词(如"其一/其二/其三"、 "首先/其次/最后")在 **≥4个不同章节** 机械复用,额外 −20 分; ≥6个章节复用,额外 −30 分。此项即使各项内部有数据也照扣, 因为它是可观察的模板化痕迹。 **3.3 拔高词与修饰词检测**(维度3,权重12%)— 5级分类 - 识别拔高词并分级:L1(绝对化+无数据) / L2(相对化+泛泛对比) / L3(定量无基准) / L4(定量有数字无对比) / L5(完整定量+充分对比) - 检查拔高词后是否有量化证据(数字、对比、百分比) - **判分(收严)**: * L5为主且拔高词密度<8% → 100分 🟢 * L4-L5为主 → 80分 🟢 * L3为主 → 55分 🟡 * 存在 **1个** L1或2个L2 → 30分 🟠 **标红**(原需>3个才归零) * 存在 **2个及以上** L1 → 0分 🔴 **标红** - 参考资源:[references/layer1-enhanced-detection.md](references/layer1-enhanced-detection.md) §2.3 **3.4 被动句占比与语态分析**(维度4,权重9%) - 抽取论文5个代表段落,统计被动句占比(正常范围10-20%) - 检查是否出现连续>3句都是被动语态的"生硬段落" - 被动句中是否都有明确的执行者 - **判分(收严)**: * `<15%` → 100分 🟢 * `15-22%` → 85分 🟢 * `22-27%` → 55分 🟡(原25-30%才扣到60) * `27-33%` → 30分 🟠 **标红** * `>33%` → 0分 🔴 **标红** - **附加扣分**:出现连续≥4句被动语态的段落,每处 −10 分 **3.5 段落结构规律性检测**(维度5,权重6%) - 抽取20段,统计段落开头词的重复率和段长分布 - 检查开头方式是否多样化("根据""为了""利用前问的"等) - 段落间是否有明确的逻辑承接("由上可知""基于此"等) - **判分(收严)**: * 开头词重复率 `<15%` → 100分 🟢 * `15-28%` → 80分 🟢 * `28-40%` → 50分 🟡 * `40-55%` → 25分 🟠 **标红** * `>55%` → 0分 🔴 **标红** - **豁免**:数模论文各建模章节遵循"建模思路→模型建立→求解→ 结果→检验"五段式属文体常规,该章节级结构重复**不计入**本项; 本项只统计**段落级**的开头方式重复。 **3.6 文本复杂度分析**(维度6,权重1%) - 计算词汇多样性TTR = 不同词数/总词数 - 分析3-gram重复率("本文采用""通过...方法"等) - 观察熵值和n-gram频率是否过于规律 - **判分(收严)**: * TTR>0.55 且 3-gram<4% → 100分 🟢 * TTR 0.45-0.55 或 3-gram 4-8% → 65分 🟡 * TTR 0.35-0.45 或 3-gram 8-13% → 30分 🟠 **标红** * TTR<0.35 或 3-gram>13% → 0分 🔴 **标红** **4. 事实层面检测(3维,权重40%)** > ⚠️ 本层任一维度触发"一票否决项"时,**直接判定论文风险等级**, > 不再按加权分核算。详见 references/layer1-enhanced-detection.md §4.3。 **4.1 引文验证**(维度7,权重15%)— 融合nature-detector的L1-L3检查 - **L1【快速检查】**(30秒):DOI格式、作者名、期刊名、发表年份规范性 - **L2【存在性验证】**(2-3分钟):Google Scholar/知网验证文献是否存在,信息是否匹配 - **L3【主张-支撑匹配】**(5分钟,抽查不少于5篇关键文献): * 论文引用该文献的方法/结论是否与原文一致 * "数据集XXX"是否真的存在且规模一致 * "按照XXX的方法"是否在原文中有明确描述 - **判分(收严)**: * 全部通过L1-L3,且无未引用的"凑数文献" → 100分 🟢 * 全部存在,但有1-2篇列入文献表却未在正文引用 → 80分 🟡 * 有1篇作者/年份/期刊信息不符 → 25分 🔴 **标红 + 触发否决** * 有任1篇**确认不存在** → 0分 ⛔ **标红 + 强制高风险** - **附加检查**:文献总数<6篇 或 >25篇,−10分;全为综述/教科书 而无具体算法论文,−15分 **4.2 数值一致性追踪**(维度8,权重15%) - 构建"参数溯源表":列出所有关键参数,逐一追踪其在全文的使用位置 - 复算数值间的算术关系(占比、差值、合计是否自洽) - 验证参数来源层级(L1赛题给出 / L2前问推导 / L3物理约束) - **判分(收严)**: * 全部一致 + 算术自洽 + 来源清晰 → 100分 🟢 * 一致但个别参数来源未说明 → 75分 🟡 * 存在偏差1-5%且**未加解释** → 35分 🟠 **标红** * 存在偏差>5%且**未加解释** → 0分 🔴 **标红 + 触发否决** - **加分项(v2.2新增,上限+5)**:论文**主动披露**数值差异并解释 其来源(求解器容差、独立实现差异等),视为人工复算的正面证据。 此类披露**不触发否决**。 - **幽灵参数**:任一关键参数无法追溯到L1/L2/L3任一层级,每个 −15分 **4.3 术语一致性检测**(维度9,权重10%) - 构建"术语追踪表":列出5-7个核心概念 - 追踪各术语在全文的表述方式 - 检查是否存在"一个东西多个名字" - **判分(收严)**: * 完全一致 → 100分 🟢 * 仅存在领域公认同义词(如"粗差/过失误差") → 85分 🟢 * 1个核心术语有2种表述 → 55分 🟡 * 1个核心术语有3种及以上表述 → 25分 🟠 **标红** * 多个核心术语混乱(尤其算法名称) → 0分 🔴 **标红** **5. 综合评分汇总** ``` 第一层质量分 = 维1×0.20 + 维2×0.12 + 维3×0.12 + 维4×0.09 + 维5×0.06 + 维6×0.01 + 维7×0.15 + 维8×0.15 + 维9×0.10 第一层风险分 = 100 − 第一层质量分 ← 必须转换后再查等级表 ``` ### 第三阶段:第二层 - 数学建模逻辑审查(权重40%) 8. **五项深度检查** 对论文的每个模型,依次进行: - **2.1 模型常用性判断** 对标[表9:数模常用模型库],判断该模型是否为竞赛常见模型,还是AI高频的"高大上"模型 - **2.2 复杂度vs收益评估** 该模型的时间/空间复杂度是否与问题规模匹配?能否用更简单的方法?复杂度提升的收益有多大? - **2.3 华而不实识别** 检查五大特征:(1)模型名复杂但实现不透明,(2)无基线对比,(3)不必要的超参数调优,(4)通用化无边界,(5)模型数过多 - **2.4 模型选择"三问法"** 对每个模型:问1-本题问题性质?问2-本题数据特征?问3-为什么选这个而不选替代? 三问都能清晰回答 → 低风险;任何一问无法回答 → 中等风险 - **2.5 建模路径风格对照** 从建模路径、问题简化、模型选择、假设、数据适配、求解主线、结果解释、论文表达、稳健性和评审呈现十个方面,区分“人主导的渐进建模”与“AI式复杂化倾向”。详细规则见 [references/audit-framework.md](references/audit-framework.md)。该项只能作为组合证据:单独出现复杂模型、较多参数或较长篇幅,不得直接判定为AI生成。 9. **第二层输出** 综合2.1-2.5的检查结果,汇总成"建模逻辑评分表",给出建模逻辑风险等级 ### 第四阶段:综合评分与报告生成 **最终AI风险分** = (第一层风险分 + 第二层风险分) / 2 → 0-100 > 两层都必须先由质量分转换为风险分(`风险分 = 100 − 质量分`)再取平均。 > 直接对质量分取平均会得到方向相反的结论。 **风险等级(v2.2 收严)**: - 0-15:🟢 低风险 — 可直接接收 - 16-30:🟡 中低风险 — 可接收,需补充改进 - 31-50:🟠 中风险 — 需深度检查后再决定 - 51-70:🔴 中高风险 — 强烈建议强制改稿 - 71-100:⛔ 高风险 — 建议拒稿 **一票否决**:触发 references/layer1-enhanced-detection.md §4.3 任一条件时,直接采用该条规定的等级,不再按加权分核算。 --- ## 报告标红规范(v2.2强制) 报告必须让问题**一眼可见**,不得把风险项混在通过项里平铺呈现。 **颜色语义**(HTML报告统一使用): | 状态 | 色值 | 触发条件 | 呈现要求 | |---|---|---|---| | 🔴 严重 | `#c0392b` | 维度得分 `<30` 或触发一票否决 | 红底红框卡片 + 置于报告最前 + 列出证据页码 | | 🟠 警示 | `#e67e22` | 维度得分 `30-54` | 橙色左边框 + 明确写出改进动作 | | 🟡 注意 | `#f39c12` | 维度得分 `55-79` | 黄色标记 + 一句话说明 | | 🟢 通过 | `#27ae60` | 维度得分 `≥80` | 常规呈现,不占视觉重心 | **强制要求**: 1. 任一维度 `<55` 时,报告顶部必须有**红色警示区**,汇总全部标红项 2. 每个标红项必须包含三要素:**问题描述 + 证据位置(页/节)+ 具体改法** 3. 不得用"建议优化""可以更好"这类模糊措辞描述标红项 4. 评分表中标红行使用红色背景,不能只靠一个小图标区分 5. 若全部维度均 `≥80`,才可在结论区使用绿色通过卡片 **生成两个版本HTML报告**: - 简洁自检版:问题定位 + 优先级排序 + 快速改进指引 - 完整审查版:按论文结构逐部分详细分析 + 具体修改建议 + 参数溯源表 所有报告均标注"**BZD数模社制作**",支持下载和打印 --- ## 关键输出物 ### 1. 第一层输出表(增强的9维融合框架) ``` 【第一层评分汇总 v2.1】 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【语言层面】(权重60%) 得分/100 权重 贡献 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 维度1: 高频连接词密度 XX/100 12% XX% 维度2: 排比/同构句式 XX/100 7.2% XX% 维度3: 拔高词(5级分类) XX/100 7.2% XX% 维度4: 被动句占比 XX/100 5.4% XX% 维度5: 段落规律性 XX/100 3.6% XX% 维度6: 文本复杂度(TTR/熵值) XX/100 0.6% XX% 语言小计 60% XX分 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【事实层面】(权重40%) 得分/100 权重 贡献 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 维度7: 引文验证(L1-L3) XX/100 15% XX% 维度8: 数值一致性(参数追踪) XX/100 15% XX% 维度9: 术语一致性 XX/100 10% XX% 事实小计 40% XX分 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 第一层最终得分 XX/100 风险等级 [绿/黄/橙/红/黑] ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 关键诊断: 🔴 高风险指标(需立即处理): - 拔高词"显著"XX次,后跟数据仅XX次 - TTR值XX < 0.4(词汇极度重复) 🟡 中等风险指标(需改进): - 被动句占比XX% (目标15-20%) - 3-gram重复率XX% (目标<5%) ✅ 通过指标(无需改进): - 引文5篇全部验证通过 - 关键参数追踪完全一致 - 术语使用基本统一 ``` **增强说明**(相比v2.0): - ✨ 引文验证不再只是"格式检查",而是真实性和支撑匹配度检查 - ✨ 增加了数值参数追踪,能发现虚构数据或计算不一致 - ✨ 增加了文本复杂度的科学度量(TTR、n-gram频率) - ✨ 增加了术语一致性检测,发现概念混乱 ### 2. 第二层输出表(模型合理性审查) ``` 【第二层评分汇总】 模型常用性判断: XX/100 Q1: 模型名 → 常用/自定义/AI高频 模型复杂度评估: XX/100 Q1: 复杂度 vs 问题规模 → 合理/过度 华而不实识别: XX/100 五大特征检查 → 无/少/多 模型选择"三问法": XX/100 Q1: 问题明确?Q2: 数据特征?Q3: 替代论证? 建模路径风格: XX/100 十项对照:渐进建模 / 混合 / AI式复杂化倾向 第二层总分 = XX/100 ``` ### 3. 最终AI风险评分 ``` 最终AI风险分 = (第一层 + 第二层) / 2 = XX/100 风险等级 = 🟢低 / 🟡中低 / 🟠中 / 🔴中高 / ⛔高 置信度 = 低/中/高(基于输入材料完整性) 关键发现: ✓ 建模逻辑清晰/✗ 模型选择有风险 ✓ 参数溯源完整/✗ 参数来源模糊 ✓ 问间对接明确/✗ 跨问联动不清 ... ``` ### 4. HTML分层报告 三个版本均自动生成,包含: - 学生自检版:5分钟快速诊断清单 + 高频陷阱对照表 + Top3改进 - 老师评审版:两层评分表 + 问题清单 + 审查意见 - 完整审计版:详细的五维分析 + 两层审查 + 逐板块建议 + 综合评分 --- ## 特殊说明 ### 关于"置信度" - **仅论文**:置信度 = 中(±8-12分) - **论文+赛题**:置信度 = 中(±6-10分) - **论文+赛题+代码/结果**:置信度 = 高(±5-8分) - **再加版本历史或对话记录**:置信度 = 高(但仍非身份鉴定) ### 关于"模型选择"的AI痕迹 本工具重点关注模型选择中的两类典型AI痕迹: 1. **自证式论证**:选择模型因为"该模型精度高、效率高"(不说明本题为什么需要) 2. **高大上陷阱**:使用深度学习、强化学习、复杂优化等不必要的复杂模型 这两类是AI生成论文最容易被识别的特征。 ### 关于"参数溯源" 每个参数应能追溯到: - **L1:赛题直接给出**(标注\*来自赛题) - **L2:前问推导出**(标注\*来自问i的结果) - **L3:物理约束推导**(标注\*由XXX约束推导) 无法追溯的参数 = 幽灵参数 = 高风险 --- ## 文件清单 ``` bzd-paper-aigc-auditor/ ├── SKILL.md (本文件——skill定义) ├── README.md (项目说明) ├── references/ │ ├── audit-framework.md (五维评分标准+检查表) │ ├── humanizer-keywords.txt (Humanizer-zh高频连接词表) │ ├── models-zh.md (数模常用模型库vs AI高频模型) │ └── patterns-zh.md (AI常见自证式论证模式库) └── templates/ ├── BZD数模论文AI痕迹自查指南.html (学生自检用户指南) └── BZD数模论文AI痕迹审计报告模板.html (审计报告——简洁版+完整版) ``` --- ## 快速开始 **用户(学生/老师)流程**: 1. 准备论文PDF或Word 2. 打开"BZD数模论文AI痕迹自查指南.docx",按步骤操作 3. 调用本skill进行审计 4. 获得分层HTML报告 5. 按报告中的建议改进论文 **社团/评委流程**: 1. 收集参赛论文 + 赛题 + 代码(可选) 2. 批量调用本skill 3. 汇总HTML报告,形成评审档案 4. 用"老师评审版"或"完整审计版"进行决策 --- ## 版本信息 - **当前版本**:v2.0(2024-XX) - **改进内容**: - 加入Humanizer-zh高频连接词检测 - 增加第二层"模型合理性"审查 - 从单一报告升级为分层HTML报告 - 权重调整:语言60%+其他40% - 新增"三问法"和"华而不实"识别 - **适用场景**:CUMCM、美赛、国赛、校赛等数学建模竞赛 - **支持平台**:Claude Code、Codex均可使用 --- ## 重要声明 ⚠️ **本工具的限制**: - 该评分**不是作者身份概率**,也不能替代正式AIGC检测或查重服务 - 仅凭成稿无法证明某句话由AI生成 - 数学建模中的规范句式、模型名称、专业术语天然可能重复 - 模型的创新性不等于AI拼装(本工具只判断模型选择的合理性) ✅ **本工具的优势**: - 专针对数学建模竞赛的AI痕迹识别 - 融合Humanizer-zh的中文文本分析 - 两层递进式检查,避免误判 - 分层输出,适应不同用户 - 可持续更新的模型库和模式库
View on GitHub