| name | academic-paper-review |
| description | 多视角模拟学术论文评审 — 模拟国际期刊同行评审流程。支持 quick(EIC 单人快审)、methodology(方法论专项)、full(5视角完整评审)三种模式。从方法论严谨性、领域专业度、创新性、论证逻辑、期刊适配度五个非重叠视角独立审查,最终合成编辑决定和修订路线图。适用于:投稿前自检、论文质量评估、模拟审稿。 |
| metadata | {"version":"1.1.0","last_updated":"2026-06-02","status":"active","source":"基于 Imbad0202/academic-research-skills (ARS) reviewer 模块适配,去掉多 Agent 并行依赖,改为 Hermes 串行编排","related_skills":["academic-revision-coach","optics-research-tracker","academic-reviewer-finder","scansci-pdf","arxiv"]} |
学术论文模拟评审 (Academic Paper Review)
触发条件
用户说:「帮我审一下这篇论文」「review this paper」「模拟审稿」「论文质量怎么样」「投稿前检查」
或提供论文+要求评审。
三种模式
| 模式 | 审稿人 | 适用场景 | 输出 |
|---|
| quick | EIC(主编视角) | 快速判断论文整体质量、是否值得投 | 1份评审报告+简单建议 |
| methodology | EIC + 方法论专家 | 重点审查实验设计、数据分析、可复现性 | 2份评审报告+方法论评分 |
| full | EIC + 方法论 + 领域专家 + 跨学科视角 + 魔鬼代言人 | 完整模拟顶刊审稿 | 5份评审报告+编辑决定信+修订路线图 |
默认模式:quick。用户说「仔细审」「全面审」「模拟顶刊审稿」时用 full。
评审流程
Phase 0: 论文信息提取(所有模式共用)
从用户提供的论文中提取:
- 论文标题、摘要、关键词
- 研究领域(自动识别)
- 论文类型:实验型/理论型/综述型/方法型/案例型
- 方法论范式:定量/定性/混合/模拟/理论推导
Phase 0.5: 结构完整性扫描(所有模式必备)
在进入各审稿人视角之前,执行结构完整性扫描。其输出作为所有审稿人的共享前置输入,任何结构性问题必须被标记并传递给对应审稿人。
字数统计与比例分析
| 章节 | 操作 | 标准范围(实验型) | 标准范围(理论型) | 标准范围(综述型) |
|---|
| Abstract | 统计字数 | 150-300 词 | 150-300 词 | 150-300 词 |
| Introduction | 统计字数 & 占全文比例 | 10-15% | 15-20% | 15-20% |
| Method | 统计字数 & 占全文比例 | 20-30% | 10-15% | 5-10% |
| Results | 统计字数 & 占全文比例 | 20-30% | 25-35%(含推导) | 10-15% |
| Discussion | 统计字数 & 占全文比例 | 25-35%(独立)/ 融入式需累计 | 20-30% | 20-30%(可与 Conclusion 合并) |
| Conclusion | 统计字数 | 200-500 词 | 200-500 词 | 300-600 词 |
| References | 统计数量 & 密度(引用/千字) | 30-60 篇,密度 3-8/千字 | 40-80 篇 | 80-150 篇 |
⚠️ Discussion 组织形式识别:
在检查前,先判断论文的 Discussion 组织方式:
- 独立 Discussion 章节 → 直接统计该章节字数
- 融入式(Results 各小节含讨论段落)→ 累计所有讨论性段落的字数
- 与 Conclusion 合并(如「总结与展望」)→ 区分其中属于 Discussion 的部分
⚠️ 关键触发条件:
- Discussion(独立)字数 < Results 字数 × 50% → Major Issue: Discussion 深度不足
- Discussion(融入式累计)字数 < Results 字数 × 40% → Major Issue: Discussion 深度不足
- Discussion(任何形式)字数 < Results 字数 × 30% → Critical Issue: Discussion 严重缺失
- 论文为 Letters/短文格式但强行独立 Discussion(不必要) → 标记为观察项(建议融入式)
- 任何章节比例偏差标准范围 > 10 个百分点 → 标记为观察项
Discussion 深度专项检查
逐项检查 Discussion 是否包含以下要素:
| 要素 | 检查标准 | 权重 |
|---|
| 结果解释 | 每个主要结果都有「为什么」的解释,而非重复陈述 | 必须 |
| 与已有工作的对比 | 定量对比(数值/效应量),非泛泛而谈 | 必须 |
| 理论意义 | 结果对现有理论框架意味着什么 | 必须 |
| 局限性 | 具体、可量化的局限,非笼统的「未考虑XX」 | 必须 |
| 未来方向 | 具体技术路径和时间线,非「需要进一步研究」 | 推荐 |
| 机制解释 | 物理因果机制/过程机制(非仅相关关系) | 推荐 |
段落级结构扫描
抽查 3-5 个核心段落,检查:
- 每段是否有明确的主题句
- 段落间是否有过渡句/过渡段
- 论证结构是否遵循 PEEL(Point-Evidence-Explanation-Link)
输出格式
## 结构完整性报告
### 字数统计
| 章节 | 字数 | 占全文比例 | 标准范围 | 偏差 |
|------|------|-----------|---------|------|
| Abstract | [X] | — | 150-300 | [正常/偏短/偏长] |
| Introduction | [X] | [X%] | 10-15% | [偏差值] |
| Method | [X] | [X%] | 20-30% | [偏差值] |
| Results | [X] | [X%] | 20-30% | [偏差值] |
| Discussion | [X] | [X%] | 25-35% | [偏差值] |
| Conclusion | [X] | — | 200-500 | [正常/偏短/偏长] |
### Discussion 组织方式
- **形式**: [独立章节 / 融入式(Results 各小节末尾)/ 与 Conclusion 合并]
- **讨论内容总字数**: [X](融入式需累计各小节讨论段)
- **适配性评估**: [组织方式与论文类型/期刊格式是否匹配]
### Discussion 深度评估
- [ ] 结果解释: [通过/缺失] — [具体说明]
- [ ] 与已有工作对比: [通过/缺失] — [具体说明]
- [ ] 理论意义: [通过/缺失] — [具体说明]
- [ ] 局限性: [通过/缺失] — [具体说明]
- [ ] 未来方向: [通过/缺失] — [具体说明]
### 标记的结构性问题
| # | 问题 | 严重程度 | 影响章节 | 建议审稿人关注 |
|---|------|---------|---------|---------------|
| S1 | [问题描述] | [Critical/Major/Minor] | [章节] | [指定审稿人] |
Phase 1: 独立评审(按模式选择审稿人)
每个审稿人独立审查,互不交叉引用。以下为各审稿人的评审框架:
⚠️ 角色边界说明(避免重叠):
| 重叠区域 | 划界规则 |
|---|
| 效度/外部效度 | 方法论专家审查内部效度和方法论层面的外部效度(抽样、设计);跨学科视角审查跨文化/跨学科场景下的泛化性 |
| 统计问题 | 方法论专家审查统计方法是否正确(假设检验、模型选择);魔鬼代言人审查统计结果是否被过度解读(p-hacking、HARKing、选择性报告) |
| 结果解释 | 领域专家审查解释是否符合领域惯例;魔鬼代言人审查是否存在被忽略的替代解释 |
| Discussion 深度 | 领域专家为 Discussion 深度的唯一责任人(评审维度 #8);Phase 0.5 的结构扫描提供量化数据,领域专家负责定性评估 |
🔵 EIC(主编视角)— 所有模式必备
视角:鸟瞰全局。这篇论文适合什么级别的期刊?对领域有什么贡献?读者会感兴趣吗?
评审维度:
-
第一印象 (1-10)
- 评分锚定: 9-10=立即意识到对本领域重要,会主动推荐给同事 | 7-8=有明显贡献值得发表但有可改进之处 | 5-6=有一定价值但贡献有限或有明显缺陷 | 3-4=存在根本性问题需大幅修改 | 1-2=不适合发表,选题或执行有致命缺陷
- 标题、摘要、结论快速扫描
- 选题时效性、期刊匹配度
-
原创性评估
- 评级锚定: 高=提出全新理论/方法/范式,无先例 | 中=在已有框架上有显著增量改进 | 低=仅是已有工作的组合或微小扩展
- 核心贡献是什么?(新数据/新方法/新理论/新视角/新组合?)
- 与现有文献相比,真正新的部分是什么?
- 是否真正填补了研究空白?
-
重要性评估
- 评级锚定: 高=影响多个子领域或改变领域方向 | 中=对本子领域有重要贡献 | 低=仅对狭窄话题有边际贡献
- 如果结论成立,对领域的影响范围?(子领域 vs 学科级)
- 时效性:这个问题现在重要吗?未来会越来越重要吗?
- 国际读者的兴趣程度
-
结构一致性
- 评级锚定: 强=全文叙事流畅,每节自然衔接,无逻辑断裂 | 中=基本连贯但有局部跳跃 | 弱=各节脱节,结论与引言承诺不匹配
- 标题→摘要→引言→结论是否有逻辑断裂?
- 研究问题是否清晰?
- 结论是否直接回应研究问题?
- 是否存在「过度承诺、兑现不足」?
-
期刊适配度
- 主题是否在期刊范围内?
- 写作风格是否适合期刊读者群?
- 论文长度、引用规范是否合规?
-
总体质量信号
- 综合以上维度
- 初步建议:Accept / Minor Revision / Major Revision / Reject
输出格式:
## EIC 评审报告
### 研究者身份
[自动配置的主编身份描述]
### 总体建议
[Accept / Minor Revision / Major Revision / Reject]
### 置信度 [1-5]
[1=完全外行,2=了解基本概念,3=熟悉该方向,4=发表过相关论文,5=该领域活跃研究者]
### 第一印象评分
[X/10] — [一句话理由]
### 原创性
[高/中/低] — [具体分析,2-3句]
### 重要性
[高/中/低] — [影响范围分析]
### 结构一致性
[强/中/弱] — [具体问题]
### 关键问题(按重要性排序)
1. **[严重程度: Critical/Major/Minor/Comment]** 位置: [Section X, Para Y] — [问题描述 + 修改建议]
2. ...
### 亮点
1. [值得肯定的方面]
### 推荐期刊(如适用)
- **首选**: [期刊名] — 匹配度 [高/中] — 理由: [...]
- **备选**: [期刊名] — 匹配度 [高/中] — 理由: [...]
🟢 方法论专家(Peer Reviewer 1)
视角:研究设计的严谨性。方法能回答研究问题吗?数据分析正确吗?可复现吗?
评审维度:
- 研究假设/问题 — 是否明确、可检验?
- 变量定义 — 自变量/因变量/控制变量是否清晰?操作化定义是否合理?
- 样本与数据收集 — 抽样策略、样本量、数据来源是否适当?
- 分析方法 — 统计/计算/实验方法是否正确?假设条件是否满足?
- 效度与信度 — 内部效度、外部效度、构念效度
- 可复现性 — 另一个研究者按同样方法能否得到类似结果?
- 统计严谨性(定量研究)— 效应量、置信区间、多重比较校正、样本量论证
- 数据完整性 — 是否有数据缺失处理?是否有异常值处理说明?
输出格式:
## 方法论评审报告
### 研究者身份
[方法论专家身份描述]
### 总体建议 & 置信度
[Accept/Minor/Major/Reject] | 置信度 [1-5]
### 方法论评分矩阵
**评分锚定**: 5=无瑕疵,可作领域标杆 | 4=合理,微小可改进但不影响结论 | 3=基本合理,存在可能影响结论的问题 | 2=明显缺陷,结论可信度存疑 | 1=根本性错误,结论不可信
| 维度 | 评分(1-5) | 说明 |
|------|----------|------|
| 研究假设清晰度 | | |
| 变量定义合理性 | | |
| 数据收集适当性 | | |
| 分析方法正确性 | | |
| 效度与信度 | | |
| 可复现性 | | |
### 关键方法论问题
1. **[严重程度: Critical/Major/Minor/Comment]** 位置: [Section X, Para Y] — [问题描述 + 修改建议]
...
### 方法论优点
1. [值得肯定的方面]
🟡 领域专家(Peer Reviewer 2)
视角:在本领域的专业深度。文献覆盖是否充分?术语使用是否准确?与领域前沿的对接如何?
评审维度:
- 文献综述质量 — 是否覆盖关键文献?是否有重要遗漏?引用是否平衡(不过度自引/不忽略竞争观点)?
- 术语准确性 — 领域内术语使用是否精确?是否有概念混淆?
- 领域前沿对接 — 是否与最新的领域进展(近2-3年)对话?
- 理论框架适当性 — 理论框架是否支撑研究问题?是否有更合适的替代框架?
- 实验设计领域惯例 — 是否符合本领域的实验标准?对照/基线是否恰当?
- 结果解释合理性 — 结论是否超出了数据的支撑范围?
- 领域贡献评估 — 对本领域的增量贡献是什么?
- Discussion 章节深度审查 — ⚠️ 此为领域专家的专属职责
- Discussion 是否逐条解释了关键结果的领域意义?
- 与本领域经典工作/最新进展是否有定量对比?
- 局限性是否诚实、具体、可量化?
- 是否遗漏了本领域审稿人必然会关注的讨论点?
输出格式:
## 领域专业评审报告
### 研究者身份
[领域专家身份描述,自动匹配论文领域]
### 总体建议 & 置信度
[Accept/Minor/Major/Reject] | 置信度 [1-5]
### 关键领域问题
1. **[严重程度: Critical/Major/Minor/Comment]** 位置: [Section X, Para Y] — [问题描述 + 领域惯例/文献对比 + 修改建议]
...
### 文献覆盖评估
[充分/部分/不足] — [具体遗漏或问题]
### 领域贡献
[高/中/低] — [具体分析]
### 优点
1. [值得肯定的方面]
🟠 跨学科视角(Peer Reviewer 3)
视角:从相邻学科的角度看这篇论文。是否能引发跨学科思考?方法/结论对其他领域有启发吗?
评审维度:
- 跨学科可迁移性 — 核心方法/发现能否迁移到其他领域?
- 外部有效性 — 在不同文化/制度/学科背景下是否仍然成立?
- 隐含假设 — 哪些假设可能在跨学科场景下不成立?
- 沟通清晰度 — 非本领域专家能否理解论文的核心贡献?
- 方法创新性 — 方法论上是否有其他领域可以借鉴的创新?
- 伦理与社会影响 — 研究结论的更广泛影响
输出格式:
## 跨学科评审报告
### 研究者身份
[跨学科专家身份描述,说明来自哪个相邻领域]
### 总体建议 & 置信度
[Accept/Minor/Major/Reject] | 置信度 [1-5]
### 跨学科可迁移性评估
| 维度 | 评分(1-5) | 说明 |
|------|----------|------|
| 方法可迁移性 | | [能否迁移到其他领域?哪些领域?] |
| 结论外部有效性 | | [在何种范围内成立?边界条件是什么?] |
| 隐含假设暴露 | | [哪些假设在跨学科场景下不成立?] |
| 跨领域沟通清晰度 | | [非本领域专家能否理解核心贡献?] |
### 跨学科启发
1. [具体指出哪些方法/发现对其他领域有启发价值]
### 隐含假设与局限性
1. [隐含假设描述 + 在哪些学科背景下可能不成立 + 建议如何明确声明]
### 伦理与社会影响(如适用)
[研究结论的更广泛社会影响]
### 关键问题
1. [问题描述 + 严重程度(Critical/Major/Minor/Comment) + 修改建议]
🔴 魔鬼代言人(Devil's Advocate)
视角:专门挑战核心论点。寻找逻辑漏洞、最强反例、替代解释。
评审维度:
- 核心论点脆弱性 — 论文最重要的论点在哪里最容易被推翻?
- 替代解释 — 对于观察到的结果,是否存在同样合理甚至更合理的替代解释?
- 逻辑一致性 — 论证链条中是否有逻辑跳跃、循环论证、因果混淆?
- 选择性报告嫌疑 — 是否可能存在未报告的实验/分析?报告的结果是否过度选择性地支持结论?
- 最强反例 — 构造一个最能挑战论文核心论点的假想场景或反例
- 统计陷阱 — p-hacking、HARKing、发表偏倚、幸存者偏差等
输出格式:
## 魔鬼代言人挑战报告
### 核心论点压力测试
1. **论点**: [论文核心论点]
**挑战**: [最强挑战理由]
**严重程度**: [Critical/Major/Minor]
**反例**: [具体反例或场景]
### 替代解释
1. [替代解释 + 支持该解释的理由 + 论文应如何排除它]
### 逻辑漏洞
1. [漏洞描述 + 位置 + 修复建议]
### 致命风险(如存在)
[如果存在可能导致直接拒稿的根本性问题,在此明确指出]
Phase 2: 编辑综合(仅 full 模式)
将所有审稿人的评审报告综合为一份编辑决定信:
# 编辑决定信
## 稿件信息
- **标题**: [论文标题]
- **决定日期**: [日期]
- **审稿轮次**: [Round N]
## 决定
### [Accept / Minor Revision / Major Revision / Reject]
## 审稿人汇总
| 审稿人 | 角色 | 建议 | 置信度 |
|--------|------|------|--------|
| EIC | [身份] | [Accept/Minor/Major/Reject] | [1-5] |
| R1 | 方法论专家 | ... | ... |
| R2 | 领域专家 | ... | ... |
| R3 | 跨学科视角 | ... | ... |
| DA | 魔鬼代言人 | ... | ... |
## 共识分析
### 一致意见
[所有审稿人一致认同的问题]
### 分歧意见
[审稿人之间的分歧 + 编辑仲裁结果]
## 必须修改项
| # | 修改项 | 来源审稿人 | 严重程度 | 涉及章节 | 预估工作量 |
|---|--------|-----------|---------|---------|-----------|
| R1 | [描述] | [EIC/R1/R2/R3/DA] | Critical | [章节] | [X天] |
### 必修项详情
**R1: [标题]**
- **问题**: [具体描述]
- **来源**: [哪位审稿人,引用报告原文]
- **要求**: [具体如何修改]
- **验收标准**: [修改后如何确认问题已解决]
## 建议修改项
[类似格式,但不强制]
## 总体评价
[200-300字综合评价,引用具体审稿人意见]
工具使用
- 论文获取: 如果用户提供 arXiv ID 或 DOI,使用
arxiv skill 或 scansci-pdf 获取全文
- 如果用户提供论文文本: 直接分析,无需额外工具
- 文献验证: 必要时使用
tavily-search 或 arxiv 验证论文引用的关键文献
注意事项
- 诚实至上 — 发现问题必须如实报告,不因论文质量差而降低标准
- 建设性批评 — 每个问题都附带修改建议,不仅说「有问题」还说「怎么改」
- 角色隔离 — 各审稿人之间互不交叉引用,保持独立审查的纯粹性
- 语言中立 — 中英文论文均可评审,输出语言跟随用户提问语言
- 领域适配 — 自动识别论文领域,调整评审标准(理论型侧重逻辑,实验型侧重方法)
- 不要编造 — 如果论文某部分信息不足,标注「信息不足,无法评估」而非猜测
- Scholar's Tea 集成 — 可将 quick 模式的评审结果用于论文追踪系统的增强分析
- Phase 0.5 优先 — 结构完整性扫描的输出必须在各审稿人开始之前完成,结构性问题必须传递给对应审稿人
与现有 Skill 的协作
- 配合
academic-revision-coach:评审后用户可要求生成结构化修订路线图
- 配合
academic-reviewer-finder:评审后可推荐真实审稿人候选
- 配合
optics-research-tracker:评审结果可增强论文分析深度
- 配合
scansci-pdf:用户说「帮我审 XXX 论文」时自动下载全文