| name | academic-review-board |
| description | AI Academic Review Board — multi-agent peer review for research papers. Use when: user wants to review a paper/experiment design, run a peer review session, set up a review board for a research project, or evaluate research methodology. NOT for: code review, investment decisions, or simple proofreading. |
Academic Review Board — AI 学术同行评审
用 LLM multi-agent 模拟学术同行评审,在论文投稿前发现方法论缺陷。支持多研究范式(v2.0)。
文献基础
| 框架 | 来源 | 我们借鉴了什么 |
|---|
| AgentReview | Georgia Tech, EMNLP 2024 | Inclusive AC 风格、强制排序、数值锚点 |
| MARG | Northwestern / Allen AI, 2024 | 专业化分工、内部讨论、Refinement |
| PRE | 清华, CIKM 2024 | 位序随机化、匿名评审、质量追踪 |
架构
8 位专家 + 1 位 GM (General Manager)
4 阶段: 独立评审 → 交叉讨论 → 精炼去重 → 加权投票 + GM 裁决
6 个研究范式: 经济金融 | CS/AI | 临床流行病 | 实验行为 | 自然工程 | 生物组学
范式选择
| 范式 | 目录 | 状态 | 典型领域 |
|---|
| 实证经济与金融 | economics-finance/ | ✅ | 金融、经济、会计 |
| 计算机科学与 AI | cs-ai/ | ✅ | ML、NLP、CV、机器人 |
| 临床与流行病学 | clinical-epidemiology/ | ✅ | 医学、药学、公卫 |
| 实验与行为科学 | experimental-behavioral/ | ✅ | 心理、教育、行为经济 |
| 自然科学与工程 | natural-science-engineering/ | ✅ | 物理、化学、材料 |
| 生物与组学 | biology-omics/ | ✅ | 基因组、神经、生态 |
范式选择看方法论,不看院系。详见 paradigm_role_structure.md。
三层角色架构
Layer 2 核心专家(方法论三角)— 每人 5 票:
| 角色 | 经济金融版 | CS/AI 版 | 覆盖 |
|---|
| Methodology Critic | 识别策略/因果推断 | 问题设定/方法创新性 | 研究设计 |
| Experiment Designer | 回测/point-in-time | 消融/基线公平性 | 实验设计 |
| Statistician | Fama-MacBeth/年度FDR | bootstrap/Friedman | 统计分析 |
Layer 1 + 3 一般专家 — 每人 3 票:
| 角色 | 覆盖 | 层 |
|---|
| Devil Reviewer | 致命缺陷、claim-evidence gap | L1 |
| Domain Expert | 理论根基(按领域完全不同) | L3 |
| Literature Scout | 文献覆盖、定位准确性 | L1 |
| Reproducibility Auditor | 数据溯源、代码复现 | L1 |
| Ethics & Compliance | 研究伦理、合规 | L3 |
投票力分布: 核心 3×5=15 / 一般 N×3(N=4-5)
GM 职责
- Phase 3 精炼执行(合并/去重/淘汰/安全审查)
- Phase 4 综合裁决(可推翻投票,须给理由)
- 安全边界一票否决权
- 更新专家记忆和历史追踪
4 阶段评审流程
Phase 1: 独立评审
- 7 位专家各自独立生成 3 个提案(共 21 个)
- 专家之间不可见彼此提案(防锚定)
- 每位专家只看到知识包 + 自己的角色定义
Phase 2: 交叉讨论(借鉴 MARG)
- 所有提案随机打乱顺序 + 隐去来源角色
- 每位专家对其他人的提案发表意见:支持/质疑/补充/合并
- 原提案作者可修改或撤回
- Devil Reviewer 可追加 FATAL 标记
Phase 3: 精炼(GM 执行,借鉴 MARG Refinement)
- 合并重复、淘汰空洞提案、拆分混合问题、安全审查
- 通常 21 个 → 10-14 个
Phase 4: 加权投票 + GM 裁决
- 核心 5 票,一般 3 票,不能投自己
- 提案顺序随机(每人不同)
- GM 综合票数 + 讨论记录 + 安全考量做最终裁决
使用时机:4 阶段研究生命周期
| 阶段 | 输入 | 专家 | 成本 | 核心问题 |
|---|
| 想法 | 1 页研究提案 | 3 个(Domain + Literature + Devil) | ~20K token | 值不值得做?有没有人做过? |
| 设计 | 实验方案 + 数据说明 | 7 个全上 | ~66K token | 实验设计有没有坑?⚠️ ROI 最高 |
| 结果 | 结果 + 统计表 + 鲁棒性 | 7 个全上 | ~66K token | 结论是真的还是 artifact? |
| 投稿前 | 完整论文草稿 | 7 个全上 | ~66K token | Reviewer 2 会怎么打? |
想法阶段可跳过 Phase 2-3,只收集独立评估。设计阶段是 ROI 最高的时机——这时候发现问题只需要改方案,投稿前发现问题要推翻重做。
知识包生成(含 GitNexus)
评审前运行知识包生成器,为 Reproducibility Auditor 注入代码架构上下文:
python3 scripts/build-knowledge.py --topic "{议题}" --paradigm "{范式名}"
5 步流程:跨语言关键词提取 → GitNexus 查询 → blast radius 展开 → 角色过滤 → Markdown 输出。
--paradigm 缺省时默认 economics-finance。
前提:项目已用 gitnexus analyze 索引。未索引时自动跳过,不影响其他专家。
专家改进机制
三层事后评议
- Session Debrief(每次评审后):记录每个提案命运 (ADOPTED/MERGED/PRUNED/IGNORED/VETOED)
- Pattern Analysis(每 3 次评审后):检测 GENERIC>50% / DUPLICATE>40% / IRRELEVANT>30% 等失败模式
- Expert Revision(触发式):诊断根因 + 修改 prompt + Planted Error Test 验证
专家记忆文件 (.memory.md)
每位专家维护独立学习记忆:累积统计、校准范例(好/坏提案示范)、知识补充、关注调整。
模板见 templates/expert-memory.md。
校准会议(Calibration Session)
首次评审前 + 新增专家时,用包含已知缺陷的测试文档校准所有专家。
目标:确保 7 位专家对 "什么算 P0/P1/P2" 有共识。
成本估算
- 每阶段 7 agents × ~2000 token = ~14K token
- 4 阶段 + GM = ~66K token/次
- ~$2-3/次(Opus 定价)
在新项目中使用
初始化
mkdir -p {project}/review-board/{prompts,scripts,sessions,cache}
cp -r ~/academic-review-board/prompts/_shared {project}/review-board/prompts/
cp -r ~/academic-review-board/prompts/economics-finance {project}/review-board/prompts/
cp ~/academic-review-board/prompts/orchestration.md {project}/review-board/prompts/
cp ~/academic-review-board/prompts/gm-academic.md {project}/review-board/prompts/
cp ~/academic-review-board/scripts/build-knowledge.py {project}/review-board/scripts/
cp ~/academic-review-board/templates/* {project}/review-board/cache/
cd {project} && gitnexus analyze
运行评审
python3 scripts/build-knowledge.py --topic "{议题}" --paradigm "{范式}"
自定义选项
| 可调项 | 默认 | 说明 |
|---|
| 研究范式 | economics-finance | 6 个范式可选,看方法论不看院系 |
| 专家数量 | 7-8 | 由 roster.md 动态配置(含可选角色) |
| 投票权重 | 核心5/一般3 | 可改为等权 |
| Phase 2 交叉讨论 | 开启 | 时间紧可跳过 |
| FATAL 机制 | +3 分 | 可关闭或调整加分值 |
| Ethics Auditor | 按范式 | 医学/心理必开,金融/工程可选 |
| GitNexus 集成 | 开启 | 无代码库的纯理论论文可关闭 |