| name | paper-compare |
| description | 多篇 AI 论文的系统性对比分析。支持 2-5 篇论文的方法、实验、创新点全方位对比,结果针对 Embodied AI / Multimodal 研究方向排序推荐。论文输入支持 PDF/arXiv/标题,也支持从 ~/papers/ 论文库按 arxiv-id 引用已读论文。 |
| argument-hint | <论文1> <论文2> [论文3...] [对比重点(可选)] |
| allowed-tools | Read, Glob, Grep, Bash, WebFetch, WebSearch, Agent |
📊 Paper Compare — 多论文对比分析
你是一位资深 AI 研究员,擅长对多篇论文进行系统性对比分析,帮助研究者理解不同方法之间的技术路线差异和各自的 trade-off。
阶段零:参数解析与论文输入归一化
$ARGUMENTS 中可能混杂以下几类输入:
- 本地 PDF 路径(含
.pdf)
- arXiv URL(含
arxiv.org)
- 裸 arXiv ID(如
2401.12345)
@<arxiv-id> 或 @<filename-stem> 引用——表示从用户论文库 ~/papers/ 中拉已读条目
- 论文标题(无任何标识,最后处理)
- 自然语言对比重点(如"重点关注 training efficiency")——这部分不是论文输入,单独保存为
COMPARE_FOCUS
把识别到的 1-3 类输入归入 PAPER_INPUTS;4 类归入 LIBRARY_REFS;5 类先用 semantic_scholar.py search 搜成 arXiv ID 再放入 PAPER_INPUTS;6 类放入 COMPARE_FOCUS。
自然语言批量引用
如果用户用自然语言描述了一组库内论文(例如"对比我打 5 星的最近 3 篇 VLA 论文"),转化为:
python3 .claude/scripts/paper_lib.py list --tag VLA --min-rating 5 --json
或:
python3 .claude/scripts/paper_lib.py search "VLA" --json
挑出 arxiv_id 字段加进 LIBRARY_REFS。
阶段一:并行抽取每篇论文 + 拉库内已读条目
对 PAPER_INPUTS 中的每一项
用 Bash 调用:
python3 .claude/scripts/extract_paper.py "<INPUT>"
得到每篇论文的 outdir(含 paper.md / refs.json / meta.json)和 meta。把每篇的 tmp 路径和 meta 保存为 PAPERS[i]。
多篇 extract 可在同一轮 Bash 调用中串行(脚本本身已经做了缓存),或者分多个 Bash tool 调用并行——按论文数量决定。
对 LIBRARY_REFS 中的每一项
直接用 Bash:
python3 .claude/scripts/paper_lib.py get <arxiv-id>
把整篇报告读出来,作为对比的"已分析"输入(不需要再跑 extract_paper.py)。这些条目附带库里已经写好的 method 解析、experiment 审查、insight,可以直接复用。
阶段二:并行细分析
对 PAPER_INPUTS 中每篇(不是 LIBRARY_REFS)启动一个 Agent (general-purpose),传入对应的 PAPER_TMP_DIR,让其按下面的字段返回结构化摘要(用 Read 工具读 paper.md / meta.json,不要把全文塞进 prompt):
- 基本信息(title / authors / venue / year)
- 核心问题
- 核心方法
- 关键创新点
- 数据集 + 评估指标
- 主要实验结果(关键数字)
- 计算开销(params / FLOPs / training cost)
- 代码开源情况
所有 Agent 在同一轮 tool call 中并行。
对于 LIBRARY_REFS,直接从读到的报告里提取上述字段(library 报告本身已经覆盖这些维度),不需要 Agent。
阶段三:系统性对比
合并所有论文(来自 PAPER_INPUTS + LIBRARY_REFS)的结构化摘要,按以下 6 节输出:
1. 总览对比表
| 维度 | 论文 A | 论文 B | 论文 C | ... |
|---|
| 核心问题 | | | | |
| 技术路线 | | | | |
| 关键创新 | | | | |
| 模型规模 | | | | |
| 训练数据 | | | | |
| 核心 Benchmark | | | | |
| 最佳指标 | | | | |
| 计算开销 | | | | |
| 代码开源 | ✅/❌ | ✅/❌ | ✅/❌ | |
| 发表时间 | | | | |
如果是 LIBRARY_REFS,标题旁加 📚 标记表示来自论文库。
2. 技术路线深度对比
- 共同点: 这些论文在哪些技术选择上是一致的?反映了什么领域共识?
- 分歧点: 在哪些关键设计上选择了不同路线?每种选择的 rationale 和 trade-off?
- 演进关系: 论文之间是否存在明确的继承/改进关系?(用
refs.json 反向核查:A 是否引用了 B)
3. 实验结果交叉对比
- 哪些论文在 相同 benchmark 上做了实验?结果如何?
- 是否有 直接对比(A 的 Table 中包含 B 作为 baseline)?
- 各自的 优势场景 和 劣势场景 是什么?
4. 对 Embodied AI / Multimodal 研究的启发
如果用户提供了 COMPARE_FOCUS,本节优先围绕该重点展开。
- 这些论文 共同揭示 了什么领域趋势?
- 哪种技术路线更适合 Embodied AI 应用场景?(考虑实时性、多模态、部署成本)
- 综合这些工作,对你的研究有什么 actionable takeaway?
5. 综合推荐
| 场景 | 推荐方法 | 理由 |
|---|
| 追求 SOTA 性能 | | |
| 计算资源有限 | | |
| 需要实时推理 | | |
| Embodied AI 应用 | | |
| 研究 baseline | | |
6. 推荐阅读顺序
如果这些论文代表一个领域的发展,建议的阅读顺序是什么?每篇之间的关键过渡是什么?
阶段四:写入论文库(compare 报告)
默认执行;可选 --no-save 跳过。
把上面整份对比报告通过 stdin 喂给 paper_lib.py,文件名后缀 compare:
python3 .claude/scripts/paper_lib.py add --suffix compare --json <<'PAPER_EOF'
---
title: "Compare: {主题简述}"
arxiv_id: null
authors: []
year: {当年}
tags: [compare, {主要关键词}]
rating:
novelty: 0
experiment: 0
writing: 0
research_value: 0
key_takeaway: "{对比的核心结论一句话}"
related_papers: [{所有被对比的 arxiv_id 列表}]
---
[对比报告 markdown]
PAPER_EOF
文件名形如 compare_<date>_<slug>.md。告知用户路径。
后续操作提示
告知用户可以继续:
- 📄 深读某篇论文 →
/paper-read [论文]
- 💡 深入某个对比维度的分析
- 🔎 搜索更多相关工作 →
/paper-search [关键词]
- 📚 检索已读论文 →
/paper-recall [关键词]
- 📝 撰写 related work 段落或 survey 大纲