| name | deep-dive |
| description | 对 1-10 篇核心论文进行精读分析,提取方法细节、实验设置、关键超参数、代码实现等。当用户说"精读这篇论文"、"分析方法细节"、"deep dive"时触发,或在 pipeline Stage 4(Idea Approval 后)自动调用。 |
deep-dive
对核心论文进行深度精读,超越 claim-extractor 的浅层提取。
与 claim-extractor 的区别
| 维度 | claim-extractor | deep-dive |
|---|
| 深度 | 提取关键断言 | 完整方法拆解 |
| 输出 | evidence_graph claims | 结构化精读笔记 |
| 速度 | 快(每篇 1-2 分钟) | 慢(每篇 5-10 分钟) |
| 用途 | 综述、证据链 | Idea 评估、方法复现 |
输入
- 论文 ID 列表(corpus_ledger 中的 id)
- 或直接指定 parsed_mds/ 中的 Markdown 文件
精读模板
对每篇论文生成结构化笔记:
# {论文标题} — 精读笔记
## 1. 核心贡献(一句话)
## 2. 问题定义
- 输入/输出是什么
- 形式化表述
## 3. 方法拆解
### 3.1 整体架构
(用文字描述,如有必要画 ASCII 图)
### 3.2 关键模块
- 模块 A: 作用、输入、输出、参数
- 模块 B: ...
### 3.3 loss 函数
- 数学表达式
- 各项含义
### 3.4 训练细节
- 优化器、学习率、batch size
- 训练时长、GPU 资源
- 数据增强策略
## 4. 实验分析
### 4.1 数据集
- 名称、规模、split 方式
### 4.2 Baseline 对比
- 对比了哪些方法
- 主要指标和数值
### 4.3 消融实验
- 验证了哪些组件的贡献
## 5. 局限性(作者自述 + 我的观察)
## 6. 复现可行性
- 是否开源代码
- 计算资源需求估计
- 数据是否公开
## 7. 与当前研究的关联
(如果在 idea-brainstorm 上下文中被调用)
执行步骤
- 检查论文是否已解析为 Markdown
- 未解析 → 先调用
pdf-to-markdown 或 alphaxiv-paper-lookup
- 读取完整 Markdown
- 按模板逐节填写
- 将精读笔记保存到
artifacts/deep_dive_{paper_id}.md
- 同时将关键发现追加到
evidence_graph.json(比 claim-extractor 更详细)
批量模式
如果输入多篇论文,生成对比矩阵:
| 论文 | 核心方法 | 数据集 | 主要指标 | 开源 |
|---|
| A | ... | ... | ... | ✅ |
| B | ... | ... | ... | ❌ |
Pipeline Exit
完成后执行:
- 更新
project_state.json 的 current_stage
- 必须调用
pipeline-orchestrator.complete_stage("deep_dive") 验证产出
- 根据返回值自动进入下一阶段(novelty_check)