| name | literature-survey |
| description | 对给定领域、主题、研究问题或论文集合执行广泛、充分、逻辑清晰的文献调研与综述写作。用于需要系统检索论文、归纳研究脉络、构建分类框架、总结研究现状、比较不同方法路线、提炼每一类代表性工作、补充核心 LaTeX 公式,并最终整理成结构完整但不过碎的 Markdown 文档的场景。 |
Literature Survey
Overview
执行面向研究问题的文献调研,而不是只堆砌论文列表。优先建立清晰的问题边界、检索范围、分类逻辑和证据链,再写出平衡、完整、可追溯的综述。
默认产出或更新一个 Markdown 文件。除非用户另有要求,否则将调研结果组织成以段落叙述为主的综述,而不是零散条目堆叠。
Workflow
1. 明确调研任务
先明确以下事项;若用户未说明,则做合理假设并写明假设:
- 调研对象:领域、主题、具体问题、方法线、任务设定或论文集合
- 时间范围:经典工作、近五年、最新进展,或“从起源到现在”
- 覆盖目标:综述全景、比较某几类方法、梳理一条技术路线、寻找代表作
- 输出语言:默认跟随用户
- 输出深度:快速综述、标准综述、深入综述
将问题改写成 1 到 3 句精确的调研目标。后续检索、筛选、分类和写作都围绕这个目标展开。
2. 检查本地已有综述
在开始外部文献检索前,先在当前工作区或用户指定的本地笔记目录中检索相似主题、问题或方法线的 Markdown 文件,尤其是已有文献调研、survey、综述、notes、review 类文件。
优先使用 rg --files -g '*.md' 查文件名,再用 rg 组合主题词、同义词、缩写、核心方法名、任务名和代表性论文名检索正文。判断相似时看研究问题、任务设定、方法路线或论文集合是否重合,不要只因为共享泛化关键词就判为相似。
若找到可能相关的已有 Markdown 文件,必须先暂停新建文档并询问用户是否要在已有文件上修改或丰富内容。询问时列出最多 5 个候选文件,包含路径和一句相似原因,并给出两个明确选项:
- 在某个已有
.md 上修改、扩写或补全
- 新建一个独立的文献调研
.md
若用户已明确指定目标文件、明确要求新建,或本地没有相似文件,则不需要额外询问,直接继续。若用户选择已有文件,先阅读其结构、写作风格、已有分类和引用,再在原文基础上补充内容;保留用户已有内容,不覆盖无关段落,并在必要时重整结构以保持综述连贯。
3. 广泛检索文献
先广,再收。不要只依赖单一搜索词、单一站点或单一研究流派。
至少组合以下检索路径:
- 主题词检索:主任务名、同义词、旧称、新称、缩写、上位概念、下位概念
- 方法词检索:模型族、理论框架、训练目标、推断机制、优化策略
- 评测词检索:benchmark、dataset、evaluation、ablation、survey、review
- 综述回溯:先找 survey 或 tutorial,再顺着其参考文献和被引关系扩展
- 代表作扩展:对关键论文做 backward citation 和 forward citation
- 顶会/顶刊扩展:按该领域核心 venue 补齐遗漏
优先使用原始论文页面、官方出版页面、arXiv、作者主页、项目页等一手来源。面对技术问题时,优先引用论文本身,而不是二手博客。
若研究方向较新或变化快,必须核实最新论文与时间信息,不要凭记忆判断“最新进展”。
详细的搜索扩展和偏差控制规则见 search-and-balance.md。
4. 筛选并记录证据
为纳入与排除建立明确标准,并在综述中贯彻一致口径。典型纳入维度:
- 与研究问题直接相关
- 方法或问题设定具有代表性
- 在理论、方法、实验或应用上有实质贡献
- 能代表某一分支、转折点或新趋势
典型排除维度:
- 与核心问题关系很弱,只是表面共享关键词
- 重复性工作过多,且没有新增视角
- 仅有工程微调,难以影响研究脉络判断
为每篇保留最少必要信息:
- 题目、作者、年份、venue、链接
- 研究问题与任务设定
- 核心方法与关键假设
- 训练目标、推断机制或理论结论
- 使用的数据集、评价指标、主要实验结论
- 优势、局限、适用条件
不要把尚未验证的信息写成事实;拿不准时明确说明是推断。
5. 构建有逻辑的分类框架
分类逻辑决定综述质量。优先按“研究问题如何被建模和解决”来分,而不是按“论文热度”或“年份堆叠”来分。
优先考虑以下主分类轴:
- 问题建模方式
- 核心机制或方法范式
- 监督/数据假设
- 理论假设或结构先验
- 训练目标或优化策略
- 推断与决策方式
- 评测设定或应用场景
分类时遵循这些原则:
- 类间可区分:不同类之间有清楚的方法学差异
- 类内可概括:同一类内部能提炼共性,而非只是一组无关论文
- 覆盖尽量完整:不要只写自己最熟悉的一类
- 尽量平衡:热门分支可以写得更细,但不能挤压其他重要分支到几乎消失
如果该领域没有稳定分类法,则改用“发展脉络 + 方法簇”双层结构:先写时间演化,再写并行的方法路线。
6. 总结每一类研究
每一类都要回答同一组问题,保持横向可比性:
- 这类方法试图解决什么核心矛盾
- 它们共享什么关键思想或建模假设
- 代表性方法分别如何实现
- 相比相邻路线,它们强在哪里、弱在哪里
- 在什么任务、数据条件或资源约束下更适用
总结时使用完整语句和成段解释,不要只列关键词。先抽象共性,再介绍代表性工作。
7. 选择代表性工作
每一类通常选 2 到 5 篇代表作;数量服从信息密度,而不是机械统一。
选择代表作时综合考虑:
- 开创性:是否定义了问题、提出了关键范式或成为后续起点
- 代表性:是否能代表该类主流思路
- 影响力:是否显著影响后续研究
- 方法清晰度:是否便于解释该类核心思想
- 实证质量:实验是否扎实,比较是否充分
- 时效性:是否体现该类最新变化
不要只选高引用老论文,也不要只选最新论文。必要时纳入观点相反、假设不同或结果负面的工作,以避免叙述偏向。
8. 介绍具体论文与方法
介绍论文时优先使用完整表述,至少覆盖:
- 论文试图解决的问题
- 方法的核心思想
- 关键模块或优化目标
- 最重要的实验发现
- 相对前作的推进点
若存在真正核心的公式,则给出精炼的 LaTeX 公式,并说明符号含义与公式作用。不要为了“显得专业”而堆公式;只有当公式确实是理解方法的关键时才保留。
例如:
\mathcal{L}(\theta)=\mathbb{E}_{(x,y)\sim\mathcal{D}}\left[\ell\!\left(f_\theta(x),y\right)\right]
给公式配一句解释,说明它对应训练目标、推断准则、价值函数、证据下界或其他核心对象。
9. 输出 Markdown 文档
默认直接产出或更新 .md 文件。若用户选择已有文件,则在该文件上修改或丰富内容;若需要新建且用户没有指定文件名,使用 YYYY-MM-DD-topic-survey.md 的命名方式,topic 使用英文短 slug。
正文结构默认遵循 output-template.md。写作时遵循这些要求:
- 先给出问题定义、范围和分类逻辑,再展开各类工作
- 以段落叙述为主,列表只用于必要的对照或摘要
- 避免把一篇篇论文写成孤立卡片
- 各类篇幅与其研究重要性和文献密度相匹配,但保持整体平衡
- 在结尾总结研究现状、主要分歧、共同瓶颈和未来方向
10. 做最终质量检查
交付前逐项检查:
- 检索是否足够广,是否覆盖主要方法路线
- 分类是否基于研究逻辑,而不是随意拼接
- 研究现状是否平衡,是否明显偏向某一派别
- 代表作选择是否兼顾经典、主流和近期进展
- 论文介绍是否完整,是否避免过碎
- 结论是否由前文证据支撑
- 引文、年份、链接是否准确
- 若声称“最新”,是否已核实日期
更细的检查项见 search-and-balance.md。
Output Standard
默认输出应满足以下标准:
- 读者即使不熟悉该领域,也能看懂分类逻辑和发展脉络
- 读者能够快速定位每一类方法的代表作与核心思想
- 读者能区分事实、总结与推断
- 文档结构完整,但不过度碎片化
若证据不足以支持“全面综述”,不要夸大覆盖度;明确说明仍有哪些盲区或待补部分。