원클릭으로
paper-digest
当 Supervisor 给出论文或 blog 的 URL/标题/PDF/DOI,或阅读队列中有待处理条目时,消化内容并生成结构化笔记到 Papers/
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
当 Supervisor 给出论文或 blog 的 URL/标题/PDF/DOI,或阅读队列中有待处理条目时,消化内容并生成结构化笔记到 Papers/
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
当 Supervisor 说"调研""survey""了解研究现状",或需要系统了解某主题的文献全貌时,搜索外部文献、批量 digest、综合生成调研报告
当 Workbench/survey-updates.json 中某 survey 积压了新消化的论文(autoresearch 检测到 ≥5 篇 或最老条目超 7 天),或 Supervisor 说"刷新一下 XX survey"时, 把新论文笔记增量合并进对应 Topics/*-Survey.md,并同步刷新其 DomainMap。
MindFlow 的核心研究循环。当 Supervisor 说"自己干活吧""开始研究", 或系统需要自主推进研究时启动。 持续运行:读取当前状态 → 判断最高价值行动 → 调用卫星 skill → 记录 → 循环
当 Supervisor 给出自己论文的 LaTeX 草稿(.tex)并要求"写 related work""起草相关工作"时, 基于 Papers/ 已读论文与 Topics/ survey 起草英文 LaTeX Related Work 章节, 所有 \cite{} 来自 references.bib,evidence-driven 不编造。
当 Supervisor 说"看看最近有什么 AI 新闻""news 总结",或 autoresearch 检测到 News/ 超期未更新时,抓取 config 中的博客/新闻/公众号源,按研究兴趣筛选点评, 产出 News/YYYY-MM-DD.md 并把重要线索回链进 vault。
每日论文总结。抓取 HuggingFace Daily/Trending + arXiv + venue 源(OpenAlex 期刊 IJCV/TNNLS/TPAMI、CVF 顶会 CVPR/ICCV/WACV)最新论文,按研究方向打分筛选, 生成论文笔记后基于深度阅读写出有态度的总结锐评。 触发词:"今日论文总结""过去3天论文总结""过去一周论文总结""看看最近有什么论文"
| name | paper-digest |
| description | 当 Supervisor 给出论文或 blog 的 URL/标题/PDF/DOI,或阅读队列中有待处理条目时,消化内容并生成结构化笔记到 Papers/ |
| argument-hint | [arXiv URL / blog URL / PDF path / title / DOI] |
| allowed-tools | Read, Write, Edit, Glob, Grep, Bash, WebSearch, WebFetch |
给定一篇论文或技术 blog 的来源(URL、PDF 路径、标题或 DOI),它自动获取内容、提炼核心信息,并按照 Templates/Paper.md 格式生成结构化笔记保存至 Papers/。
支持两种内容类型:
根据 source 的类型选择获取方式:
https://arxiv.org/abs/2603.08127):用 WebFetch 抓取该页面。若需要正文,同时抓取对应的 HTML 全文页(如 https://arxiv.org/html/2603.08127)。https://openaccess.thecvf.com/content/CVPR2026/html/..._paper.html):全文 走同名 PDF(把路径中的 /html/ 换成 /papers/、.html 换成 .pdf,即 .../content/CVPR2026/papers/..._paper.pdf)。⚠️ thecvf.com 对 WebFetch 的 UA 返回 403,必须用 Bash + curl 带浏览器 UA 下载 PDF 再用 Read 读取:
curl -s --max-time 90 -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36" \
-o /tmp/cvf_paper.pdf "<pdf_url>"
然后 Read /tmp/cvf_paper.pdf(>10 页需指定 pages)。abstract、作者等元数据可同样用 curl 抓 html 页解析(id="abstract" / id="authors"),或直接从 PDF 首页提取。venue 字段按 proceeding 填,如 CVPR 2026、ICCV 2025。CVF 论文 PDF 免费且完整,应获取全文而非停留在 abstract。若候选来自 daily-papers,其 pdf_url 字段已给出 PDF 直链。/path/to/paper.pdf):用 Read 读取文件内容。site:arxiv.org 或 filetype:pdf),从结果中定位最可能的论文页面,再用 WebFetch 获取内容。10.1145/...):用 WebFetch 抓取 https://doi.org/<DOI>,跟随重定向到出版商页面。网络兜底协议:若 WebFetch / WebSearch 卡住、返回空内容、只拿到 abstract、或 arXiv / HuggingFace 页面无法完整读取,读取 references/network-fetch-fallback.md 并启用 Lexmount fallback。关键约束:
LEXMOUNT_API_KEY 或已被 .gitignore 忽略的 .env 读取。https://arxiv.org/html/<arxiv_id>,再尝试 https://ar5iv.labs.arxiv.org/html/<arxiv_id>;用:
python3 scripts/lexmount_fetch.py extract "<url>" --format markdown
extract 结果仍不完整,再用 DOM dump 检查:
python3 scripts/lexmount_fetch.py dump "<url>" --engine lightmount_domstable --format text
extract 公共页面;仍失败再 dump --engine chrome_cdp。从获取到的内容中提取以下元数据(如果全文无法获取,至少要获取 abstract):
| 字段 | 说明 |
|---|---|
title | 完整论文标题 |
authors | 作者列表(字符串数组) |
institute | 作者所属机构(字符串数组,从 affiliation 提取) |
date_publish | 发表日期,格式 YYYY-MM-DD、YYYY-MM 或 YYYY |
venue | 发表场所,如 NeurIPS 2025、arXiv;blog 填来源名如 Google DeepMind Blog、Lilian Weng Blog |
url | 论文链接(优先用论文主页,无则用 arXiv abstract 页) |
arxiv_id | arXiv id,如 2606.19409(非 arXiv 论文留空) |
doi | DOI,如 10.1109/TPAMI...(期刊/会议有则填,否则留空) |
code | GitHub 代码链接(若论文中提及) |
Read Critically——论文不是圣经。找出隐含假设和适用边界,ablation、failure case、baseline 选择往往比 main result 更有信息量。对高引论文同样保持批判。
通读获取到的内容,重点提炼以下四个维度:
如果只能获取 abstract 而非全文,在所有内容区块开头加注:> [未获取全文,仅基于 abstract]
文件名格式:YYMM-ShortTitle.md
YYMM:取自 date_publish 的年份后两位 + 月份,如 2603(2026年3月)ShortTitle:标题的 CamelCase 缩写,2-4 个关键词,如 EvoScientist、RoboClaw、DiffusionPolicy2602-ScalingLaws.md去重检查:用 Glob 扫描 Papers/ 目录,检查是否已存在同名或同主题笔记(搜索标题关键词)。若发现重复,停止并告知 Human,不创建新文件。
Tag 选择:阅读 references/tags.md,按照规范选择 tag。
读取 Templates/Paper.md,按模板中的字段和 %% 注释指导填写所有内容。
补充规则(模板未涵盖的):
> [未获取全文,仅基于 abstract],不得推测正文内容YYYY-MM-DD写入文件:用 Write 将笔记保存到 Papers/YYMM-ShortTitle.md。
YAML 前置校验:写入后立即用 Bash 执行以下检查,确保 frontmatter 可被 Quartz 正确解析:
f="Papers/YYMM-ShortTitle.md"
# 检查 title 等字段值中含冒号但未加引号的情况
awk '/^---$/{n++; next} n==1 && /^[a-z_]+:/{print}' "$f" | while read -r line; do
value=$(echo "$line" | sed 's/^[a-z_]*: *//')
if echo "$value" | grep -q ':' && ! echo "$value" | grep -q '^"'; then
echo "YAML ERROR: unquoted colon in value: $line"
fi
done
若发现未加引号的字段,立即用 Edit 为该值加上双引号后重新检查。
固化引用身份:用 Bash 为该论文分配稳定 cite_key 并缓存权威 BibTeX:
python3 skills/4-writing/latex-citation-enhancer/assign_cite_keys.py Papers/YYMM-ShortTitle.md
python3 skills/4-writing/latex-citation-enhancer/fetch_bibtex.py Papers/YYMM-ShortTitle.md
第一条从 url 抽 arxiv_id 并写回 cite_key(幂等,已有 key 不变);第二条把 arXiv/Crossref 权威 BibTeX 存入 references/bibtex-cache.bib(抓不到则从 frontmatter 重建)。两条都安全可重复执行。
追加日志:用 Edit(或 Write 若文件不存在)将以下格式的 log entry 追加到 Workbench/logs/YYYY-MM-DD.md(日期为今天):
### [HH:MM] paper-digest
- **input**: <source 的原始内容>
- **output**: [[Papers/YYMM-ShortTitle]]
- **observation**: <一句话描述论文核心贡献>
- **status**: success
若日志文件不存在,先创建文件(包含一级标题 # YYYY-MM-DD),再追加 entry。
阅读队列:若 source 来自阅读队列(Workbench/queue.md 的 Reading 部分),用 Edit 将对应条目标记为已完成(如在行首添加 ✓ 或删除该条目)。
笔记保存后,运行记账脚本把它挂到相关 survey 的待更新队列:
python3 scripts/survey_updates.py record "Papers/{文件名}.md"
Topics/*-Survey.md frontmatter 的 keywords 与本笔记 tags/标题匹配(大小写与连字符已归一化),输出匹配到的 survey 列表(JSON)。survey-updates 记账失败 即可。survey-refresh skill 负责(GUI canonical 在 ≥1 篇时触发;其他 survey 在 ≥5 篇或最老条目超 7 天时触发)。GUIAgent-Survey,该 pending 是下一 skill round 的强制优先项:在执行任何其他研究任务、或宣告一个包含 digest+整合的多步请求完成前,必须先运行 survey-refresh。独立的单篇 digest 可以在本轮结束,但必须明确报告“GUI survey integration pending”;这保留“一轮一个 skill”的原子性,同时保证下一轮立即整合。GUIAgent-Survey,不等待 5 篇 / 7 天阈值;保持本轮
paper-digest 原子性,并由下一轮优先执行 survey-refresh GUIAgent-Survey。GUI 论文的 tag
必须遵守 references/tags.md 的 umbrella 规则,避免只标 agentic-RL 或宽泛 environment
而漏记账。Papers/YYMM-ShortTitle.md 已存在,停止执行并告知 Human,不得覆盖或修改已有文件。> [未获取全文,仅基于 abstract],不得推测正文内容填充 Method / Key Results 等节。Papers/YYMM-ShortTitle.md 已创建且正文 >200 字cite_key 非空,references/bibtex-cache.bib 含该 key 的条目Workbench/logs/YYYY-MM-DD.md示例 1:从 arXiv URL 消化论文
/paper-digest "https://arxiv.org/abs/2603.08127"
执行过程:
https://arxiv.org/abs/2603.08127 获取 abstract、作者、日期等元数据https://arxiv.org/html/2603.08127 获取 HTML 全文Papers/2603-*.md 检查是否重复references/tags.md 选取合适 tagsPapers/ 和 Ideas/ 搜索相关笔记Papers/2603-EvoScientist.mdWorkbench/logs/2026-03-26.md输出文件:Papers/2603-EvoScientist.md
示例 2:从论文标题搜索
/paper-digest "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion"
执行过程:
"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion" site:arxiv.org输出文件:Papers/2303-DiffusionPolicy.md
示例 3:从本地 PDF 消化
/paper-digest "/Users/qingli/Downloads/roboclaw_2025.pdf"
执行过程:
/Users/qingli/Downloads/roboclaw_2025.pdf 读取 PDF 内容示例 4:从 blog URL 消化
/paper-digest "https://lilianweng.github.io/posts/2024-11-28-reward-hacking/"
执行过程:
Lilian Weng Blog输出文件:Papers/2411-RewardHacking.md