| name | paper-summary |
| description | Fully automated paper summarization with optimized image extraction. First analyzes PDF to identify key figures, then extracts ONLY relevant images from specific pages (resource efficient). Generates structured Chinese summaries with key takeaways (精华), and processes images with smart renaming and cleanup. Use for VLN, VLA, VLM, RL, and Robotics papers. Just provide PDF path - everything else is automated. |
Paper Summary Skill
结构化中文论文摘要生成(VLN / VLA / VLM / RL / Robotics)。工作流:先读 PDF 识别关键图,只从相关页抽图,再生成带 RENAME 注释的摘要,最后自动重命名/归档/清理。
环境与路径
- 环境:conda
TF-ID(依赖见 scripts/requirements.txt:pdf2image、transformers、pillow)
- Python:
/c/Users/tingd/miniconda3/envs/TF-ID/python.exe
- 脚本目录:
/c/Users/tingd/.claude/skills/paper-summary/scripts/
- 博客根:
C:/GitHub/Tingde.Liu.github.io/
- 图片最终目录:
images/[topic]/
- 摘要最终目录:
paper_summary/
Windows / Git Bash 命令规范(必读)
这是整个 skill 里唯一的命令模板,所有步骤都走这套。不要用:
- ❌
conda run -n TF-ID python ...(UnicodeEncodeError)
- ❌
cmd //c "scripts\\extract_images.bat" ...(逗号页码被 bash 截断)
- ❌
-o ./images(.bat 会切换工作目录,相对路径落错位置)
规范模板:
PATH="/c/Users/tingd/miniconda3/envs/TF-ID/Library/bin:$PATH" \
"/c/Users/tingd/miniconda3/envs/TF-ID/python.exe" \
"/c/Users/tingd/.claude/skills/paper-summary/scripts/extract_images.py" \
"C:/path/to/paper.pdf" \
-o "C:/path/to/images" \
-t figure --pages 1,3,6,7
"/c/Users/tingd/miniconda3/envs/TF-ID/python.exe" \
"/c/Users/tingd/.claude/skills/paper-summary/scripts/process_images.py" \
"C:/path/to/outputs/paper-summary-[name].md" \
-d "C:/path/to/images" \
-o "C:/GitHub/Tingde.Liu.github.io/images/[topic]" \
--md-output-dir "C:/GitHub/Tingde.Liu.github.io/paper_summary"
关键点:
- Python 解释器与脚本路径用 Unix 风格 (
/c/Users/...)
- PDF /
-o 用 绝对路径(Windows C:/... 即可)
--pages 不加引号:--pages 1,3,6,7 或 --pages 3-7,10,12-15
-o 指向该论文的 images 文件夹的绝对路径
- poppler PATH:conda 安装的 poppler 不自动入 PATH,必须在命令前加
PATH="/c/Users/tingd/miniconda3/envs/TF-ID/Library/bin:$PATH"
Topic 分类(-o 的 [topic])
先 ls C:/GitHub/Tingde.Liu.github.io/images/ 看已有的子目录,再按下面规则选:
vln/ — 使用 LLM/VLM 的导航(含 Skill-Nav 等 LLM planner 机器人导航)
robotics_navigation/ — 无 LLM/VLM 的传统导航(经典算法、MPC 等)
vla/ — Vision-Language-Action、机器人操作
vlm/ — VLM 研究
agent/ — Agent 框架
llm-training/ — LLM 训练方法
ros2/ — ROS2 相关
工作流(自动模式)
Step 1 — 读 PDF 定位图
- 通读论文,识别被引用的 Figure 及其页码与用途(架构图、结果、消融等)
- 生成目标页列表,如
[1, 3, 6, 7]
Step 2 — 生成摘要草稿(含占位符)
- 按 输出结构 生成五段式内容
- 在 "主要方法/创新点" 节点插入
<img> 占位符,配 <!-- RENAME: figure_XX.png -> {PaperName}-{desc}.png --> 注释
Step 3 — 按目标页抽图
- 用上面 Windows 命令模板调
extract_images.py
- 输出目录应为 PDF 同级
images/,会生成 figure_01.png... 和 image_index.md
Step 4 — 核对并定稿
- 读
image_index.md 确认抽到的图
- 用 Read 查看关键图,对上 Step 2 的占位符,填中文 figcaption
- 存到
[pdf 同级目录]/outputs/paper-summary-[name].md
Step 5 — 自动归档
- 调
process_images.py:重命名 → 移动到 images/[topic]/(源目录清空)→ 删未使用图 → 更新 MD 中的路径与去掉 RENAME 注释 → 删 image_index.* → MD 移到 paper_summary/
Step 6 — 报告结果
- 最终 MD 路径、抽取/重命名/删除/保留的数量、图片最终位置
输出结构
标题行
## [Paper/Method Name (year)]
———[Subtitle/Slogan]
📄 **Paper**: [arXiv:XXXX.XXXXX](https://arxiv.org/abs/XXXX.XXXXX) · 🏛️ **VENUE YEAR**
Paper 行格式规范(与 _posts/2026-01-05-VLN-Papers.md 一致):
- 基本结构:
📄 **Paper**: [链接文字](url),多个条目之间用 · 分隔。
- 所属期刊/会议:末尾追加
· 🏛️ **VENUE YEAR**,VENUE 照搬论文正式发表处。
- 录用示例:
🏛️ **ICRA 2024**、🏛️ **AAAI 2026**、🏛️ **CVPR 2026**、🏛️ **ICLR 2026**、🏛️ **IEEE TPAMI 2025**、🏛️ **ECCV 2024**、🏛️ **ACL 2025**、🏛️ **IEEE RA-L**
- 带状态/出版社时照写:
🏛️ **AAAI 2026 (Poster)**、🏛️ **Vicinagearth (Springer) 2025**
- 预印本(preprint)不加
· 🏛️ 段:仅写 arXiv 链接,如 📄 **Paper**: [arXiv:2512.08186](https://arxiv.org/abs/2512.08186)。
- venue 判定:从 PDF 的页眉/页脚/版权行/脚注(如 "Accepted to …"、"To appear in …"、"Published as a conference paper at …")确定发表处;无明确信息则按预印本处理,不要臆测 venue。
- 可选条目:如有代码/主页,在 venue 前用
· 追加,如 · [Code](url)、· [Project Page](url)。
五段式(用 ### 标题 和 --- 分段)
-
### 精华 — 最多 5 句话,凝练方法论启发,聚焦可迁移思想
-
### 1. 研究背景/问题 — 2–3 句,核心问题 + 动机
-
### 2. 主要方法/创新点 — 主体,最详细。在此插图片占位符:
<div align="center">
<img src="/images/[topic]/[PaperName]-[desc].png" width="100%" />
<!-- RENAME: figure_01.png -> [PaperName]-[desc].png -->
<figcaption>中文简述</figcaption>
</div>
- 命名格式:
{PaperName}-{Description}.png(带论文前缀避免重名覆盖)
- 示例:
Uni-NaVid-architecture.png、MOTUS-method-overview.png、VLingNav-results.png
架构讲解规范(让读者真正看懂):
先放整体架构图,再按以下顺序展开:
① 整体框架概述(1–2 句)
用一句话说清楚系统由哪几个核心模块组成,以及它们之间的协作关系。不要只说"提出了 X 框架",要说"X 框架由 A、B、C 三个模块构成,A 负责…,B 负责…,C 负责…"。
② 逐模块讲解(每个关键模块单独一段)
每个模块按"输入 → 处理过程 → 输出"的数据流描述:
- 输入:这个模块接收什么(图像 patch?语言 token?历史轨迹?)
- 处理:内部做了什么操作(cross-attention?pooling?MLP?)
- 输出:产生什么供下游使用
- 设计动机:为什么要这样设计,解决了什么问题(联系背景节的 gap)
③ 端到端数据流(可选,针对多阶段 pipeline)
若系统是多阶段 pipeline,用一段话按顺序描述一个样本从输入到最终预测的完整流经路径,帮助读者建立整体感知。
④ 训练目标 / 损失函数
列出核心损失项,用公式 + 一句话说明每项的作用。公式遵守本文档的 MathJax 安全规则。
⑤ 推理流程(若与训练有差异)
若推理时有特殊步骤(beam search、iterative refinement、memory retrieval 等),单独说明。
-
### 3. 核心结果/发现 — 关键指标、对比、显著发现
-
### 4. 局限性 — 1–2 句
写作规范
- 语言:中文正文,保留英文专有名词/模型名/缩略语(VLM、SPL、Transformer 等)
- 详略:方法创新最详细,背景与局限简短
- 术语:照搬论文原词
- 图片:所有用到的图必须写
RENAME 注释,只引用实际抽到的图
Jekyll / MathJax 公式安全(kramdown 会在 MathJax 前先解析 Markdown)
- 绝对值不要用
|...|:$|s_t| > \tau$ → $\lvert s_t \rvert > \tau$(| 会被当表格分隔符)
- 范数同理:
\lVert...\rVert 代替 \|...\|
} 后紧跟 _ 会被当成斜体起始:
$\pi^{\rightarrow}_{\theta_k}$ → $\pi_{\theta_k}^{\rightarrow}$(下标写在上标前)
\mathcal{X}_{sub} → \mathcal X_{sub}(单字符参数省大括号;\mathbf / \mathbb / \mathrm 同理)
- 行内公式含
\mathbf{...}_、\bar{...}_、\hat{...}_ 等 }_ 组合时,改用 $$...$$
Manual Fallback
如果自动抽图失败,用户手动提供图片,仍按 输出结构 写摘要,把图放到 ./outputs/ 即可(不加 RENAME 注释)。