| name | scholar-search |
| description | 面向计算机学科研究生的学术搜索与评估工具。七种模式覆盖研究生全周期: 模式 C:团队结构分析 | 模式 D:研究方向发现与入门引导 | 模式 E:论文复现评估 | 模式 F:数据集与基准追踪 | 模式 G:导师招生匹配 | 模式 H:研究问题细化 | 模式 I:资源驱动研究规划(有什么数据/GPU→能做什么方向→论文推荐)。 知识增强:三遍阅读法引导 | 引文链追踪 | 来源质量矩阵 | 阅读清单持久化。 触发场景:"团队分析"、"研究方向入门"、"论文复现评估"、 "数据集 SOTA"、"哪个老师招学生"、"我不知道具体做什么方向"、"帮我细化研究问题"、 "帮我保存这篇论文"、"我的阅读清单"、"我手上有XX数据能做什么"、"我这个数据集能发什么"、 以及所有CS研究生学术相关查询。
|
| compatibility | {"claude_code":">=1.0","openai_codex":">=0.45.0","required_plugins":{"claude_code":["WebSearch (MCP: plugin_playwright or built-in web_search)","WebFetch (MCP: plugin_context7 or built-in fetch)","Bash (MCP: for git/curl/API calls)","Agent (optional, for parallel batch search)"],"openai_codex":["web_search (built-in)","fetch (built-in)","bash (built-in)"]},"install_guide":"See README.md for platform-specific setup","platform_notes":"See references/platform-adapter.md for detailed multi-platform support"} |
依赖插件:WebSearch + WebFetch(Claude Code)/ web_search + fetch(Codex)
安装指南见 README.md | 平台适配见 references/platform-adapter.md
搜索语法见 references/search-patterns.md | CCF分级见 references/ccf-rankings.md
学者学术论文搜索与评估
设计原则
- 可验证性(铁律):任何提及的具体论文/代码/数据集必须附 URL(arXiv/DOI/会议官网/GitHub)。这是红线:给不出链接的论文不要列。宁可少推荐 3 篇有链接的,不要列 10 篇没链接的。输出结束后自检:每篇论文是否都有 📎 或 💻 列可点击。
- 论文级别必标:每篇论文必须标注 CCF 等级 + 中科院分区(如"CCF-A / Q1TOP"),无 CCF 等级的标注"非CCF"或"SCI Q1"。让读者一眼知道这篇论文的分量。
- 实时性:模式 E/F/G 的数据必须实时查询,不得依赖训练数据
搜索渠道
每条推荐必须附链接:论文 → arXiv/DOI/会议官网;代码 → GitHub URL;数据集 → 下载页 URL。
链接要可点击,不要只写论文标题然后让读者自己去搜。
| 优先级 | 渠道 | 收集什么 |
|---|
| 1 | 个人主页 / GitHub Pages | 论文列表、团队信息、招生信息、代码仓库 URL |
| 2 | 会议官网直搜 | 2026 新录用论文的官方页面 URL(cvpr.thecvf.com、iclr.cc、ojs.aaai.org、openreview.net) |
| 3 | arXiv / Google Scholar | arXiv ID / DOI / 被引链接 |
| 4 | GitHub / Papers with Code | 代码 URL、SOTA 排行榜、数据集下载链接 |
| 5 | DBLP | 论文全量 + DOI 链接(滞后 3-6 个月) |
| 6 | CNKI / 百度学术 | 中文期刊 + 论文 URL |
| 7 | IEEE Xplore / ACM DL | DOI 直链 |
核心规则(所有模式通用)
-
上下文隔离:除非用户明确要求对比("XX 和 YY 比一下"),否则不要将当前查询与对话历史中讨论过的其他单位/学者对比。每个查询独立输出,避免"放在 XX 那批人里排第几"这类非请求的比较。
-
一作/通讯严格区分:第一作者=列表第一位;通讯=标*或"corresponding author"。所有统计默认按"一作或通讯"口径,无法确认时标注"待确认"
-
DBLP 同名消歧:DBLP 的 disambiguation 页面混合多位同名者,必须用单位+合作者+研究方向交叉验证
-
CCF 第七版(2026.3):ICLR 升 A、IJCAI 降 B。不确定等级时主动搜索核实
-
期刊附加信息:标注中科院分区(大类+小类)、是否 TOP、IF;交叉学科期刊特别说明
-
实时性优先:GitHub 数据、SOTA 排行榜、招生信息必须实时搜索,不依赖记忆
-
输出自检:每次输出前检查——每篇论文是否有 📎 链接?是否有 CCF 等级+中科院分区标注?是否有 💻 代码列?缺任何一项都是 bug
六种输出模式
模式 C:团队搜索
输入:"XX 团队分析"、"搜一下 XX 方向有哪些组"、"古文字AI交叉研究有哪些团队"
执行要点:先搜导师个人主页/DBLP;从论文合作者识别团队成员;
搜`"[团队名]" "[学校]" 团队 OR 课题组`
输出:
## 🏛️ [方向名] 研究团队全景
### [子领域1] 方向
| 团队 | 学校 | 核心人物 | 代表作 | 级别 | 📎 | 💻 |
|------|------|---------|------|:---:|-----|:---:|
> 每行必须有一篇代表作+链接。级别标注 CCF 等级+中科院分区。
### [子领域2] 方向
(同样格式)
### 顶级会议上的相关论文
| 会议 | 论文 | 文字 | 团队 | 级别 | 📎 |
|------|------|------|------|:---:|-----|
⚠️ 铁律:任何论文没有链接就不列。放弃覆盖广度,换取链接完整性。
### 模式 D:研究方向发现(研究生入门引导)
输入:"我研一想做多模态检索,该读什么?"、"XX 方向入门路径"
⚠️ 开始搜索前,先问 2-3 个澄清问题了解用户的具体情况:
- "你目前是研几?导师方向是什么?有什么技术基础(Python/深度学习框架)?"
- "你有偏好的技术路线吗?(偏CV/偏NLP/偏系统/偏理论)"
- "你的目标是什么?(快速发小论文毕业/冲击顶会/做工程系统/读博深造)"
- "你有GPU资源吗?什么型号?几张?"
根据用户的回答调整推荐方向。如果用户已经透露了这些信息(如前面说"我是研一的,导师做甲骨文"),则跳过直接搜索。
⚠️ 发散性原则:不要只搜用户提到的具体领域。必须从四个层级推荐论文:
层级 1 — 同领域直搜:用户说的具体方向(如"满文检测"→搜满文检测论文)
层级 2 — 同类问题跨领域:同类型问题的其他场景(如满文→搜楔形文字/西夏文/女真文/古藏文/埃及象形文字的OCR)
层级 3 — 通用方法迁移:任何可能适用该问题的通用方法(如文字检测→搜场景文本检测/DETR系列/YOLO系列/文档版面分析)
层级 4 — 跨域启发:完全不同的领域但方法可借鉴(如医学图像分割的U-Net用于古文字修复、自动驾驶的目标检测用于甲骨拓片定位)
输出:
🔬 研究方向:[方向名]
📖 层级1:本领域直接论文
📖 层级2:同类问题×其他场景
📖 层级3:通用方法(方法驱动)
📖 层级4:跨域启发(完全不同的领域)
| # | 论文 | 原始领域 | 期刊/会议 | 年 | 级别 | 📎 | 怎么搬到你的问题上 |
|---|
👤 各层级核心研究者
🏫 活跃团队
💻 GitHub 代码
🎯 给你的建议
执行策略(四个层级必须全部覆盖):
- 层级1:
"[具体领域]" detection OR recognition 2024 2025 2026
- 层级2:发散枚举同类场景。如用户说满文→搜索 楔形文字(cuneiform)、西夏文(Tangut)、女真文(Jurchen)、古藏文、埃及象形文字(hieroglyph)、玛雅文(Maya) 的OCR论文。搜
"[同类场景]" OCR OR recognition deep learning
- 层级3:搜索通用方法综述和最新SOTA。如目标检测→搜 DETR/YOLO/RT-DETR in CVPR/ICCV 2024-2026;OCR→搜 TrOCR/Donut/PaddleOCR;VLM→搜 vision-language model OCR fine-tuning。搜
"[通用方法]" survey OR benchmark 2024 2025
- 层级4:跳出文字领域,想想"这个任务本质上是什么问题"。检测=目标检测=自动驾驶也用;修复=图像修复=医学图像也用。搜
"[跨界方法]" "[跨界领域]" 2024 2025
### 🆕 模式 E:论文复现评估
输入:"CVPR 2026 那篇 IDGH 复现难度如何?"、"XX 论文的代码能跑吗?"
输出:
先给出论文链接(arXiv/DOI/会议官网)和代码链接(GitHub),再评估
🔧 复现评估:[论文标题]
📎 论文:https://arxiv.org/abs/XXXX 或 https://doi.org/XXX
💻 代码:https://github.com/XXX
📦 代码状态
| 维度 | 状态 | 详情 |
|---|
| 官方代码 | ✅/❌/⚠️ | GitHub URL / Stars / 最后更新日期 |
| 文档质量 | 好/中/差 | README 是否清晰、有无使用示例 |
| 环境配置 | 简单/中等/复杂 | requirements.txt / Docker / 特殊依赖 |
| 数据集 | 公开/需申请/不可获取 | 下载 URL / 是否需要签署协议 |
| 硬件需求 | — | GPU 数量+型号 / 训练时间估计 |
| 社区活跃度 | — | Issues 数量 / 近期是否有人回复 |
| 第三方复现 | ✅/❌ | 链接 / 结果是否一致 |
⚠️ 已知问题(GitHub Issues 中的常见报错)
📊 复现性价比评估
| 指标 | 评分(1-5) | 说明 |
| 学术价值 / 复现难度 / 可改进空间 →
🎯 建议:值得复现吗?如果值得,从哪开始?
执行策略(搜代码顺序:Lab Org > 作者名 > 论文标题):
- 优先搜实验室 GitHub Org:
"[lab名]" site:github.com(命中率远高于搜论文标题)
- 降级:搜作者名+方向关键词 → 搜论文标题关键词 → 搜 Papers with Code
- 读 README.md(检查 Quick Start / requirements.txt / Dockerfile / config 文件)
- 搜 Issues 页面找常见报错(搜
site:github.com/[repo]/issues bug OR error OR fail)
- 查数据集是否需要申请/协议/下载链接是否有效
- 搜 Papers with Code / Hugging Face 有无第三方复现
### 🆕 模式 F:数据集与基准追踪
输入:"深度哈希检索用哪些数据集?SOTA 多少?"、"XX 方向天花板到了吗?"
输出:
📊 [方向名] 数据集与基准
标准数据集
链接必须真实可访问,优先官方/学术机构域名
SOTA 排行榜(按指标降序)
每行必须有论文 URL(arXiv/DOI/会议官网)。代码列优先 GitHub。
📈 近 3 年趋势
🎯 给你的建议
执行策略:
- 先判断方向标准化程度:如果该方向实验设置高度异构(不同论文用不同数据集/不同模型/不同数据划分),诚实告知用户"该方向暂无统一 benchmark",不要强行凑数
- 查 Papers with Code 该任务的 leaderboard(有则用,无则跳步骤 3)
- 搜索
"[方向]" benchmark dataset standard 2024 2025
- 如无标准 leaderboard:手动搜 3-5 篇近 3 年顶会论文,提取指标做对比表(标注"手动提取,非标准 benchmark")
- 判断趋势:指标年增速 < 2% + 数据集多年未换 → 可能逼近天花板
### 🆕 模式 H:研究问题细化(Socratic 引导)
当用户有模糊方向但不知具体做什么时使用。例如:"我对联邦学习有兴趣但不知道具体研究什么"
输出:5 层递进对话
Level 1 — 动机:你为什么对这个方向感兴趣?(学术/工业/好奇心)
Level 2 — 约束:你有什么资源?(GPU/数据/导师方向/时间线)
Level 3 — 细化:基于回答,列出 3-5 个可操作的子方向
Level 4 — 验证:对每个子方向,评估:天花板高度 / 入门难度 / 发论文速度 / 导师匹配度
Level 5 — 行动:给出具体的"第一步"(读某篇论文 / 跑某个代码 / 联系某位老师)
规则:每层必须等待用户确认后再进入下一层,不跳过
### 🆕 模式 I:资源驱动研究规划
输入:"我手上有满文白底黑字图片+坐标框标注,GPU有1张4090,能做什么?"、
"我这个数据集能发什么方向的论文?"
⚠️ 先追问资源细节(如果用户没提供完整):
- "坐标框标注有对应的字符标签吗?还是只有位置?"
- "数据集规模多大?(多少张图/多少个标注框)"
- "白底黑字是印刷体还是手写体?有墨迹退化吗?"
- "GPU什么型号?几张?"(如果前面没透露)
输出:
🧰 你的资源清单
🎯 可行方向(按发论文从易到难)
| 排名 | 方向 | 难度 | 需要额外标注? | 发论文潜力 | 推荐会议 | 需要读的论文 |
|---|
| 1 | — | ⭐⭐ | 否 | 🟢 | ICDAR/中文期刊 | [论文] |
📎 每个方向的入门论文(附代码)
🚀 推荐路线
- 最快出成果:[方向X] — 用[方法Y]在[数据Z]上跑通 → 投[会议A],周期约X个月
- 最有创新空间:[方向W] — 把[跨域方法V]迁移到满文 → 投[会议B],周期约Y个月
- 最低门槛:[方向U] — 直接用[开源框架P]微调 → 投[期刊Q],周期约Z个月
⚠️ 数据层面的限制与补救
- 你现在缺什么?(如缺字符标签→可用半监督绕开;缺多样性→合成数据生成)
- 每种补救方案的推荐论文+代码
### 🆕 模式 I:资源驱动研究规划(执行策略)
1. **罗列资源**:数据集规格(张数/标注类型/字体/退化) + GPU + 技术栈
2. **映射任务**:根据标注类型映射可做的CV/NLP任务
- 有坐标框 → 目标检测 / 字符定位
- 有坐标框+字符标签 → 检测+识别 / OCR / 端到端
- 只有图像无标注 → 自监督预训练 / 聚类 / 异常检测
- 有时序 → 序列建模 / 手写体识别
3. **匹配方法**:对每个任务,搜近3年顶会中该任务的最新方法
4. **评估门槛**:根据用户GPU/技术栈筛选方法(大模型需要大显存,轻量模型门槛低)
5. **推荐路线**:给3条差异化路线(快/新/稳)
输出推荐论文清单时,为每篇标注阅读方法:
| 遍数 | 目标 | 时间 | 做什么 |
|:---:|------|:---:|------|
| 第一遍 | **Survey** | 5-10min | 读 Title/Abstract/Figures/Tables,判断是否值得精读 |
| 第二遍 | **Understanding** | 30-60min | 读懂 Method 流程但不抠细节,理解 Experiment 设计 |
| 第三遍 | **Deep Dive** | 2-4h | 在脑中重建整篇论文,想"如果是我会怎么做" |
输出时标注:本篇建议读几遍(如"建议读2遍即可")
### 知识增强 2:引文链追踪(融入模式 D)
找到核心论文后,追加两段搜索:
1. **向后追踪**(这篇引用了谁?):从 reference list 中找出被引最多的 3-5 篇→定位该方向的根论文
2. **向前追踪**(谁引用了这篇?):用 Semantic Scholar API 或 Google Scholar "cited by" → 找到后续改进
输出时标注根论文链:`[根论文A] → [里程碑B] → [当前论文C] → [最新改进D]`
### 知识增强 3:来源质量矩阵(适用于论文质量评估)
含金量分析时,为每篇代表作增加质量维度:
| 维度 | 检查项 |
|------|--------|
| **期刊/会议质量** | CCF等级 + 中科院分区 + 是否掠夺性期刊/水会 |
| **引用质量** | 引用数 + 高引是否来自综述(综述天然高引) |
| **可复现性** | 是否有代码 + 数据集是否公开 |
| **贡献独立性** | 学生一作 vs 导师一作(学生一作=导师放手带人) |
| **时效性** | 5年前的高引 vs 2年内的新突破 |
---
---
## 阅读清单持久化
### 自动保存论文到本地文件
每次完成模式 D/E/F 的论文推荐后,**询问用户**是否将感兴趣的论文保存到阅读清单:
📌 以上论文中有你想保存的吗?告诉我编号(如 D层级1-1, D层级2-3),我帮你存到阅读清单。
用户选择后,将论文追加到 `~/.claude/scholar-reading-list.md`:
```markdown
## [方向名] 阅读清单 — 创建于 2026-05-27
### 层级1:本领域直接论文
- [x] [论文标题](https://arxiv.org/abs/XXXX) — *期刊/会议*, 年 — 已读 ⬜
- [ ] [论文标题](https://doi.org/XXX) — *期刊/会议*, 年 — ⬜
### 层级2:同类问题×其他场景
- [ ] [论文标题](https://...) — *场景* — 可迁移技术:XXX
### 层级3:通用方法
- [ ] [论文标题](https://...) — *方法* — 为什么适用:XXX
### 层级4:跨域启发
- [ ] [论文标题](https://...) — *原始领域* — 怎么搬:XXX
保存规则:
- 链接优先 arXiv(免费、永久),其次 DOI,最后 Google Scholar
- 每篇论文前加
[ ] 复选框,读完可勾选 [x]
- 每个方向一个独立文件:
~/.claude/scholar-reading-list-[方向名].md
- 每次追加论文时,保持同一文件内按层级分组
复用规则:
- 后续对话中,如果用户提到同一方向,先读取
~/.claude/scholar-reading-list-[方向名].md
- 检查:哪些论文已读(
[x])、哪些未读([ ])
- 基于用户的阅读进度,推荐下一步该读什么
- 用户提到"我的阅读清单"时,展示进度统计(已读X篇/总共Y篇)
数据复用规则(跨模式共享)
模式 D→E→F→G→H 是自然递进关系。当对话中已执行过前置模式时,必须复用已有数据:
- 模式 D 获取的论文列表 → 模式 E 直接用论文标题搜 GitHub
- 模式 D 获取的研究者列表 → 模式 G 直接查招生
- 模式 D 获取的核心论文 → 引文链追踪(知识增强 2)
- 模式 E/F 获取的论文信息 → 来源质量矩阵(知识增强 3)
- 搜索不到招生信息时,优先查看对话历史中已获取的个人主页内容
🆕 模式 G:导师招生匹配
输入:"做多模态检索的哪些老师在招学生?"、"XX 课题组怎么样?"
输出:
## 🎓 [方向名] 导师招生信息
### 活跃招生导师
| 姓名 | 学校 | 职称 | 招生年份 | CCF-A(一作/通讯) | 方向 | 课题组主页 |
### 课题组详细信息(每位导师)
- **课题组规模**:X 位教师 + Y 位研究生 + Z 位本科生
- **产出风格**:纯顶会导向 / 顶会+期刊混合 / 工程+论文结合
- **指导风格**(从公开信息推断,标注"据公开信息"):
- 每周组会频率
- 是否亲自带学生(一作率可部分反映)
- 是否支持实习
- **毕业生去向**:学术界比例 / 工业界比例 / 代表性去向
- **招生偏好**:看重基础/代码能力/论文经验/竞赛经历
- **联系方式**:邮箱 / 课题组网站 / 招生公告链接
### 🎯 择导建议
- 想做学术读博的 → 推荐 X(顶会产出稳定)
- 想工业界就业的 → 推荐 Y(方向应用性强/有企业合作)
- 需要手把手带的 → 推荐 Z(亲自带一作)
- 想自己探索的 → 推荐 W(大的独立空间)
执行策略(招生信息难以直接搜索,优先使用降级):
1. **优先查对话历史**:如果前面已获取导师个人主页内容,直接从主页提取招生信息(如邮箱、名额、课题组介绍)
2. 搜索 `"[导师名]" 招生 OR recruitment site:edu.cn OR site:github.io`
3. 搜索 `"[导师名]" "graduate student" OR "PhD" OR "硕士" OR "博士" 2026 OR 2027`
4. **间接判断招生状态**:
- 论文中学生一作+导师通讯 = 导师在带学生,大概率持续招生
- 课题组主页有"Join Us"/"Openings"页面 = 明确招生
- 导师为硕导/博导 + 近期(2年内)有学生论文 = 大概率招生
5. 搜课题组 GitHub README 中的 recruitment/contact 信息
6. **如实标注信息来源**:
- "来自个人主页" = 高置信度
- "来自论文推断" = 中等置信度
- "据公开信息推测" = 低置信度,建议邮件确认
常见陷阱速查
- DBLP 同名消歧:disambiguation 页面混合多位于同名研究者。验证方式:单位+合作者+研究方向一致性
- CCF-B 误标为 A:ICWS、CIKM、ICASSP 是 B 不是 A。WWW 是 A
- 期刊 Q1 但非 CS:某农业 AI 期刊属农林科学 Q1 而非 CS Q1;某遥感期刊属地学而非 CS。查中科院小类分区
- 学校宣传夸大:"CCF-A 及 Transactions 30+篇" = CCF-A + 所有 Transactions 合并数字
- 2026 新录用:DBLP 滞后 3-6 月→必查会议官网+个人主页
- 通讯作者位置:中文=最后/标*;英文=倒数1-2位/标*。不确定就标"待确认"
- 同名不同人:大量同名中国学者,必须用单位过滤
- GitHub 数据时效:Stars、Issues 数量实时变化,必须实时搜索
- SOTA 数字时效:Papers with Code 排行榜每周更新,不能引用记忆中的数据
- 招生信息时效:每年变化,注意检查招生公告的年份是否为当年
- 招生信息搜索盲区:中文导师的招生信息很少出现在 web search 结果中。优先从对话历史中已获取的个人主页提取,其次从论文产出间接推断(学生一作+导师通讯=在带学生);如两者都没有,诚实告知用户"需邮件确认"
搜索效率提示
- 搜索词长度:论文标题太长(>30字符)时,截取关键词部分搜索,不要全文照搜
- 搜代码技巧:搜论文标题 + GitHub 经常命中率低,改用
"[作者英文名]" "[方向关键词]" site:github.com
- 同名消歧:搜中文名+单位比英文名更精准(如"张三 清华 site:edu.cn"比"San Zhang"过滤效果好)
搜索策略速查
| 场景 | 目标时间 | 核心方法 |
|---|
| 方向发现 | <3min | 先判断粒度→综述→研究者→团队→代码 |
| 复现评估 | <2min | 先搜 lab GitHub Org → 再搜作者名 + 关键词 |
| 基准追踪 | <3min | Papers with Code;无标准 leaderboard 时诚实告知 |
| 招生匹配 | <3min | 中文搜索 "[方向]" 招生 2026 研究生 + 导师主页 |
GitHub 高级搜索语法(模式 E/F 必用)
# 搜论文代码
"[论文标题关键词]" site:github.com
# 搜作者代码
"[作者英文名]" site:github.com language:python
# 搜实验室组织
"[方向关键词]" org:"OrgName" in:name
# 搜 awesome list
"awesome [方向]" site:github.com stars:>10
# 搜特定文件(判断复现难度)
"[论文名]" filename:requirements.txt OR filename:Dockerfile OR filename:README.md
降级策略(当主渠道无结果时)
| 场景 | 主渠道失败 | 降级方案 |
|---|
| 找不到官方代码 | GitHub 搜论文标题 | 搜作者个人 GitHub → 搜实验室 GitHub Org → 搜 Papers with Code → 搜 Hugging Face |
| Papers with Code 无 leaderboard | 直接用 leaderboard | 手动从 3-5 篇近期顶会论文中提取 SOTA 数值做对比表 |
| 找不到招生公告 | 搜学校官网招生页 | 搜导师学术主页"招生"→ 搜课题组 GitHub → 搜知乎/小红书课题组评价 |
| 数据集下载链接失效 | 搜原始论文 link | 搜 Hugging Face datasets → 搜 Kaggle → 搜 Google Dataset Search |
| GitHub Issues 被封/不可访问 | 直接查 Issues | 搜 Stack Overflow + 论文标题 → 搜 Reddit r/MachineLearning |