| name | scholar-research-assistant |
| description | 学术科研助手,基于 ScholarClub 平台 及 Semantic Scholar 数据库,支持关键词/作者/期刊/时间多维度检索,自动构建关键词矩阵、进行论文质量评分(引用数/期刊级别/作者影响力),输出结构化文献报告。适用于文献综述、领域调研、作者研究脉络追踪。 |
| version | 1.0.2 |
学术论文检索报告技能
任务目标
- 核心功能:通过五步标准流程,系统性检索并筛选学术论文,生成高质量的结构化文献报告
- 检索维度:关键词、作者姓名、期刊/会议名称、发表时间范围
- 质量保障:四维评分体系(相关性40%+引用影响力25%+期刊质量20%+作者影响力15%),自动分级输出A/B/C/D级论文
- 适用场景:文献综述撰写、特定领域论文查找、学者研究脉络追踪、学术背景调研
前置准备
- 依赖说明:scripts脚本使用Python标准库和requests库(requests为常见HTTP库,通常已预装)
- 数据源:Semantic Scholar学术数据库(免费开放访问,提供API Key可提升速率限制)
- 如果遇到 Semantic Scholar 的速率限制,则调用 ScholarClub 的接口进行文章检索,每次 limit 最大设置为 10
ScholarClub API
标准化工作流程
执行原则:以下五个步骤必须按顺序执行,未完成上一步的最小标准不得进入下一步。
第一步:明确检索目标与核验口径
智能体职责:与用户交互,提取并确认以下信息
必填项:
- 研究主题:核心研究问题或领域
- 文献类型:期刊论文/会议论文/综述/预印本等
- 发表时间范围:起始年份和结束年份
- 核心筛选标准:最低引用数、期刊级别、开放获取要求等
可选项:
- 目标期刊/会议列表
- 特定作者或研究团队
- 研究方法限定(如实证研究、理论分析、实验研究等)
最小完成标准:
- 研究主题明确,能够生成至少3个核心关键词
- 时间范围已确定(可接受"不限")
- 至少确定1项筛选标准
输出物:检索需求确认单,包含上述所有已确认的检索参数
第二步:预检索与线索获取
智能体职责:基于研究主题,进行初步探索获取领域线索
执行内容:
-
领域核心期刊识别:
- 调用
scripts/paper_search.py 使用研究主题进行初步检索
- 从返回结果中提取高频率出现的venue(期刊/会议名称)
- 识别领域内权威期刊和顶级会议
-
高影响力作者识别:
- 分析检索结果中的作者信息
- 识别引用数高、论文数量多的核心作者
- 记录作者所属机构和研究团队
-
典型研究方向识别:
- 分析论文标题和摘要中的高频关键词
- 识别领域内的研究热点和分支方向
- 记录典型研究方法和研究范式
最小完成标准:
- 获取至少5个领域核心期刊/会议
- 识别至少3位高影响力作者
- 提炼出至少3个典型研究方向
输出物:预检索线索清单,包含期刊列表、作者列表、研究方向列表
第三步:整理关键词矩阵
智能体职责:基于第一步需求和第二步线索,构建结构化关键词矩阵
关键词分类:
| 类别 | 定义 | 来源 | 示例 |
|---|
| P类关键词 | 直接围绕用户需求的核心关键词 | 用户需求提取 | 研究主题、核心概念、专业术语 |
| W类关键词 | 基于预检索线索的扩展关键词 | 预检索线索 | 高影响力作者、核心期刊、相关研究方向 |
矩阵构建规则:
-
P类关键词(Primary):
- 从用户需求中直接提取的核心概念
- 专业术语的中英文对照
- 研究方法关键词(如适用)
- 数量要求:3-8个
-
W类关键词(Wider):
- 基于预检索结果扩展的相关概念
- 高影响力作者姓名
- 核心期刊名称
- 相关研究分支术语
- 数量要求:5-15个
组合策略:
- 单独使用P类关键词进行精准检索
- P类+W类组合进行扩展检索
- 使用布尔逻辑(AND/OR/NOT)优化检索表达式
最小完成标准:
- P类关键词不少于3个
- W类关键词不少于5个
- 形成至少3组不同的关键词组合
输出物:关键词矩阵表,包含P类关键词列表、W类关键词列表、组合检索策略
第四步:执行学术数据库检索
智能体职责:调用脚本执行检索,获取候选论文列表
执行方式:调用 scripts/paper_search.py 执行检索
脚本调用示例:
python scripts/paper_search.py \
--query "deep learning natural language processing" \
--year-start 2020 \
--year-end 2024 \
--limit 50 \
--fields "title,authors,abstract,venue,year,citationCount,referenceCount,url,openAccessPdf"
支持的检索参数:
| 参数 | 说明 | 示例 |
|---|
--query | 检索关键词(必填) | "machine learning" |
--year-start | 起始年份 | 2020 |
--year-end | 结束年份 | 2024 |
--venue | 期刊/会议名称 | "Nature" |
--author | 作者姓名 | "Hinton" |
--limit | 返回数量 | 20 |
--fields | 返回字段 | 见默认字段列表 |
默认返回字段:
paperId:论文唯一标识
title:论文标题
authors:作者列表
abstract:摘要
venue:发表期刊/会议
year:发表年份
citationCount:引用次数
referenceCount:参考文献数
url:论文链接
openAccessPdf:开放获取PDF链接
多轮检索策略:
- 使用P类关键词进行首轮精准检索
- 根据结果质量决定是否进行扩展检索
- 使用W类关键词进行补充检索
- 合并去重所有检索结果
最小完成标准:
- 至少执行1轮检索
- 获取不少于20篇候选论文(如领域较小可适当降低)
- 每篇论文包含完整的元数据信息
输出物:候选论文原始数据(JSON格式),包含所有检索结果的完整元数据
第五步:相关性核验与报告生成
智能体职责:对候选论文进行质量核验,生成结构化检索报告
核验维度:详见 references/quality_criteria.md
核验流程:
-
相关性初筛:
- 阅读标题和摘要,判断与研究主题的相关程度
- 标记相关性等级:高度相关/中度相关/低度相关
- 剔除明显不相关的论文
-
质量评估:
- 引用数评估:按年份分层评估引用影响力
- 期刊/会议评估:识别发表渠道的学术声誉
- 作者评估:识别作者的学术影响力(H-index、论文数)
-
权威性核验:
- 是否发表在领域顶级期刊/会议
- 作者是否为领域知名学者
- 是否为高被引论文
-
去重与排序:
- 按相关性等级分组
- 同组内按引用数降序排列
- 标注开放获取状态
最小完成标准:
- 完成所有候选论文的相关性评估
- 筛选出不少于10篇高度相关论文
- 每篇论文完成质量指标标注
报告生成:参考 assets/report_template.md 生成结构化报告
输出物:结构化检索报告(Markdown格式),包含:
- 检索概述(需求、策略、范围)
- 核心发现(领域研究现状、主要研究方向、代表性学者)
- 论文清单(按相关性分级、包含完整元数据和质量指标)
- 附录(检索词矩阵、检索日志)
资源索引
注意事项
- 顺序执行:五个步骤必须严格按顺序执行,每步完成后检查最小完成标准
- 智能体主导:关键词提取、相关性判断、报告撰写由智能体完成,脚本仅负责API调用
- 检索策略迭代:若首轮检索结果不理想,可返回第三步调整关键词矩阵
- 开放获取优先:在质量相当的情况下,优先推荐开放获取论文
- 数据时效性:注意Semantic Scholar数据更新周期,最新发表论文可能存在延迟
- 速率限制:无API Key时限制100次/5分钟,建议合理规划检索次数
使用示例
示例1:文献综述检索
用户:帮我检索2020-2024年关于"大语言模型在教育领域应用"的论文,用于写综述
技能执行:
1. 确认需求:LLM+教育,2020-2024,期刊/会议论文,引用数≥30
2. 预检索:识别 AIED、Computers & Education 等核心期刊,定位 3 位高影响力作者
3. 构建关键词矩阵:
P类:LLM, large language model, education, teaching, learning
W类:GPT, ChatGPT, AI tutor, adaptive learning, 高影响力作者名
4. 执行 3 轮检索,获取 60 篇候选论文
5. 质量评分筛选 → 输出结构化报告:
- A级(核心推荐)12篇:含完整元数据、引用数、开放获取链接
- B级(重要参考)18篇
- 附:检索词矩阵、检索日志
示例2:作者研究脉络追踪
用户:帮我梳理 Yoshua Bengio 在深度学习领域的主要研究贡献
技能执行:
1. 以 "Bengio" 为核心,deep learning 为主题,时间不限
2. 检索返回按年份排序的论文列表
3. 质量核验,标注里程碑论文(backpropagation 1989、word2vec 2003 等)
4. 输出按时间线组织的研究脉络报告,注明各阶段代表作及引用数
示例3:快速领域热点扫描
用户:我想了解 2023-2024 年多模态大模型的最新研究进展
技能执行:
1. P类关键词:multimodal LLM, vision-language model, VLM
2. 执行检索,优先筛选近 1 年高引用(≥50)论文
3. 识别领域主要研究方向:图文理解、视频理解、医学多模态等
4. 输出热点方向摘要 + 代表论文清单