ワンクリックで
paper-source-scraper
按研究方向自动搜索最新论文并执行两级去重(运行内 + 跨周期),输出增量新论文列表。当用户说"搜索最新论文"、"论文巡检"时触发。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
按研究方向自动搜索最新论文并执行两级去重(运行内 + 跨周期),输出增量新论文列表。当用户说"搜索最新论文"、"论文巡检"时触发。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
This skill should be used when the user wants to search for academic papers on arXiv. It supports searching by keywords, author, title, abstract, and categories with customizable time ranges. Use this skill when users ask to find papers, search for research, look up academic articles, or query arXiv for specific topics like "RAG papers", "LLM research", or "find papers by author X".
Use this skill when asked to read, analyze, or summarize an arxiv paper given an arxiv URL or paper ID. Also triggered when processing papers from daily research reports. **每次只精读一篇论文**,严禁批量精读。
对最终选中的论文进行深度精读,从 card.md 中提取结构化字段(sub_field、ID_paradigm、baselines 等)。当 paper-pipeline 编排流程执行到 Step 6(深度精读)时自动触发。
对边缘分数论文生成信息卡片,支持对话式实时交互(Agent 编排首选)和异步挂起(cron 兜底)。当用户说"人工审阅论文"、"捞回论文"时触发。
将论文分析结果沉淀到知识库(paper_index.json),检测论文关联关系,并基于跨论文洞察生成研究 Idea 提案。当 paper-pipeline 编排流程执行到 Step 6.8(知识沉淀)时自动触发。
编排论文阅读全流程(搜索→打分→仲裁→精读→代码评估→知识沉淀),通过 Agent 分步编排模式调度各子 Skill,支持断点续跑和对话式人工仲裁。当用户说"开始论文日常巡检"、"继续之前的巡检"、"运行论文 Pipeline"时触发。
| name | paper-source-scraper |
| description | 按研究方向自动搜索最新论文并执行两级去重(运行内 + 跨周期),输出增量新论文列表。当用户说"搜索最新论文"、"论文巡检"时触发。 |
本 Skill 是一个纯数据获取工具,不包含任何 LLM 逻辑。所有逻辑放在 scripts/source_scraper.py 中确定性执行。
执行搜索脚本:
python $PAPER_AGENT_ROOT/scripts/source_scraper.py --run-id {run_id}
脚本将:
profile.yaml 读取关键词列表、白名单作者列表、arXiv 分类列表、时间范围ArxivSearcher.search() 执行搜索seen_papers.json + seed_papers.json 做 Diff,过滤已见论文seen_papers.jsonskill1_search_results.json + 去重统计摘要profile.yaml 中的搜索配置:
keywords:关键词列表whitelist_authors:白名单作者列表arxiv_categories:arXiv 分类列表search_days:搜索时间范围seen_papers.json:全局已见论文注册表seed_papers.json:核心论文目录{
"papers": [
{
"arxiv_id": "2603.01234",
"title": "...",
"authors": ["..."],
"abstract": "...",
"url": "https://arxiv.org/abs/2603.01234",
"source": "keyword_search",
"published_date": "2026-03-01",
"categories": ["cs.IR", "cs.AI"],
"comments": ""
}
],
"stats": {
"total_raw": 50,
"dedup_intra_run": 35,
"dedup_cross_run": 12,
"new_increment": 12
}
}
| 场景 | 处理策略 |
|---|---|
| arXiv API 频率限制(429) | 指数退避重试(最多 3 次) |
| 网络连接失败 | 返回空列表 + 错误日志 |
seen_papers.json 不存在或损坏 | 从 paper_index.json + seed_papers.json 重建 |
搜索统计:
原始搜索结果: 50 篇
运行内去重后: 35 篇 (去除 15 篇重复)
跨周期去重后: 12 篇 (去除 23 篇已见)
最终增量新论文: 12 篇