| name | dedup-review |
| description | 文献去重助手 - 多源文献合并去重、相似度判断、整理规范题录 |
| metadata | {"openclaw":{"emoji":"🔍"}} |
文献去重助手
从多个数据库(知网、万方、Web of Science、PubMed、Scholar)导出的文献合并时,帮你识别并去除重复,整理成干净的题录库。
功能概述
- 去重判据:DOI(最可靠)> 标题+年份 > 标题相似度 > 作者+期刊
- 多源合并:不同数据库字段名不一,需统一字段后比对
- 相似度判断:标题大小写/标点/空格差异、预印本 vs 正式版
- 题录规范:补全缺失字段(DOI/页码/期刊全称)、统一格式
- 工具辅助:Zotero 自动去重、EndNote Find Duplicates、参考文献管理软件
去重流程
- 统一字段:各导出文件对齐到同一字段(作者/标题/年份/期刊/DOI/类型)
- 精确去重:按 DOI 完全匹配,一键合并
- 近似去重:标题归一化(转小写、去标点空格)后比对相似度
- 人工复核:相似度高的逐条确认(尤其预印本 vs 正式发表)
- 输出干净库:导出为统一格式(RIS/BibTeX/CSV)
常见重复情形
| 情形 | 说明 |
|---|
| 同篇多库收录 | 知网 + 万方都有 → 按 DOI/标题合并 |
| 预印本 vs 正式 | arXiv 版与期刊版 → 保留正式发表版 |
| 会议 vs 期刊扩展 | 会议论文 + 期刊扩展版 → 按需保留 |
| 中英文版 | 同研究中文版与英文版 → 视需求 |
| 标点/大小写差异 | "A, B" vs "A B" → 归一化后判同 |
使用示例
我从知网导出 120 条、万方 80 条,帮我说明怎么合并去重
这两条标题很像但年份不同,是同一篇吗?怎么判断?
帮我写个 Python 脚本,按 DOI 去重一个 RIS 文件
Python 去重示例(按 DOI)
import re, json
seen, kept = set(), []
for entry in entries:
doi = (entry.get('doi') or '').lower().strip()
key = doi or re.sub(r'[^a-z0-9]', '', entry['title'].lower())[:60]
if key and key not in seen:
seen.add(key); kept.append(entry)
print(f'{len(entries)} -> {len(kept)} (去重 {len(entries)-len(kept)})')
适用场景
- 系统性综述/Meta 分析的文献筛选阶段(PRISMA 流程)
- 多数据库文献合并
- 文献库日常整理
- 开题前的文献清点
不适用场景
- 需要查重自己论文的重复率(用 Turnitin/知网查重)
- 替代人工对预印本/正式版的判断(需人工确认)