用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/cas-bigdatalab/piflow --skill duplicate-detector-fuzzy命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
Dataspace 文件输入源算子。用于根据 Dataspace 数据源实例 ID 和空间内文件路径下载单个文件,并将该文件作为工作流输入提供给下游算子。该算子没有上游输入,必须作为 DAG 的起始节点使用。
Dataspace 文件输出终止算子。用于接收上游算子的单个文件输出,按指定相对目录上传到 Dataspace 空间目录中,实际文件名自动沿用输入文件名。该算子必须作为 DAG 的终止节点使用。
用于编辑或创建 Gaussian 输入文件(.gjf),支持添加 Link 0 指令(%chk、%oldchk、%nprocshared、%mem)、Route 行关键词、电荷和多重度。可对已有 gjf 文件进行参数填充,也可从零创建新的 gjf 文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | duplicate_detector_fuzzy |
| description | 模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。 |
| name_zh | 模糊去重算子 |
| input_params | [{"name":"input","type":"string","required":true,"description":"输入文件路径(支持CSV/TSV/Excel/JSON等)"},{"name":"output","type":"string","required":true,"description":"输出文件路径"},{"name":"subset","type":"string","required":false,"description":"用于比对相似度的文本字段"},{"name":"similarity_threshold","type":"string","required":false,"default":"0.9","description":"相似度阈值(0-1),默认0.9"},{"name":"keep","type":"string","required":false,"default":"first","description":"保留策略(first/last/none/mark)"}] |
| output_params | [{"name":"output","type":"csv_file","description":"去重后的数据文件"}] |
| tag | 数据清洗 |
| publisher | COMMUNITY |
本skill使用标准库相似度算法检测数据集中的近似重复记录。
与精确去重不同,模糊去重可以发现内容高度相似但不完全相同的记录,如:
| 策略 | 说明 |
|---|---|
first | 保留第一条记录 |
last | 保留最后一条记录 |
none | 删除所有重复记录 |
mark | 标记重复但不删除 |
python scripts/run_duplicate_detector_fuzzy.py \
--input data.csv \
--output deduped.csv \
--subset "name" \
--similarity_threshold 0.9
| 参数 | 必填 | 说明 |
|---|---|---|
--input | 是 | 输入文件路径 |
--output | 是 | 输出文件路径 |
--subset | 是 | 比对相似度的文本字段 |
--similarity_threshold | 否 | 相似度阈值(0-1),默认0.9 |
--keep | 否 | 保留策略,默认"first" |
pip install pandas openpyxl