| name | document_deduplicator |
| description | 文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本。
当用户提到文档去重、删除重复文档、样本去重、文本去重、去除重复内容、
清洗重复数据、整理文档集合等需求时使用此skill。
即使用户没有明确说出"去重",只要任务涉及从多个文档中识别和删除重复内容,
就应该使用此skill。
|
| name_zh | 文档去重算子 |
| input_params | [{"name":"input","type":"string","required":true,"description":"输入文件路径(支持json, txt)"},{"name":"output","type":"string","required":true,"description":"输出文件路径(支持json, txt)"},{"name":"text_key","type":"string","required":false,"default":"text","description":"文本字段的键名"},{"name":"lowercase","type":"bool","required":false,"default":false,"description":"是否将文本转为小写进行比对"},{"name":"ignore_non_character","type":"bool","required":false,"default":false,"description":"是否忽略非字母字符(空格、数字、标点)"}] |
| output_params | [{"name":"output","type":"json_file","description":"去重后的文件(json或txt格式)"}] |
| tag | 数据清洗 |
| publisher | COMMUNITY |
Document Deduplicator 文档去重 Skill
功能概述
本skill使用MD5哈希算法进行文档级别的精确匹配去重。
通过计算每个文档内容的哈希值,快速识别并删除完全相同或指定条件下相同的重复文档。
触发条件
当用户请求以下任务时,应使用此skill:
- 文档去重
- 删除重复文档
- 样本去重
- 文本去重
- 去除重复内容
- 清洗重复数据
- 整理文档集合
核心参数说明
必需参数
| 参数 | 说明 |
|---|
--input | 输入文件路径 (支持 json, txt) |
--output | 输出文件路径 (支持 json, txt) |
可选参数
| 参数 | 说明 | 默认值 |
|---|
--text_key | 文本字段的键名 | text |
--lowercase | 是否将文本转为小写进行比对 | False |
--ignore_non_character | 是否忽略非字母字符(空格、数字、标点) | False |
支持的文件格式
JSON 格式
{
"data": [
{"text": "文档内容1"},
{"text": "文档内容2"},
{"text": "文档内容1"}
]
}
TXT 格式
文档内容1
文档内容2
文档内容1
使用方法
python scripts/run_document_deduplicator.py \
--input ./input.json \
--output ./output.json
python scripts/run_document_deduplicator.py \
--input ./documents.txt \
--output ./deduplicated.txt
python scripts/run_document_deduplicator.py \
--input ./input.json \
--output ./output.json \
--lowercase True