Skip to main content

这个仓库中的 skills

cas-bigdatalab/piflow - 第 3 页

SkillsMP 已收集 cas-bigdatalab/piflow 中的 203 个 Skill。打开任一 Skill 可查看来源和详情。

cas-bigdatalab/piflow

已展示 40 / 203 个已收集 Skill。

职业分类
软件开发工程师
描述

图像文本匹配过滤器。过滤器将图像和文本之间的匹配分数保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本匹配过滤、图片文字匹配度、文图匹配检测、图像文本相关性过滤等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

图像文本相似度过滤器。过滤器将图像和文本之间的相似性保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本相似度过滤、图片文字相似度、文图相似度检测、图文相关性过滤等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

图像水印过滤器。过滤器以保持其图像没有水印的样本具有高概率。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像水印检测、图片无水印过滤、水印去除、检测图片水印等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

7z 压缩包解压工具。递归扫描目录内 .7z 文件及分卷(.7z.001 等),解压并输出解压清单。依赖 py7zr 库。不负责 zip、rar 等其他格式的解压。

更新
职业分类
软件开发工程师
描述

7z 压缩包内容预览工具。递归扫描目录内 .7z 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 7z 预览、7z 压缩包内容查看、7z 文件清单等需求时使用此 skill。 即使用户没有明确说出"7z 预览",只要任务涉及在解压前先查看 7z 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、rar、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。

更新
职业分类
软件开发工程师
描述

RAR 压缩包解压工具。递归扫描目录内 .rar 文件及分卷(.part1.rar/.part2.rar 等),解压并输出解压清单。依赖 rarfile 库及系统 unrar 工具。不负责 zip、7z 等其他格式的解压。

更新
职业分类
软件开发工程师
描述

RAR 压缩包内容预览工具。递归扫描目录内 .rar 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 rar 预览、rar 压缩包内容查看、rar 文件清单等需求时使用此 skill。 即使用户没有明确说出"rar 预览",只要任务涉及在解压前先查看 rar 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、7z、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。

更新
职业分类
软件开发工程师
描述

TAR 压缩包解压工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,解压并输出解压清单。不负责 zip、7z、rar 等其他格式的解压。

更新
职业分类
软件开发工程师
描述

TAR 压缩包内容预览工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 tar 预览、tar.gz 预览、tar 压缩包内容查看、tar 文件清单等需求时使用此 skill。 即使用户没有明确说出"tar 预览",只要任务涉及在解压前先查看 tar 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、7z、rar 等其他压缩格式的预览(各有独立…

更新
职业分类
软件开发工程师
描述

ZIP 压缩包解压工具。递归扫描目录内 .zip 文件及分卷(.z01/.z02 等),合并分卷后解压并输出解压清单。当用户需要批量解压 zip 或分卷 zip 时使用此 skill。不负责 7z、rar 等其他格式的解压。

更新
职业分类
软件开发工程师
描述

ZIP 压缩包内容预览工具。递归扫描目录内 .zip 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 zip 预览、压缩包内容查看、zip 文件清单、压缩包预检等需求时使用此 skill。 即使用户没有明确说出"zip 预览",只要任务涉及在解压前先查看 zip 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 7z、rar、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。

更新
职业分类
软件开发工程师
描述

不可见字符清洗工具。移除零宽空格、BOM、软连字符、双向文本控制符、C0控制字符等 63 个码点 的不可见/干扰字符。当用户提到不可见字符、零宽空格、BOM 清除、控制字符清洗等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

根据给定键中的值将样本分组为批处理样本。当用户提到样本分组、按键值分组、批处理样本、按键聚合、分组聚合等需求时使用此skill。 即使用户没有明确说出"分组",只要任务涉及将多个样本按某个字段/键的值进行归类合并,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

关键词提取标注工具。读取包含文本字段的表格或JSONL语料,为每条记录提取核心关键词并写入新增关键词字段。 当用户提到关键词提取、关键词抽取、文本关键词、标签提取等需求时使用此skill。 即使用户没有明确说出"keyword_extractor",只要任务涉及从文本内容中提取重要词汇或短语作为标签,就应该使用此skill。 不负责按预置领域关键词库做相关性筛选、文本清洗、分词结果展开或章节切分。

更新
职业分类
软件开发工程师
描述

语种过滤工具。对指定或全部文本列进行语言检测,可选择保留或剔除目标语种, 输出过滤后的数据并附带 detected_lang 列。

更新
职业分类
软件开发工程师
描述

语言识别分数过滤器。过滤器以保留置信度得分大于特定最小值的特定语言的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到语言识别过滤、语言检测、文本语言筛选、按语言过滤等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

本地格式化器。类用于从本地文件或本地目录加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载本地数据集、读取本地文件、格式化本地数据、数据集加载等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

低信息量过滤工具。读取结构化数据文件,对指定文本列同时校验字符总数与行数是否落在阈值区间内,输出过滤后的合规行。 当用户提到低信息量过滤、字符数筛选、短文本过滤、超长文本过滤、行数过滤、信息量阈值等需求时使用此skill。 即使用户没有明确说出"低信息量",只要任务涉及同时按字符数和行数两个维度过滤文本行,就应该使用此skill。 不负责按单词数过滤(用words_num_filter)、按token数过滤(用token_num_filter)、按最长单行长度过滤(用maximum_line_length_filt…

更新
职业分类
软件开发工程师
描述

Markdown标记清除工具。读取Markdown文件,去除Markdown语法标记(标题#、加粗**、斜体*、链接[]()、代码块```、引用>、列表标记等),输出纯文本文件。 当用户提到Markdown清洗、去除MD标记、MD转纯文本等需求时使用此skill。 适用于Markdown文件的语法净化,不负责CSV/表格数据的结构清洗。

更新
职业分类
软件开发工程师
描述

最大行长度过滤器。过滤器将最大行长度的样本保持在特定范围内。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到最大行长度过滤、文本行长筛选、最长行过滤、按行长度过滤等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

元标签聚合工具。合并意思相近的元标签,将多个相似标签归类到统一的标签下。 当用户提到标签聚合、合并标签、归类标签、标签映射、标签合并、整理标签等需求时使用此skill。 即使用户没有明确说出"聚合"或"合并",只要任务涉及将多个相似标签归类统一, 就应该使用此skill。

更新
职业分类
软件开发工程师
描述

MinerU文件解析算子。通过远程调用MinerU接口,解析本地文件(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。

更新
职业分类
软件开发工程师
描述

MinerU URL解析算子。通过远程调用MinerU接口,解析在线文档URL(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。

更新
职业分类
软件开发工程师
描述

缺失值删除工具。读取结构化表格或 JSONL 数据,删除包含缺失值的行或删除缺失比例过高的列;不负责缺失值填充。 当用户提到删除缺失值、删除空值行、删除空值列等需求时使用此skill。 适用于科研表格和结构化数据的缺失清理,不负责插值、补值、均值填充或其他修复操作。

更新
职业分类
软件开发工程师
描述

混合格式化器。该类通过从每个数据集中随机选择样本并合并它们来混合多个数据集,然后将合并的数据集导出为新的混合数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到混合数据集、合并多个数据集、数据集混合、数据融合等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

乱码修复工具。自动检测并修复因编码错误解释导致的乱码文本(Mojibake),支持 GBK/UTF-8、Latin-1/UTF-8、 Big5、Shift_JIS 等 11 种编码链自动尝试,通过字符合理度评分自动选择最佳修复结果。 当用户提到乱码修复、编码修复、mojibake、文字乱码、编码错误等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

最相关实体聚合工具。从文档中提取与给定实体最相关的指定类型实体,并按重要性排序。 当用户提到提取相关人物、查找相关实体、排序实体、分析实体关系、提取主要角色等需求时使用此skill。 即使用户没有明确说出"最相关实体",只要任务涉及从文档中分析并提取与目标相关的实体, 就应该使用此skill。

更新
职业分类
软件开发工程师
描述

将所有样本分组为一批样品。当用户提到样本合并、合并所有样本、一批分组、全部聚合等需求时使用此skill。 即使用户没有明确说出"合并",只要任务涉及将多个样本合并为单个批次,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

将批处理的样本拆分为独立样本。当用户提到样本拆分、拆分批次、批处理展开、反向分组等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将批处理数据(字段值为数组)展开为独立样本,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

嵌套聚合工具。将多个文档碎片整合成一个连贯的文档总结。 当用户提到文档摘要、整合文档、文档聚合、碎片整合、长文总结等需求时使用此skill。 即使用户没有明确说出"嵌套"或"聚合",只要任务涉及将多个短文档整合成一个总结, 就应该使用此skill。

更新
职业分类
软件开发工程师
描述

无用数字字符清理工具。读取结构化文本数据,对指定或全部文本字段移除无语义的独立数字字符,输出清理后的结构化文件。 当用户提到无用数字字符清理、数字噪声删除、文本中的杂散数字清理等需求时使用此skill。 即使用户没有明确说出"number_noise_cleaner",只要任务涉及从文本中删除无业务意义的数字字符,就应该使用此skill。 不负责数值规整、字段校验或通用正则替换。

更新
职业分类
数据科学家
描述

字段分布校验工具。读取结构化数据文件(CSV、TSV、Excel等),按模式检查数值字段统计特征或分类字段频率分布是否合理。 数值模式用于检查均值、标准差、中位数、分位数等统计量;分类模式用于检查类别数上限和单类占比是否异常。 当用户提到分布校验、统计特征验证、类别频率检查、类别倾斜检测等需求时使用此skill。 即使用户没有明确说出"分布校验",只要任务涉及验证字段整体分布是否偏移或失衡,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

数值格式清洗工具。读取 JSONL 结构化数据,按字段规则统一单位、数值格式、范围和空值表达,输出规整后的 JSONL 和统计文件。 当用户提到数值格式化、单位统一、千分位、科学计数法、空值填充、数值规整等需求时使用此skill。 即使用户没有明确说出"数值格式清洗",只要任务涉及按字段规则整理数值表达,就应该使用此skill。 不负责文本去重、标点清洗、字段校验或非数值内容整理。

更新
职业分类
软件开发工程师
描述

淤地坝候选叠加筛选算子。用户提到淤地坝识别、坝体候选筛选、叠加过滤时优先调用。

更新
职业分类
软件开发工程师
描述

Parquet格式化器。用于加载和格式化parquet类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到Parquet格式化、Parquet数据加载、读取Parquet文件、Parquet转JSONL等需求时使用此skill。

更新
职业分类
桌面出版专家
描述

从零创建PDF文件工具。使用reportlab库生成专业PDF文档,支持自定义页面大小、标题、作者、 以及通过JSON配置内容结构(标题、段落、表格等)。当用户需要生成PDF报告、文档时使用此skill。

更新
职业分类
桌面出版专家
描述

裁剪PDF页面边距。通过指定边界坐标(left,bottom,right,top)来裁剪页面区域。当用户需要裁剪PDF页面时使用此skill。

更新
职业分类
桌面出版专家
描述

将多个PDF文件合并为一个PDF文件。当用户需要合并PDF文档时使用此skill。

更新
职业分类
桌面出版专家
描述

提取 PDF 文件元数据并输出 JSON 结果。 当用户提到把这次流程沉淀成 skill、保存为 skill等需求时使用此 skill。

更新
职业分类
桌面出版专家
描述

提取PDF文件的元数据(标题、作者、主题、页数等),输出为JSON格式。当用户需要查看PDF文档信息时使用此skill。

更新
已展示 40 / 203 个已收集 Skill。