Skip to main content

Skills in this repository

cas-bigdatalab/piflow - Page 2

SkillsMP has collected 203 skills from cas-bigdatalab/piflow. Open a skill to review its source and details.

cas-bigdatalab/piflow

Showing 40 of 203 collected skills.

occupation
Software Developers
description

数据纵向拼接工具。读取多个具有相同列结构的结构化数据文件,执行按行纵向追加合并(concat),输出单一合并文件。 当用户提到数据拼接、纵向合并、行合并、数据追加、文件合并等需求时使用此skill。 即使用户没有明确说出"拼接",只要任务涉及将多个同构数据文件上下合并为一个,就应该使用此skill。 不负责横向关联(join/merge on key)、字段级合并或非结构化文档聚合。如需按键值关联请使用其他skill。

Source text: Chinese

updated
occupation
Software Developers
description

数据横向关联工具。读取多个结构化数据文件,按指定键进行横向关联(JOIN),输出关联后的合并文件。 当用户提到数据关联、表连接、横向合并、键合并、JOIN等需求时使用此skill。 即使用户没有明确说出"关联",只要任务涉及按某个字段将多个表的数据关联在一起,就应该使用此skill。 不负责数据纵向拼接(concat)、数据去重、或字段值聚合(GROUP BY)。

Source text: Chinese

updated
occupation
Software Developers
description

数值标准化工具。读取JSONL数据,按指定字段执行Z-score或Min-Max标准化,并保留原始值与变更标记。 当用户提到数值标准化、归一化、字段规整、范围映射等需求时使用此skill。 即使用户没有明确说出"data_normalizer",只要任务涉及对某个数值字段做标准化处理,就应该使用此skill。 不负责四舍五入/小数位统一(见DC3_RoundOff)、文本清洗、类别编码或多字段联合统计分析。

Source text: Chinese

updated
occupation
Software Developers
description

按字段拆分数据工具。根据指定字段的值将结构化表格拆分为多个文件,每个唯一值对应一个输出文件。 当用户提到数据拆分、按字段分组导出、分类导出、数据分片、按某列值分割文件等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将结构化表格按某字段值分成多个文件,就应该使用此skill。 不负责字段聚合统计、行级过滤或跨表关联合并。

Source text: Chinese

updated
occupation
Software Developers
description

JSONL比例切分工具。读取JSONL数据集,按给定比例拆成多个子集,支持随机切分和按字段分层切分。 当用户明确提到按比例拆分JSONL、训练集/验证集/测试集切分、分层保持类别分布等需求时使用此skill。 即使用户没有明确说出"切分",只要任务是把一份JSONL按比例分成多个子集,就应该使用此skill。 不负责按固定条数均匀分块,不负责按份数切块,也不负责处理非JSONL输入。

Source text: Chinese

updated
occupation
Software Developers
description

数据类型转换工具。转换数据字段的类型,支持数值、字符串、日期等类型互转。 当用户提到类型转换、数据格式转换、字段类型修改等需求时使用此skill。 即使用户没有明确说出"类型转换",只要任务涉及改变字段的数据类型,就应该使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

空行清洗工具。读取结构化数据文件(CSV、TSV、Excel等),删除所有列为空的行(空行), 然后输出为相同格式的文件。当用户提到空行清洗、清理空行、删除空行、处理空白行、净化数据文件等需求时使用此skill。 即使用户没有明确说出"空行清洗",只要任务涉及读取结构化文件并删除空行,就应该使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

字符串空格清理工具。读取结构化数据文件(CSV、TSV、Excel等),检查所有字符串类型(object)字段, 删除字段值前后多余的空格,然后输出为相同格式的文件。当用户提到空格清理、去除空格、trim、清理字符串空格等需求时使用此skill。 即使用户没有明确说出"空格清理",只要任务涉及读取结构化文件并删除字符串字段的前后空格,就应该使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

四舍五入数据处理工具。读取结构化数据文件和标准配置文件,根据配置对数字型字段进行四舍五入处理, 然后输出为相同格式的文件。当用户提到四舍五入、数字取整、保留小数位、数据舍入等需求时使用此skill。 即使用户没有明确说出"四舍五入",只要任务涉及根据配置文件对数据进行舍入处理,就应该使用此skill。

Source text: Chinese

updated
occupation
Project Management Specialists
description

Guide users through a structured workflow for co-authoring documentation. Use when user wants to write documentation, proposals, technical specs, decision docs, or similar structured content. This workflow helps users efficiently transfer context, refine…

updated
occupation
Data Scientists
description

文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本。 当用户提到文档去重、删除重复文档、样本去重、文本去重、去除重复内容、 清洗重复数据、整理文档集合等需求时使用此skill。 即使用户没有明确说出"去重",只要任务涉及从多个文档中识别和删除重复内容, 就应该使用此skill。

Source text: Chinese

updated
occupation
Desktop Publishers
description

将解压的XML目录重新打包为DOCX文件

Source text: Chinese

updated
occupation
Office Clerks, General
description

从DOCX文件中提取文本内容

Source text: Chinese

updated
occupation
Desktop Publishers
description

将DOCX文档转换为Markdown格式

Source text: Chinese

updated
occupation
Desktop Publishers
description

将DOCX文件解压为XML目录

Source text: Chinese

updated
occupation
Desktop Publishers
description

验证DOCX文件格式有效性

Source text: Chinese

updated
occupation
Data Scientists
description

精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。 当用户提到精确去重、完全重复检测、数据去重等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

文本内部重复片段模糊清理工具。读取 JSONL 文本数据,按文本字段删除近似重复的段落、句子或连续片段,保留首次出现内容并输出清理后的样本。 当用户提到清理重复片段、删除重复段落、去掉近似重复内容等需求时使用此 skill。 即使用户没有明确说出 "duplicate_fragment_cleaner",只要任务涉及同一文本内部的重复片段清理,就应该使用此 skill。 不负责跨记录去重、摘要改写或语义重写。

Source text: Chinese

updated
occupation
Software Developers
description

结构化表格重复行检测工具。仅检查CSV/TSV/Excel等表格型数据中的完全重复记录或指定列子集重复, 标记后续重复行并保留首次出现;不处理文本片段清理、文档去重或其他字段质控。

Source text: Chinese

updated
occupation
Software Developers
description

空数据格式化器。用于创建空数据。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到创建空数据集、生成空数据、初始化数据集、测试用空数据等需求时使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

英文文本基础清洗工具。读取英文科研文本,展开常见缩写、修正常见拼写错误并可选规范大小写,输出整理后的 JSONL 数据。 当用户提到英文文本清洗、英文缩写展开、英文拼写纠正、英文文本规整等需求时使用此skill。 适合外文论文、英文实验记录的基础规整,不负责翻译、语法改写或跨语言语义修复。

Source text: Chinese

updated
occupation
Software Developers
description

多编码文本统一转换工具。读取文本文件或目录,自动识别源编码并转换为目标编码(默认 UTF-8),输出转换后的文件。 当用户提到编码转换、乱码修复、GBK 转 UTF-8、统一文件编码等需求时使用此 skill。 即使用户没有明确说出“编码转换”,只要任务涉及把文本文件转成指定编码,就应该使用此 skill。 不负责非文本二进制文件处理、内容清洗或格式转换。

Source text: Chinese

updated
occupation
Software Developers
description

实体属性聚合工具。从多个文档中提取并总结给定实体的特定属性信息。 当用户提到从文档中提取实体信息、总结人物属性、聚合实体特征、提取文档中的实体信息、 根据文档总结实体属性(如总结某人物的主要经历、身份背景、成就等)等需求时使用此skill。 即使用户没有明确说出"聚合"或"实体",只要任务涉及从多个文档中提取和总结某个主题/人物/实体的 特定属性,就应该使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

敏感词过滤器。过滤文本中包含敏感词/标记词比例超过指定阈值的样本。 当用户提到敏感词过滤、脏词过滤、违禁词过滤、内容审核、敏感词检测等需求时使用此skill。 即使用户没有明确说出"敏感词",只要任务涉及过滤包含特定敏感词的文本内容, 就应该使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

接入资源格式识别工具。读取单个文件或目录中的接入资源,识别文本、表格、文档、图像、HTML、数据或未知类型,输出带推荐处理路由的格式识别结果文件。 当用户提到格式识别、资源类型预判、采集入口分流、为文本/表格/文档/图像/HTML 选择后续处理路径等需求时使用此 skill。 即使用户没有明确说出"格式识别",只要任务涉及在采集入口判断文件类型并分配推荐处理路由,就应该使用此 skill。 不负责读取正文内容、提取图像元信息、表格采集、文档解析、格式转换或实际执行后续处理。

Source text: Chinese

updated
occupation
Web Developers
description

Create distinctive, production-grade frontend interfaces with high design quality. Use this skill when the user asks to build vue-web components, pages, artifacts, posters, or applications (examples include websites, landing pages, dashboards, React…

updated
occupation
Software Developers
description

全角/半角字符规范化工具。读取结构化数据文件,将文本中的全角ASCII字符(字母、数字、标点)转换为半角形式, 并可按需执行指定 Unicode 正规化。适用于中日韩混排科研文本的统一预处理,不负责空白行删除、拼写纠错或重复标点合并。 当用户提到全角转半角、半角规范化、全半角统一、全角字母数字转换等需求时使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

几何识别与图像分割结果地理转换算子。用户提到图像分割分析、遥感分割定位、地理坐标映射时优先调用。

Source text: Chinese

updated
occupation
Software Developers
description

沟道坡度特征计算算子。用户提到沟道坡度、DEM地形坡度预处理、沟道地形分析时优先调用。

Source text: Chinese

updated
occupation
Software Developers
description

山洪/水文敏感度计算算子。用户提到山洪敏感度、易发性评估、水文风险分析时优先调用。

Source text: Chinese

updated
occupation
Data Scientists
description

图像美学过滤器。过滤美学评分不在指定范围内的图像样本。 当用户提到图像美学、图像质量过滤、图片评分筛选、图像质量评估、过滤低质量图像等需求时使用此skill。 即使用户没有明确说出"美学评分",只要任务涉及根据图像美学质量来筛选数据, 就应该使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像长宽比过滤器。过滤图像长宽比不在指定范围内的样本。 当用户提到图像长宽比、图片比例过滤、图像尺寸筛选、图像宽高比等需求时使用此skill。 即使用户没有明确说出"长宽比",只要任务涉及根据图像宽高比来筛选数据, 就应该使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像去重工具。使用图像哈希精确匹配在文档级别删除包含重复图像的样本。 当用户提到图像去重、删除重复图片、图片去重、清理重复图像等需求时使用此skill。 即使用户没有明确说出"图像去重",只要任务涉及从包含图像的数据中删除重复图片, 就应该使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像人脸数量过滤器。过滤以保持样本的面数在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、识别人脸、人脸数量检测、图片人脸筛选、按人脸数量过滤等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像人脸面积比例过滤器。过滤以保持面面积比在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、人脸占比、面部面积比例、图片人脸区域筛选、按人脸占比过滤等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像NSFW内容检测过滤器。过滤器保留图像具有低nsfw分数的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图片安全检测、NSFW过滤、不良内容过滤、图片审核、图像内容过滤等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像对相似度过滤器。过滤器将图像之间具有相似性的图像对保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像相似度检测、图像对过滤、双图相似度、图片相似度筛选、图像pair过滤等需求时使用此skill。

Source text: Chinese

updated
occupation
Data Scientists
description

图像形状过滤器。过滤器保持样品的图像形状 (w,h) 在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像尺寸过滤、图片宽高筛选、图像分辨率过滤、按图片大小过滤、图像形状限制等需求时使用此skill。

Source text: Chinese

updated
occupation
Software Developers
description

图像文件大小过滤器。保留图像大小 (以字节/KB/MB/... 为单位) 在特定范围内的数据样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文件大小过滤、图片大小筛选、图像尺寸KB/MB过滤、按文件大小过滤等需求时使用此skill。

Source text: Chinese

updated
Showing 40 of 203 collected skills.