Skip to main content

这个仓库中的 skills

cas-bigdatalab/piflow - 第 2 页

SkillsMP 已收集 cas-bigdatalab/piflow 中的 203 个 Skill。打开任一 Skill 可查看来源和详情。

cas-bigdatalab/piflow

已展示 40 / 203 个已收集 Skill。

职业分类
软件开发工程师
描述

数据纵向拼接工具。读取多个具有相同列结构的结构化数据文件,执行按行纵向追加合并(concat),输出单一合并文件。 当用户提到数据拼接、纵向合并、行合并、数据追加、文件合并等需求时使用此skill。 即使用户没有明确说出"拼接",只要任务涉及将多个同构数据文件上下合并为一个,就应该使用此skill。 不负责横向关联(join/merge on key)、字段级合并或非结构化文档聚合。如需按键值关联请使用其他skill。

更新
职业分类
软件开发工程师
描述

数据横向关联工具。读取多个结构化数据文件,按指定键进行横向关联(JOIN),输出关联后的合并文件。 当用户提到数据关联、表连接、横向合并、键合并、JOIN等需求时使用此skill。 即使用户没有明确说出"关联",只要任务涉及按某个字段将多个表的数据关联在一起,就应该使用此skill。 不负责数据纵向拼接(concat)、数据去重、或字段值聚合(GROUP BY)。

更新
职业分类
软件开发工程师
描述

数值标准化工具。读取JSONL数据,按指定字段执行Z-score或Min-Max标准化,并保留原始值与变更标记。 当用户提到数值标准化、归一化、字段规整、范围映射等需求时使用此skill。 即使用户没有明确说出"data_normalizer",只要任务涉及对某个数值字段做标准化处理,就应该使用此skill。 不负责四舍五入/小数位统一(见DC3_RoundOff)、文本清洗、类别编码或多字段联合统计分析。

更新
职业分类
软件开发工程师
描述

按字段拆分数据工具。根据指定字段的值将结构化表格拆分为多个文件,每个唯一值对应一个输出文件。 当用户提到数据拆分、按字段分组导出、分类导出、数据分片、按某列值分割文件等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将结构化表格按某字段值分成多个文件,就应该使用此skill。 不负责字段聚合统计、行级过滤或跨表关联合并。

更新
职业分类
软件开发工程师
描述

JSONL比例切分工具。读取JSONL数据集,按给定比例拆成多个子集,支持随机切分和按字段分层切分。 当用户明确提到按比例拆分JSONL、训练集/验证集/测试集切分、分层保持类别分布等需求时使用此skill。 即使用户没有明确说出"切分",只要任务是把一份JSONL按比例分成多个子集,就应该使用此skill。 不负责按固定条数均匀分块,不负责按份数切块,也不负责处理非JSONL输入。

更新
职业分类
软件开发工程师
描述

数据类型转换工具。转换数据字段的类型,支持数值、字符串、日期等类型互转。 当用户提到类型转换、数据格式转换、字段类型修改等需求时使用此skill。 即使用户没有明确说出"类型转换",只要任务涉及改变字段的数据类型,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

空行清洗工具。读取结构化数据文件(CSV、TSV、Excel等),删除所有列为空的行(空行), 然后输出为相同格式的文件。当用户提到空行清洗、清理空行、删除空行、处理空白行、净化数据文件等需求时使用此skill。 即使用户没有明确说出"空行清洗",只要任务涉及读取结构化文件并删除空行,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

字符串空格清理工具。读取结构化数据文件(CSV、TSV、Excel等),检查所有字符串类型(object)字段, 删除字段值前后多余的空格,然后输出为相同格式的文件。当用户提到空格清理、去除空格、trim、清理字符串空格等需求时使用此skill。 即使用户没有明确说出"空格清理",只要任务涉及读取结构化文件并删除字符串字段的前后空格,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

四舍五入数据处理工具。读取结构化数据文件和标准配置文件,根据配置对数字型字段进行四舍五入处理, 然后输出为相同格式的文件。当用户提到四舍五入、数字取整、保留小数位、数据舍入等需求时使用此skill。 即使用户没有明确说出"四舍五入",只要任务涉及根据配置文件对数据进行舍入处理,就应该使用此skill。

更新
职业分类
项目管理专家
描述

Guide users through a structured workflow for co-authoring documentation. Use when user wants to write documentation, proposals, technical specs, decision docs, or similar structured content. This workflow helps users efficiently transfer context, refine…

原文语言:英语

更新
职业分类
数据科学家
描述

文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本。 当用户提到文档去重、删除重复文档、样本去重、文本去重、去除重复内容、 清洗重复数据、整理文档集合等需求时使用此skill。 即使用户没有明确说出"去重",只要任务涉及从多个文档中识别和删除重复内容, 就应该使用此skill。

更新
职业分类
桌面出版专家
描述

将解压的XML目录重新打包为DOCX文件

更新
职业分类
综合办公文员
描述

从DOCX文件中提取文本内容

更新
职业分类
桌面出版专家
描述

将DOCX文档转换为Markdown格式

更新
职业分类
桌面出版专家
描述

将DOCX文件解压为XML目录

更新
职业分类
桌面出版专家
描述

验证DOCX文件格式有效性

更新
职业分类
数据科学家
描述

精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。 当用户提到精确去重、完全重复检测、数据去重等需求时使用此skill。

更新
职业分类
数据科学家
描述

模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。

更新
职业分类
数据科学家
描述

文本内部重复片段模糊清理工具。读取 JSONL 文本数据,按文本字段删除近似重复的段落、句子或连续片段,保留首次出现内容并输出清理后的样本。 当用户提到清理重复片段、删除重复段落、去掉近似重复内容等需求时使用此 skill。 即使用户没有明确说出 "duplicate_fragment_cleaner",只要任务涉及同一文本内部的重复片段清理,就应该使用此 skill。 不负责跨记录去重、摘要改写或语义重写。

更新
职业分类
软件开发工程师
描述

结构化表格重复行检测工具。仅检查CSV/TSV/Excel等表格型数据中的完全重复记录或指定列子集重复, 标记后续重复行并保留首次出现;不处理文本片段清理、文档去重或其他字段质控。

更新
职业分类
软件开发工程师
描述

空数据格式化器。用于创建空数据。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到创建空数据集、生成空数据、初始化数据集、测试用空数据等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

英文文本基础清洗工具。读取英文科研文本,展开常见缩写、修正常见拼写错误并可选规范大小写,输出整理后的 JSONL 数据。 当用户提到英文文本清洗、英文缩写展开、英文拼写纠正、英文文本规整等需求时使用此skill。 适合外文论文、英文实验记录的基础规整,不负责翻译、语法改写或跨语言语义修复。

更新
职业分类
软件开发工程师
描述

多编码文本统一转换工具。读取文本文件或目录,自动识别源编码并转换为目标编码(默认 UTF-8),输出转换后的文件。 当用户提到编码转换、乱码修复、GBK 转 UTF-8、统一文件编码等需求时使用此 skill。 即使用户没有明确说出“编码转换”,只要任务涉及把文本文件转成指定编码,就应该使用此 skill。 不负责非文本二进制文件处理、内容清洗或格式转换。

更新
职业分类
软件开发工程师
描述

实体属性聚合工具。从多个文档中提取并总结给定实体的特定属性信息。 当用户提到从文档中提取实体信息、总结人物属性、聚合实体特征、提取文档中的实体信息、 根据文档总结实体属性(如总结某人物的主要经历、身份背景、成就等)等需求时使用此skill。 即使用户没有明确说出"聚合"或"实体",只要任务涉及从多个文档中提取和总结某个主题/人物/实体的 特定属性,就应该使用此skill。

更新
职业分类
软件开发工程师
描述

敏感词过滤器。过滤文本中包含敏感词/标记词比例超过指定阈值的样本。 当用户提到敏感词过滤、脏词过滤、违禁词过滤、内容审核、敏感词检测等需求时使用此skill。 即使用户没有明确说出"敏感词",只要任务涉及过滤包含特定敏感词的文本内容, 就应该使用此skill。

更新
职业分类
软件开发工程师
描述

接入资源格式识别工具。读取单个文件或目录中的接入资源,识别文本、表格、文档、图像、HTML、数据或未知类型,输出带推荐处理路由的格式识别结果文件。 当用户提到格式识别、资源类型预判、采集入口分流、为文本/表格/文档/图像/HTML 选择后续处理路径等需求时使用此 skill。 即使用户没有明确说出"格式识别",只要任务涉及在采集入口判断文件类型并分配推荐处理路由,就应该使用此 skill。 不负责读取正文内容、提取图像元信息、表格采集、文档解析、格式转换或实际执行后续处理。

更新
职业分类
网页开发工程师
描述

Create distinctive, production-grade frontend interfaces with high design quality. Use this skill when the user asks to build vue-web components, pages, artifacts, posters, or applications (examples include websites, landing pages, dashboards, React…

原文语言:英语

更新
职业分类
软件开发工程师
描述

全角/半角字符规范化工具。读取结构化数据文件,将文本中的全角ASCII字符(字母、数字、标点)转换为半角形式, 并可按需执行指定 Unicode 正规化。适用于中日韩混排科研文本的统一预处理,不负责空白行删除、拼写纠错或重复标点合并。 当用户提到全角转半角、半角规范化、全半角统一、全角字母数字转换等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

几何识别与图像分割结果地理转换算子。用户提到图像分割分析、遥感分割定位、地理坐标映射时优先调用。

更新
职业分类
软件开发工程师
描述

沟道坡度特征计算算子。用户提到沟道坡度、DEM地形坡度预处理、沟道地形分析时优先调用。

更新
职业分类
软件开发工程师
描述

山洪/水文敏感度计算算子。用户提到山洪敏感度、易发性评估、水文风险分析时优先调用。

更新
职业分类
数据科学家
描述

图像美学过滤器。过滤美学评分不在指定范围内的图像样本。 当用户提到图像美学、图像质量过滤、图片评分筛选、图像质量评估、过滤低质量图像等需求时使用此skill。 即使用户没有明确说出"美学评分",只要任务涉及根据图像美学质量来筛选数据, 就应该使用此skill。

更新
职业分类
数据科学家
描述

图像长宽比过滤器。过滤图像长宽比不在指定范围内的样本。 当用户提到图像长宽比、图片比例过滤、图像尺寸筛选、图像宽高比等需求时使用此skill。 即使用户没有明确说出"长宽比",只要任务涉及根据图像宽高比来筛选数据, 就应该使用此skill。

更新
职业分类
数据科学家
描述

图像去重工具。使用图像哈希精确匹配在文档级别删除包含重复图像的样本。 当用户提到图像去重、删除重复图片、图片去重、清理重复图像等需求时使用此skill。 即使用户没有明确说出"图像去重",只要任务涉及从包含图像的数据中删除重复图片, 就应该使用此skill。

更新
职业分类
数据科学家
描述

图像人脸数量过滤器。过滤以保持样本的面数在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、识别人脸、人脸数量检测、图片人脸筛选、按人脸数量过滤等需求时使用此skill。

更新
职业分类
数据科学家
描述

图像人脸面积比例过滤器。过滤以保持面面积比在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、人脸占比、面部面积比例、图片人脸区域筛选、按人脸占比过滤等需求时使用此skill。

更新
职业分类
数据科学家
描述

图像NSFW内容检测过滤器。过滤器保留图像具有低nsfw分数的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图片安全检测、NSFW过滤、不良内容过滤、图片审核、图像内容过滤等需求时使用此skill。

更新
职业分类
数据科学家
描述

图像对相似度过滤器。过滤器将图像之间具有相似性的图像对保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像相似度检测、图像对过滤、双图相似度、图片相似度筛选、图像pair过滤等需求时使用此skill。

更新
职业分类
数据科学家
描述

图像形状过滤器。过滤器保持样品的图像形状 (w,h) 在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像尺寸过滤、图片宽高筛选、图像分辨率过滤、按图片大小过滤、图像形状限制等需求时使用此skill。

更新
职业分类
软件开发工程师
描述

图像文件大小过滤器。保留图像大小 (以字节/KB/MB/... 为单位) 在特定范围内的数据样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文件大小过滤、图片大小筛选、图像尺寸KB/MB过滤、按文件大小过滤等需求时使用此skill。

更新
已展示 40 / 203 个已收集 Skill。