PDF/OCR伪影清洗工具。修复从学术论文PDF提取文本时的常见问题:断行连字符拼接(dehyphenation)、 页码去除、Unicode连字归一化(fi→fi)、页眉页脚去除。 当用户提到PDF文本清洗、OCR伪影处理、断行修复、连字符拼接等需求时使用此skill。
原文の言語: 中国語
メニュー
このリポジトリの skills
SkillsMP は cas-bigdatalab/piflow から 203 件の skill を収集しています。skill を開くとソースと詳細を確認できます。
cas-bigdatalab/piflow収集済み skill 203 件中 40 件を表示しています。
PDF/OCR伪影清洗工具。修复从学术论文PDF提取文本时的常见问题:断行连字符拼接(dehyphenation)、 页码去除、Unicode连字归一化(fi→fi)、页眉页脚去除。 当用户提到PDF文本清洗、OCR伪影处理、断行修复、连字符拼接等需求时使用此skill。
原文の言語: 中国語
旋转PDF页面方向。支持顺时针90度、180度、270度旋转。当用户需要旋转PDF页面方向时使用此skill。
原文の言語: 中国語
将PDF按指定页码范围拆分为独立的PDF文件。当用户需要拆分PDF文档时使用此skill。
原文の言語: 中国語
从PDF文件中提取表格数据,输出为JSON格式。当用户需要从PDF中提取表格时使用此skill。
原文の言語: 中国語
从PDF文件中提取文本内容,保存为txt文件。当用户需要从PDF中提取文字时使用此skill。
原文の言語: 中国語
困惑度过滤器。过滤以保留困惑度分数小于特定最大值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到困惑度过滤、文本困惑度检测、语言模型分数过滤、文本质量过滤等需求时使用此skill。
原文の言語: 中国語
添加单调递增ID工具。读取结构化数据文件,检查是否存在指定的ID字段(默认为ID0000), 如果不存在则添加从1开始的单调递增ID字段,并将其放在第一列,最后输出为相同格式的文件。 当用户提到添加ID、添加自增ID、添加序号、添加行号等需求时使用此skill。 即使用户没有明确说出"添加ID",只要任务涉及给数据添加自增ID,就应该使用此skill。
原文の言語: 中国語
数据排序工具。读取结构化数据文件,根据指定字段进行升序或降序排序,最后输出为相同格式的文件。 当用户提到数据排序、升序排列、降序排列、按某字段排序等需求时使用此skill。 即使用户没有明确说出"排序",只要任务涉及对数据进行排序,就应该使用此skill。
原文の言語: 中国語
将用户输入的整数加10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
原文の言語: 中国語
将用户输入的整数减去5并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
原文の言語: 中国語
将用户输入的数字乘以10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
原文の言語: 中国語
隐私标识移除工具。读取结构化文本数据,按用户选择的类别删除或替换邮箱、IPv4 地址、电话号码等文本中的隐私标识。 当用户提到移除邮箱、清洗 IP、替换电话、从文本里剔除隐私 token 等需求时使用此 skill。 它只处理文本中的 token 清理,不做字段级遮蔽,也不负责图片脱敏、音频脱敏、结构化字段加密或假数据生成。
原文の言語: 中国語
文本标点规范化工具。只处理标点本身:合并重复标点、统一中英文标点与引号样式、规范省略号和标点周围空格。 当用户提到标点规范化、标点清理、合并重复标点、全半角转换等需求时使用此skill。 适用于科研文本中标点混乱、重复符号过多的场景,不负责 HTML、表情、数字或拼写清理。
原文の言語: 中国語
时间一致性检查工具。读取被检验表,按时间序列检查数据的时间一致性, 判断相邻时间点的数据变化是否在合理范围内,识别并标记异常数据,最后输出为相同格式的文件。 当用户提到时间一致性检查、时间序列校验、数据变化检查、时序一致性等需求时使用此skill。 即使用户没有说出"时间一致性",只要任务涉及检查数据的时间序列一致性,就应该使用此skill。
原文の言語: 中国語
字段空值检查工具。读取被检验表,检查指定字段是否存在空值(NULL/NA), 识别并标记存在空值的数据点,最后输出为相同格式的文件。 当用户提到空值检查、字段空值校验、缺失值检查、NULL值检查等需求时使用此skill。 即使用户没有说出"空值检查",只要任务涉及检查数据字段是否为空,就应该使用此skill。
原文の言語: 中国語
特定字段恒定下的其他字段不一致检查工具。读取被检验表,当某些字段(恒定字段)的值相同时, 检查其他指定字段(差异字段)是否存在多个不同的值,如果存在则标记为异常数据,最后输出为相同格式的文件。 当用户提到恒定字段检查、字段一致性检查、分组内差异检查等需求时使用此skill。 即使用户没有说出"恒定字段",只要任务涉及检查分组内字段是否存在不一致,就应该使用此skill。
原文の言語: 中国語
等值检验(连续数值无变化检查)工具。读取时间序列数据,检查在连续的时间段内, 某个关键指标的数值是否长时间保持不变(久无变化检查),识别并标记异常数据,最后输出为相同格式的文件。 当用户提到等值检验、连续无变化检查、久无变化检查、时间序列恒定值检查等需求时使用此skill。 即使用户没有说出"等值检验",只要任务涉及检查时间序列数据是否长时间保持不变,就应该使用此skill。
原文の言語: 中国語
尖峰检验(连续剧烈变化检测)工具。读取时间序列数据,识别在连续N次的相邻读数之间的差值(变化量)的绝对值都高于预设阈值的异常数据,最后输出为相同格式的文件。 当用户提到尖峰检验、连续剧烈变化检测、峰值检测、时间序列突变检查等需求时使用此skill。 即使用户没有说出"尖峰检验",只要任务涉及检查时间序列数据的剧烈变化,就应该使用此skill。
原文の言語: 中国語
最大变化范围检验工具。读取时间序列数据,检查在特定时间窗口内,数据是否出现了异常剧烈波动, 即在任意两个读数之间,其差值(变化量)的绝对值超出了预设的容忍阈值,识别并标记异常数据,最后输出为相同格式的文件。 当用户提到最大变化范围检验、变化范围检验、时间序列波动检验、窗口变化检测等需求时使用此skill。 即使用户没有说出"最大变化范围",只要任务涉及检查时间序列数据在时间窗口内的变化幅度是否异常,就应该使用此skill。
原文の言語: 中国語
数据时序完整性检查工具。读取时间序列数据,设定数据记录频率(如每2分钟、30分钟或60分钟), 以此频率为基准遍历数据的时间范围,检查数据时序是否完整,发现缺失与多余数据点,最后输出为相同格式的文件。 当用户提到时序完整性检查、时间序列缺失检查、时间点完整性、数据遗漏检验等需求时使用此skill。 即使用户没有说出"时序完整性",只要任务涉及检查时间序列数据是否有遗漏或多余的时间点,就应该使用此skill。
原文の言語: 中国語
公共基础项枚举校验工具。读取被检验表和标准词典文件,将被检验表中的属性项值与标准词典进行比对, 检查是否超出词典规定的固有词表枚举值范围,超出范围的记录会标记质控标识并输出异常数据。 当用户提到枚举校验、枚举值检查、属性项校验、词表校验等需求时使用此skill。 即使用户没有明确说出"枚举校验",只要任务涉及将被检验数据与标准词典进行比对,就应该使用此skill。
原文の言語: 中国語
数值数据阈值检验工具。读取结构化数据文件(CSV、TSV、Excel等),检查数值字段是否在指定的门限范围内,不允许超出门限值之外,最后输出为同格式的文件。当用户需要对数据进行阈值检验、数值范围检查、数据质量控制等操作时使用此skill。
原文の言語: 中国語
数值关联规则校验工具。读取被检验表,根据用户自定义的条件表达式(类似Hive SQL规则)进行数据校验, 具有关联关系的数据项需满足特定约束条件。不满足条件的数据会标记质控标识并输出异常数据。 当用户提到关联规则校验、数据约束校验、自定义规则校验、条件表达式校验等需求时使用此skill。 即使用户没有说出"关联规则",只要任务涉及根据自定义条件表达式进行数据校验,就应该使用此skill。
原文の言語: 中国語
批量阈值检验工具。读取被检验表和阈值表,将数据列的值与阈值表中定义的上下限进行比对, 识别并标记超出允许范围(包括上限和下限)或为空值的数据点,最后输出为相同格式的文件。 当用户提到批量阈值检验、阈值表校验、多字段阈值检查、范围校验等需求时使用此skill。 即使用户没有明确说出"批量阈值",只要任务涉及根据阈值表进行多字段范围校验,就应该使用此skill。
原文の言語: 中国語
单字段多条件阈值检验工具。读取被检验表和阈值表,将指定字段的属性项值与阈值表中定义的多条件门限进行比对, 检查是否在门限范围内,不允许超出门限值(包括上限和下限)。不满足条件的数据会标记质控标识并输出异常数据。 当用户提到单字段阈值检验、多条件阈值检验、单字段多条件检查等需求时使用此skill。 即使用户没有说出"单字段多条件",只要任务涉及根据多个条件进行单字段阈值校验,就应该使用此skill。
原文の言語: 中国語
批量阈值检验-输入框工具。读取被检验表,将数据列的值与输入阈值条件中定义的上下限进行比对, 识别并标记超出允许范围(包括上限和下限)或为空值的数据点,最后输出为相同格式的文件。 当用户提到批量阈值检验、输入框阈值检验、多字段阈值检查、范围校验等需求时使用此skill。 即使用户没有明确说出"批量阈值输入框",只要任务涉及根据输入的阈值条件进行批量范围校验,就应该使用此skill。
原文の言語: 中国語
数据类型检查工具。读取被检验表,检查指定数值型字段的数据类型是否正确(是否能转换为数值型), 并标记不合格的数据点,最后输出为相同格式的文件。 当用户提到数据类型检查、数值类型校验、字段类型检查、数据格式校验等需求时使用此skill。 即使用户没有说出"数据类型检查",只要任务涉及检查数据字段类型是否正确,就应该使用此skill。
原文の言語: 中国語
质量标识字段检测工具。检查数据表是否配置质量标识字段,验证标识字段的存在性、值规范性 (是否为预定义合法值)、非空完整性,标记不合格数据。 当用户提到质量标识检查、QC字段检测、标识字段合规等需求时使用此skill。
原文の言語: 中国語
JSONL 随机采样工具。读取 JSONL 数据集,按抽样数量或抽样比例无放回抽取样本,输出保留原字段结构的采样结果。 当用户提到随机采样、按数量抽样、按比例抽样、JSONL 抽样筛查等需求时使用此skill。 即使用户没有明确说出"random_sampler",只要任务涉及对 JSONL 记录做无放回随机抽取,就应该使用此skill。 不负责分层采样、领域均衡采样、表格采样或其他格式转换。
原文の言語: 中国語
从CSV数据集中随机抽取样本。支持按比例(0-1)或固定数量抽取,当两者同时提供时取较小值。
原文の言語: 中国語
Ray分布式文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本,基于Ray分布式框架。 当用户提到文档去重、删除重复文档、样本去重、分布式去重、大规模数据去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模文档去重处理, 就应该使用此skill。
原文の言語: 中国語
Ray分布式图像去重工具。使用图像哈希精确匹配在文档级别删除重复样本,基于Ray分布式框架。 当用户提到图像去重、删除重复图片、分布式去重、大规模图像去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模图像去重处理, 就应该使用此skill。
原文の言語: 中国語
Ray分布式视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频,基于Ray分布式框架。 当用户提到视频去重、删除重复视频、分布式去重、大规模视频去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模视频去重处理, 就应该使用此skill。
原文の言語: 中国語
add all numbers in a text file by 10 and save to a new file. Use when user mentions read a file add numbers by 10, process number file, batch calculation.
原文の言語: 英語
Minus all numbers in a text file by 5 and save to a new file. Use when user mentions read a file minus numbers by 15, process number file, batch calculation.
原文の言語: 英語
Multiply all numbers in a text file by 10 and save to a new file. Use when user mentions multiply numbers by 10, process number file, batch calculation.
原文の言語: 英語
引用完整性校验工具。读取子表及参考表,检查外键值是否存在于参考键集合中,标记孤立记录行并输出结果文件。 当用户提到外键检查、引用完整性、孤立记录、父子表引用等需求时使用此skill。 即使用户没有明确说出“引用完整性”,只要任务涉及检查字段值是否能在参考表中找到,就应该使用此skill。 不负责重复行、空值、列存在性、字段格式等其他校验任务。
原文の言語: 中国語
远程格式化器。用于从huggingface hub的存储库加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载HuggingFace数据集、远程数据集加载、HuggingFace Hub等需求时使用此skill。
原文の言語: 中国語
分析结果落盘算子。用户提到结果保存、导出CSV、结果存储时调用。
原文の言語: 中国語
显式 schema 校验工具。读取结构化数据与用户提供的 schema,检查字段存在性、字段类型、枚举、范围、长度、正则格式、日期格式、表级行数与缺失率约束,并输出校验报告。 当用户提到 schema 校验、结构校验、模式校验、字段存在性检查、字段类型检查、枚举校验、范围校验、格式校验、表头结构校验等需求时使用此 skill。 即使用户没有明确说出"schema_validator",只要任务是在检查结构化数据是否符合明确 schema 规则,就应该使用此 skill。…
原文の言語: 中国語