科学公式/化学式规整 Skill:统一文本列中的数学符号、Unicode 上下标、化学反应箭头、全角 ASCII 和多余空格。 适用于实验记录、论文摘录、化学反应式和科学公式文本;不负责公式语义解析、单位换算或化学配平。
Idioma del texto original: chino
Menú
Skills en este repositorio
SkillsMP ha recopilado 203 skills de cas-bigdatalab/piflow. Abre una skill para revisar su origen y sus detalles.
cas-bigdatalab/piflowMostrando 40 de 203 skills recopiladas.
科学公式/化学式规整 Skill:统一文本列中的数学符号、Unicode 上下标、化学反应箭头、全角 ASCII 和多余空格。 适用于实验记录、论文摘录、化学反应式和科学公式文本;不负责公式语义解析、单位换算或化学配平。
Idioma del texto original: chino
用于识别海洋生物的技能。当用户希望识别海洋生物、上传图片识别图中海洋生物等情况时触发。
Idioma del texto original: chino
Knowledge and utilities for creating animated GIFs optimized for Slack. Provides constraints, validation tools, and animation concepts. Use when users request animated GIFs for Slack like "make me a GIF of X doing Y for Slack."
Idioma del texto original: inglés
智能引号/排版字符规范化工具。将弯引号、长破折号、省略号等排版字符转为标准 ASCII 形式, 适配 Word/PDF/网页文本的后处理清洗。当用户提到智能引号、弯引号转直引号、排版字符规范化、 长破折号等需求时使用此skill。
Idioma del texto original: chino
特殊字符过滤器。过滤器将具有特殊字符比率的样品保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到特殊字符过滤、特殊字符比例过滤、文本特殊字符检测、清理乱码文本等需求时使用此skill。
Idioma del texto original: chino
指定字段过滤器。根据指定的字段信息进行筛选。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到字段过滤、字段值筛选、元数据过滤、指定字段过滤、按字段值过滤等需求时使用此skill。
Idioma del texto original: chino
指定数值字段过滤器。根据指定的数值字段信息进行筛选。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到数值字段过滤、字段范围筛选、数值范围过滤、元数据数值过滤、按数值过滤等需求时使用此skill。
Idioma del texto original: chino
拼写变体标准化工具。统一英美拼写差异(colour→color、analyse→analyze 等),内置 153 词条 (含屈折形式 covered/covering 等),支持自定义词典扩展。当用户提到英美拼写统一、拼写变体、 British/American spelling 等需求时使用此skill。
Idioma del texto original: chino
'堆叠符号清洗工具。去除纯符号装饰行/分隔线(====、****、
Idioma del texto original: chino
统计与机器学习异常值检测工具。读取结构化表格数据,使用 IQR、Z-score、IsolationForest 或分组标准差一致性方法识别异常值,输出带异常标记、删除异常行或裁剪异常值后的结果文件。 当用户提到异常值检测、离群值识别、IQR、Z-score、IsolationForest、按实验组/分类组检查数值一致性等需求时使用此skill。 即使用户没有明确说出“statistical_outlier_detector”,只要任务涉及结构化数值字段异常识别或分组均值标准差一致性检查,就应该使用此skill。…
Idioma del texto original: chino
停用词过滤器。过滤以保持停止词比率大于特定最小值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到停用词过滤、停用词比例过滤、文本质量过滤、停用词占比检测等需求时使用此skill。
Idioma del texto original: chino
结构化数据分层采样工具。读取 JSONL、JSON、CSV、TSV、XLSX、XLS 等结构化数据,按指定字段分层后无放回抽取样本,输出保留原字段结构的采样结果。 当用户提到分层采样、类别平衡采样、按标签抽样、训练集分层划分等需求时使用此skill。 即使用户没有明确说出"stratified_sampler",只要任务涉及按字段分层并进行代表性抽样,就应该使用此skill。 不负责随机采样、领域均衡采样、批量切分、时间窗口抽样或格式转换。
Idioma del texto original: chino
后缀过滤器。过滤器以保留具有指定后缀的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到后缀过滤、文件类型过滤、按文件后缀筛选等需求时使用此skill。
Idioma del texto original: chino
系统采样算子。按照固定间隔从数据中进行系统采样,适用于时间序列数据或需要均匀分布样本的场景。 当用户提到系统采样、等距抽样、按间隔取样、均匀抽样等需求时使用此skill。 即使用户没有明确说出"系统采样",只要任务涉及从有序数据中按固定步长抽取样本,就应该使用此skill。 不负责分层采样或随机采样。
Idioma del texto original: chino
Tab/空格规范化工具。读取结构化数据文件,执行制表符展开、行尾空格清理与可选公共缩进去除,输出空白已统一的结构化数据文件。 当用户提到Tab转空格、制表符转空格、缩进规范化、行尾空格清除、公共缩进去除等需求时使用此skill。 即使用户没有明确说出"tab_space_normalizer",只要任务涉及文本中的Tab/空格归一,就应该使用此skill。 不负责文本内容改写、拼写纠错、重复标点合并或其他非空白字符清理。
Idioma del texto original: chino
表格文件采集工具。读取单个表格文件或目录中的 csv、tsv、xlsx、xls 文件,执行行记录采集,输出统一结构化表格记录文件。 当用户提到表格采集、读取科研数据表、汇总 CSV/TSV/Excel 表格、把本地表格文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"表格采集",只要任务涉及把本地结构化表格文件内容收集成统一记录,就应该使用此 skill。 不负责表格清洗、空行删除、字段去空格、格式校验、字段过滤或格式转换。
Idioma del texto original: chino
格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。
Idioma del texto original: chino
文本动作词过滤器。过滤以保留文本中包含操作的文本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到动作词过滤、动词检测、文本动作过滤、文本操作词过滤等需求时使用此skill。
Idioma del texto original: chino
纯文本文件采集工具。读取单个文本文件或目录中的 txt、md、rst、log、text 文件,执行文件正文采集,输出结构化文本记录文件。 当用户提到文本文件采集、读取纯文本语料、汇总 Markdown/RST/日志文本、把本地文本文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"文本采集",只要任务涉及把本地纯文本文件内容收集成统一记录,就应该使用此 skill。 不负责文档解析、图片解析、表格读取、文本清洗或质量过滤。
Idioma del texto original: chino
文本实体依赖过滤器。识别文本中与其他令牌独立的实体,并对其进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到实体依赖过滤、文本实体检测、依存关系过滤、实体独立性过滤等需求时使用此skill。
Idioma del texto original: chino
指定文本片段删除工具。读取结构化数据中的文本字段,删除用户显式给出的固定片段并保留其他字段不变。 当用户提到删除固定词、固定占位符、固定水印短语、固定噪声片段等需求时使用此skill。 即使用户没有明确说出 skill 名,只要任务是按明确片段从文本字段中移除内容,就应该使用此skill。 不负责按类别自动识别 HTML、URL、emoji、数字、标点、控制字符等内容,这些应交给专用清洗 skill。
Idioma del texto original: chino
文本对相似度过滤器。过滤器将文本之间具有相似性的文本对保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到文本对相似度过滤、文本对过滤、双文本相似度、文本配对过滤等需求时使用此skill。
Idioma del texto original: chino
长文本规则切分工具。将超长文本按照段落、句子、固定字符长度、非空行或科研论文章节标题进行自动切分,生成粒度均匀的短文本片段。 当用户提到文本切分、长文本拆分、按段落分割、按句子分割、文本分块、论文章节切分等需求时使用此skill。 适用于科研论文、实验综述、长篇文稿等资料的粒度拆分需求。 不负责采样、清洗、格式转换或PDF解析。
Idioma del texto original: chino
时序/数值异常标记工具。对指定或全部数值列进行 Z-Score 异常和差分突变检测, 输出 anomaly_flag 与 anomaly_reasons,不删除数据,适用于时序稳态/突变异常识别。
Idioma del texto original: chino
时间/货币归一工具。读取结构化文本数据,将常见日期格式统一为YYYY-MM-DD,将$、€、¥/¥前缀金额转换为USD/EUR/CNY数值表达。 当用户提到统一日期格式、标准化货币金额、清洗时间表述等需求时使用此skill。 即使用户没有明确说出skill名,只要任务涉及日期或货币符号的归一化,就应该使用此skill。 不负责汇率换算、时区转换或非前缀货币单位解析。
Idioma del texto original: chino
时序平缓性检测工具。检测时序数据是否符合渐变规律,包括突变跳点检测(相邻点变化超阈值) 和方向振荡检测(窗口内反复升降),对应功能说明(八)模块中的平缓性检测维度。 当用户提到时序平缓性、渐变规律、突变跳点、方向振荡等需求时使用此skill。
Idioma del texto original: chino
时间窗口采样算子。读取JSONL时间序列记录,按指定时间窗口分组后在每个窗口内均匀抽取样本。 当用户提到按天抽样、按小时抽样、周期性抽样、时间窗口采样等需求时使用此skill。 即使用户没有明确说出"时间窗口采样",只要任务涉及按时间粒度分组后抽样,就应该使用此skill。 不负责时间字段清洗、时间聚合统计或异常检测。
Idioma del texto original: chino
Token数量过滤器。筛选器将总令牌数的样本保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到token数量过滤、文本token数筛选、按token数过滤、文本分词过滤等需求时使用此skill。
Idioma del texto original: chino
TSV格式化器。用于加载和格式化tsv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到TSV格式化、TSV数据加载、读取TSV文件、TSV转JSONL等需求时使用此skill。
Idioma del texto original: chino
唯一性约束校验工具。检查指定字段的值是否在全表中唯一,标记重复出现的值所在行 (保留首次出现),支持空值跳过。当用户提到唯一性检查、重复值检测、主键约束等需求时使用此skill。
Idioma del texto original: chino
格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。
Idioma del texto original: chino
标识符字段检查工具。读取结构化数据文件,检查是否存在指定的质量标识符字段(默认为QC0000), 如果不存在则添加该字段,最后输出为相同格式的文件。当用户提到标识符字段检查、添加质量标识符、QC字段检查等需求时使用此skill。 即使用户没有明确说出"标识符字段",只要任务涉及检查或添加质量标识符字段,就应该使用此skill。
Idioma del texto original: chino
视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频样本。 当用户提到视频去重、删除重复视频、清理重复视频等需求时使用此skill。 即使用户没有明确说出"视频去重",只要任务涉及从包含视频的数据中删除重复视频, 就应该使用此skill。
Idioma del texto original: chino
加权采样算子。读取JSONL记录,按数值型权重字段执行随机采样,支持有放回和无放回两种模式。当用户提到加权抽样、按权重抽样、优先级采样、重要性重采样等需求时使用此skill。即使用户没有明确说出“加权采样”,只要任务涉及按记录权重选择样本,就应该使用此skill。不负责按类别分层均衡、普通随机采样或文本内容过滤。
Idioma del texto original: chino
单词重复比例过滤器。过滤器将单词级n-gram重复比率的样本保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到单词重复过滤、文本重复比例过滤、n-gram重复过滤、清理重复内容等需求时使用此skill。
Idioma del texto original: chino
单词数量过滤器。过滤器,以保持总字数在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到单词数量过滤、文本字数筛选、按单词数过滤、按字数过滤等需求时使用此skill。
Idioma del texto original: chino
将解压的XML目录重新打包为XLSX文件
Idioma del texto original: chino
将XLSX文件解压为XML目录
Idioma del texto original: chino
验证XLSX文件格式有效性
Idioma del texto original: chino
提取PDF文件的元数据(标题、作者、主题、页数等),输出为JSON格式。当用户需要查看PDF文档信息时使用此skill。
Idioma del texto original: chino