用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/cas-bigdatalab/piflow --skill stacked-symbol-cleaner命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | stacked_symbol_cleaner |
| description | '堆叠符号清洗工具。去除纯符号装饰行/分隔线(====、****、 |
识别并删除纯符号组成的装饰行,支持 3 种模式:(1) 连续重复符号 ====、****、----;(2) 带空格符号 * * * * *、- - - -;(3) 交替符号 -=-=-=-、_._._._。阈值 --min_repeat 控制最小重复次数。
| 参数 | 说明 |
|---|---|
--input_path | 输入 CSV/TSV/Excel 等结构化文件路径 |
--output_path | 输出清洗后文件路径 |
| 参数 | 说明 | 默认值 |
|---|---|---|
--text_columns | 需要处理的文本列,逗号分隔;不填则处理全部字符串列 | 全部字符串列 |
--min_repeat | 判定为堆叠符号装饰行的最小重复次数 | 4 |
输入为结构化表格,文本列可包含纯符号分隔线或装饰行:
id,text
1,"Title\n====\nBody"
python scripts/stacked_symbol_cleaner.py \
--input_path <输入文件> \
--output_path <输出文件> \
[--text_columns col1,col2] \
[--min_repeat 4]
| 参数 | 必填 | 说明 |
|---|---|---|
--input_path | 是 | 输入文件路径 |
--output_path | 是 | 输出文件路径 |
--text_columns | 否 | 处理的文本列 |
--min_repeat | 否 | 最小重复次数(默认4) |
[OK] 堆叠符号清洗完成 -> output.csv
文本列: ['text'], min_repeat=4
========== 和 * * * * * 行 → 已删除
使用仓库内 Python 环境运行,无额外第三方依赖;读取/写入复用共享 data_io。
min_repeat=4 时 ---(3个)保留,----(4个)删除