Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/cas-bigdatalab/piflow --skill stacked-symbol-cleaner명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SOC 직업 분류 기준
SKILL.md 표시 중
| name | stacked_symbol_cleaner |
| description | '堆叠符号清洗工具。去除纯符号装饰行/分隔线(====、****、 |
识别并删除纯符号组成的装饰行,支持 3 种模式:(1) 连续重复符号 ====、****、----;(2) 带空格符号 * * * * *、- - - -;(3) 交替符号 -=-=-=-、_._._._。阈值 --min_repeat 控制最小重复次数。
| 参数 | 说明 |
|---|---|
--input_path | 输入 CSV/TSV/Excel 等结构化文件路径 |
--output_path | 输出清洗后文件路径 |
| 参数 | 说明 | 默认值 |
|---|---|---|
--text_columns | 需要处理的文本列,逗号分隔;不填则处理全部字符串列 | 全部字符串列 |
--min_repeat | 判定为堆叠符号装饰行的最小重复次数 | 4 |
输入为结构化表格,文本列可包含纯符号分隔线或装饰行:
id,text
1,"Title\n====\nBody"
python scripts/stacked_symbol_cleaner.py \
--input_path <输入文件> \
--output_path <输出文件> \
[--text_columns col1,col2] \
[--min_repeat 4]
| 参数 | 必填 | 说明 |
|---|---|---|
--input_path | 是 | 输入文件路径 |
--output_path | 是 | 输出文件路径 |
--text_columns | 否 | 处理的文本列 |
--min_repeat | 否 | 最小重复次数(默认4) |
[OK] 堆叠符号清洗完成 -> output.csv
文本列: ['text'], min_repeat=4
========== 和 * * * * * 行 → 已删除
使用仓库内 Python 环境运行,无额外第三方依赖;读取/写入复用共享 data_io。
min_repeat=4 时 ---(3个)保留,----(4个)删除