소스 정보
- 저장소
- cas-bigdatalab/piflow
- 최근 소스 활동
- 2026년 7월 9일 03:08
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 539
- 포크
- 171
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/cas-bigdatalab/piflow --skill language-filter명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
Dataspace 文件输入源算子。用于根据 Dataspace 数据源实例 ID 和空间内文件路径下载单个文件,并将该文件作为工作流输入提供给下游算子。该算子没有上游输入,必须作为 DAG 的起始节点使用。
Dataspace 文件输出终止算子。用于接收上游算子的单个文件输出,按指定相对目录上传到 Dataspace 空间目录中,实际文件名自动沿用输入文件名。该算子必须作为 DAG 的终止节点使用。
用于编辑或创建 Gaussian 输入文件(.gjf),支持添加 Link 0 指令(%chk、%oldchk、%nprocshared、%mem)、Route 行关键词、电荷和多重度。可对已有 gjf 文件进行参数填充,也可从零创建新的 gjf 文件。
SOC 직업 분류 기준
SKILL.md 표시 중
| name | language_filter |
| description | 语种过滤工具。对指定或全部文本列进行语言检测,可选择保留或剔除目标语种, 输出过滤后的数据并附带 detected_lang 列。 |
| name_zh | 语种过滤算子 |
| input_params | [{"name":"input_path","type":"string","required":true,"description":"输入文件路径(支持CSV/TSV/Excel等)"},{"name":"output_path","type":"string","required":true,"description":"输出文件路径(过滤后的文件)"},{"name":"target_lang","type":"string","required":true,"description":"目标语种代码(如 zh, en, fr 等)"},{"name":"text_columns","type":"string","required":false,"description":"用于检测的文本列,逗号分隔;不填默认全部字符串列"},{"name":"mode","type":"string","required":false,"description":"keep=保留目标语种,drop=剔除目标语种,默认 keep"}] |
| output_params | [{"name":"output_path","type":"csv_file","description":"语种过滤后的结构化数据文件(含 detected_lang)"}] |
| tag | 数据清洗 |
| publisher | COMMUNITY |
| 参数 | 必填 | 默认值 | 说明 |
|---|---|---|---|
--input_path | 是 | 输入文件路径(支持CSV/TSV/Excel等) | |
--output_path | 是 | 输出文件路径(过滤后的文件) | |
--target_lang | 是 | 目标语种代码(如 zh, en, fr 等) | |
--text_columns | 否 | 用于检测的文本列,逗号分隔;不填默认全部字符串列 | |
--mode | 否 | keep=保留目标语种,drop=剔除目标语种,默认 keep |
python scripts/language_filter.py \
--input_path <输入文件> \
--output_path <输出文件> \
--target_lang zh \
[--text_columns col1,col2] \
[--mode keep|drop]
pip install langdetect。