| name | yixiali-taiji-adapter |
| description | 使用 YAML 配置和统一 CLI 操作 yixiali 的可复现太极 Pipeline。用于选择或填写已登记的 SFT A20B Midtrain、SFT A20B OPD-v1、RL HY3.1 A3B 模板,执行离线校验与计划,提交或恢复训练、模型卡、模型转换、推理部署、多个评估、Excel 结果导出和收尾阶段,以及查看前后台 Runner 与逐 checkpoint 状态;也用于用户明确要求时开发、修复或扩展 adapter。 |
Yixiali Taiji Adapter 使用说明
操作边界
- 默认把本 skill 当作稳定工具使用,通过单次运行 YAML 和
scripts/yixiali-taiji 完成操作。
- 用户未明确要求开发、修改、修复或扩展本 skill 时,不得修改本目录中的代码、公共模板或文档。配置缺少能力时,说明缺口并等待用户决定是否开发。
- 用户未明确要求提交、运行或恢复平台任务时,不得执行会改变太极状态的
apply、run 或 resume;可以按请求读取配置,执行离线的 validate 和 plan。
yixiali-taiji-workflow 是已经停用的旧流程。不要使用或修改它;当前操作统一使用 yixiali-taiji-adapter。
- 不得在 YAML、日志、plan、receipt、测试或回复中写入 Token、Cookie、授权头或其他 Secret。
准备运行文件
- 阅读
README.md,确认凭据、CLI 语义和当前限制。
- 从
configs/pipelines/pipelines.yaml 选择一个已登记 profile:
sft-a20b-midtrain
sft-a20b-opd-v1
rl-hy3.1-a3b
- 阅读
configs/defaults/yixiali-v1.yaml 和所选 profile YAML。除非比较模板,不要加载其他 profile。
- 将公共模板复制到 skill 目录之外的单次运行文件。只修改模板允许变更的字段,不要直接覆盖公共模板。
- 填写所有
__REQUIRED__:run.name、run.description、训练数据路径;SFT 还要填写 packing_count。
- 需要多个评估时,在
evaluation.jobs 中增加列表项,并在 result_export.jobs 中按 evaluation job ID 配置对应导出。
- 训练资源完全继承参考任务时使用
train.resources.mode: inherit;明确改机器规格时使用 override,并同时提供正整数 host_num 和 host_gpu_num。
命名、路径或资源规则有疑问时阅读 docs/naming-and-paths.md;字段契约阅读 docs/configuration-contract.md。
使用统一入口
先进入 skill 目录:
cd /apdcephfs_qy4/share_302593112/yixiali/CODES/Skills/skills/yixiali-taiji-adapter
按以下顺序操作:
scripts/yixiali-taiji validate --config-file /path/to/run.yaml
scripts/yixiali-taiji plan --config-file /path/to/run.yaml
scripts/yixiali-taiji apply --config-file /path/to/run.yaml --target train
scripts/yixiali-taiji run --config-file /path/to/run.yaml --target evaluation
scripts/yixiali-taiji run --config-file /path/to/run.yaml --detach
--target <stage> 表示执行到该阶段,并自动包含全部上游依赖;不能跳过依赖。可用阶段为 train、model_card、model_conversion、inference_deploy、evaluation、result_export 和 finalize。
查看与恢复
优先始终使用原始 config 定位状态:
scripts/yixiali-taiji status --config-file /path/to/run.yaml
scripts/yixiali-taiji logs --config-file /path/to/run.yaml --follow
scripts/yixiali-taiji resume --config-file /path/to/run.yaml --watch --detach
scripts/yixiali-taiji stop-runner --config-file /path/to/run.yaml
运行状态保存在 ${run.output_root}/_pipeline/。stop-runner 只停止本地轮询,不停止平台任务。RL 状态会按 checkpoint 展开模型卡、部署、多个评估、导出和缩容状态。
失败后重提时,保持 run.name 和输出根目录不变,把 train.parameters.task_name 改成唯一的 _retryN 名称,然后执行:
scripts/yixiali-taiji run --config-file /path/to/run.yaml --new-attempt --detach
旧 attempt 会归档到 _pipeline/attempts/,不会删除旧平台任务。完整 CLI 契约见 docs/cli.md。
执行与验证要求
- 在任何平台写操作前执行
validate 并检查 plan。
- 只有用户已经明确要求运行时,才执行对应的
apply、run 或 resume。
- 以本地 receipt 和平台 read-back 共同判断创建是否成功;不能只依据命令退出码宣称成功。
- 将实验名、路径、reference、资源和评估列表保留在 YAML;不要用临时 patch 改 Python 来完成一次实验。
- 普通使用无需阅读实现代码。仅在用户明确要求 debug 或新增功能时,阅读
docs/architecture.md、相关 adapter、gateway 和测试,再按项目规范修改并完整验证。
修改 skill 后执行:
uv run ruff check src tests
uv run pytest
uv build
python3 /root/.codex/skills/.system/skill-creator/scripts/quick_validate.py .