一键导入
evaluation-lab
通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
当需要分工时触发。基于成员技能和可用时间推荐任务分配。
当项目目标模糊、缺少方向卡时触发。帮助团队澄清项目方向、明确目标和交付物。
当需要阶段计划时触发。将项目方向转化为可执行的阶段计划。
当用户触发"主动推进"时使用。分析项目当前状态,发现风险点,生成行动建议和风险记录。
当用户触发"风险分析"时使用。分析项目风险,创建风险记录。
当需要计划调整时触发。基于签到和风险分析结果生成待确认的重规划草案。
| name | evaluation-lab |
| description | 通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。 |
从仓库根目录使用唯一稳定入口 scripts/eval-lab。不要使用裸 npm、npx、直接调用 tsx,也不要手动启动开发数据库参与评测。
零 Token 校验:
scripts/eval-lab validate --preset smoke --model mock:mock-model
运行 Slice 0 smoke:
scripts/eval-lab run --preset smoke --model mock:mock-model --json
长任务轮询:
scripts/eval-lab status <run-id>
中断后恢复:
scripts/eval-lab run --preset smoke --model mock:mock-model --run-id <run-id> --resume --json
返回结果前验证证据链:
scripts/eval-lab verify <run-id>
需要完整报告时使用 scripts/eval-lab show <run-id>;发现能力和场景时使用 scripts/eval-lab list。
Slice 1 的完整确定性验收使用:
scripts/eval-lab run --preset full --model mock:mock-model --json
scripts/eval-lab verify <run-id>
scripts/eval-lab exit-gate <run-id> --json
scripts/eval-lab reliability <run-id> --json
reliability 对没有显式重复组的单次运行应返回 evidence 不足,不能把不同场景伪装成重复试验。对比分支时由评测器创建隔离 worktree/runtime,不要手工复用正在开发的进程或数据库:
scripts/eval-lab compare --candidate <git-ref> --baseline <git-ref> --preset smoke --model mock:mock-model --json
0:通过1:ProjectFlow Agent 回归2:基础设施失败3:配置、模型或标准校验失败4:预算耗尽或统计证据不足,已保留 partial evidence最终答复必须包含 status、summary、integrityRootSha256 和 artifactPaths。Coding Agent 自身费用不计入 ProjectFlow Agent 的 $0.10 smoke 上限;若外部费用不可测,保持 unknown,不得伪报为 $0.00。