with one click
evaluation-lab
通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Menu
通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Based on SOC occupation classification
当需要分工时触发。基于成员技能和可用时间推荐任务分配。
当项目目标模糊、缺少方向卡时触发。帮助团队澄清项目方向、明确目标和交付物。
当需要阶段计划时触发。将项目方向转化为可执行的阶段计划。
当用户触发"主动推进"时使用。分析项目当前状态,发现风险点,生成行动建议和风险记录。
当用户触发"风险分析"时使用。分析项目风险,创建风险记录。
当需要计划调整时触发。基于签到和风险分析结果生成待确认的重规划草案。
| name | evaluation-lab |
| description | 通过自然语言请求安全地发现、校验、运行、轮询和核验 ProjectFlow Agent 本地评测,并返回机器可读结论与报告路径。 |
从仓库根目录使用唯一稳定入口 scripts/eval-lab。不要使用裸 npm、npx、直接调用 tsx,也不要手动启动开发数据库参与评测。
零 Token 校验:
scripts/eval-lab validate --preset smoke --model mock:mock-model
运行 Slice 0 smoke:
scripts/eval-lab run --preset smoke --model mock:mock-model --json
长任务轮询:
scripts/eval-lab status <run-id>
中断后恢复:
scripts/eval-lab run --preset smoke --model mock:mock-model --run-id <run-id> --resume --json
返回结果前验证证据链:
scripts/eval-lab verify <run-id>
需要完整报告时使用 scripts/eval-lab show <run-id>;发现能力和场景时使用 scripts/eval-lab list。
Slice 1 的完整确定性验收使用:
scripts/eval-lab run --preset full --model mock:mock-model --json
scripts/eval-lab verify <run-id>
scripts/eval-lab exit-gate <run-id> --json
scripts/eval-lab reliability <run-id> --json
reliability 对没有显式重复组的单次运行应返回 evidence 不足,不能把不同场景伪装成重复试验。对比分支时由评测器创建隔离 worktree/runtime,不要手工复用正在开发的进程或数据库:
scripts/eval-lab compare --candidate <git-ref> --baseline <git-ref> --preset smoke --model mock:mock-model --json
0:通过1:ProjectFlow Agent 回归2:基础设施失败3:配置、模型或标准校验失败4:预算耗尽或统计证据不足,已保留 partial evidence最终答复必须包含 status、summary、integrityRootSha256 和 artifactPaths。Coding Agent 自身费用不计入 ProjectFlow Agent 的 $0.10 smoke 上限;若外部费用不可测,保持 unknown,不得伪报为 $0.00。