| name | eval-score |
| description | 使用 Rubric 对 CLI 评测结果进行打分,采用两步工作流避免评分偏差 |
| disable-model-invocation | false |
| context | fork |
Eval Score - Rubric 打分
使用 Rubric 对评测结果进行多维度打分。采用 Agent-as-judge 两步工作流:
- 细化评分标准 — 仅基于测试用例 prompt(不看执行结果)
- 执行打分 — 基于所有可用数据和细化后的标准
打分针对每个 case 下 manifest.clis 中的每个 CLI 分别进行。参与对比的 CLI 取自已安装的 CLI 工具插件(evals plugin list --type cli-tool),不硬编码。
命令
/eval-score prepare <run_id>
准备打分上下文,为每个 case 生成公共的 raw-rubrics.json,为每个 case/CLI 生成 scoring-prompt.txt:
evals score prepare "$1"
/eval-score judge <run_id> <case_name> <cli_name>
执行两步打分工作流(详见 SKILL-judge.md):
Step 1: 细化 Rubrics
- 读取
{case_dir}/raw-rubrics.json 和测试用例 prompt
- 将宽泛的评分标准细化为具体的 0-5 分标准
- 写入
{case_dir}/shared-refined-rubrics.json
Step 2: 执行打分
- 读取所有上下文(output.log, doc-content, screenshots, status)
- 基于细化标准逐项打分
- 写入
{cli_dir}/rubric-scores.json
<cli_name> 取自 manifest.clis(即已安装的 CLI 工具插件名)。
文件布局
| 文件 | 层级 | 说明 |
|---|
raw-rubrics.json | Case 级 | 原始评分标准,所有 CLI 共享 |
shared-refined-rubrics.json | Case 级 | 细化后的 0-5 分标准,所有 CLI 共享 |
scoring-prompt.txt | CLI 级 | 执行上下文,每个 CLI 特有 |
rubric-scores.json | CLI 级 | 最终评分结果,每个 CLI 特有 |
/eval-score summary <run_id>
显示打分的汇总统计和跨 CLI 对比:
evals score summary "$1"
打分维度
1. Explicit Rubrics(显式标准)
用户可见的评分标准,关注功能完成度。由 Skill Step 1 细化为具体的 0-5 分标准。
2. Implicit Rubrics(隐式标准)
仅评分者可见的标准,关注执行质量(执行效率、错误处理、工具选择等)。
3. Visual Scores(视觉评分)
通过浏览器截图进行的视觉评估(美学、完整性、一致性)。
完整工作流
evals score prepare <run_id>
for case_name in ...; do
for cli_name in $(cli list from manifest.clis); do
/eval-score judge <run_id> <case_name> <cli_name>
done
done
evals score summary <run_id>
前置条件
/eval-run 已完成
/eval-progress 显示运行已完成
下一步推荐
参考 Skills