用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/xinyuehtx/doc-cli-evals --skill eval-score命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | eval-score |
| description | 使用 Rubric 对 CLI 评测结果进行打分,采用两步工作流避免评分偏差 |
| disable-model-invocation | false |
| context | fork |
使用 Rubric 对评测结果进行多维度打分。采用 Agent-as-judge 两步工作流:
打分针对每个 case 下
manifest.clis中的每个 CLI 分别进行。参与对比的 CLI 取自已安装的 CLI 工具插件(evals plugin list --type cli-tool),不硬编码。
准备打分上下文,为每个 case 生成公共的 raw-rubrics.json,为每个 case/CLI 生成 scoring-prompt.txt:
evals score prepare "$1"
执行两步打分工作流(详见 SKILL-judge.md):
Step 1: 细化 Rubrics
{case_dir}/raw-rubrics.json 和测试用例 prompt{case_dir}/shared-refined-rubrics.jsonStep 2: 执行打分
{cli_dir}/rubric-scores.json
<cli_name>取自manifest.clis(即已安装的 CLI 工具插件名)。
| 文件 | 层级 | 说明 |
|---|---|---|
raw-rubrics.json | Case 级 | 原始评分标准,所有 CLI 共享 |
shared-refined-rubrics.json | Case 级 | 细化后的 0-5 分标准,所有 CLI 共享 |
scoring-prompt.txt | CLI 级 | 执行上下文,每个 CLI 特有 |
rubric-scores.json | CLI 级 | 最终评分结果,每个 CLI 特有 |
显示打分的汇总统计和跨 CLI 对比:
evals score summary "$1"
用户可见的评分标准,关注功能完成度。由 Skill Step 1 细化为具体的 0-5 分标准。
仅评分者可见的标准,关注执行质量(执行效率、错误处理、工具选择等)。
通过浏览器截图进行的视觉评估(美学、完整性、一致性)。
# 1. 准备打分上下文
evals score prepare <run_id>
# 2. 对每个 case/CLI 执行打分(CLI 取自 manifest.clis,动态遍历)
for case_name in ...; do
for cli_name in $(cli list from manifest.clis); do
/eval-score judge <run_id> <case_name> <cli_name>
done
done
# 3. 查看汇总
evals score summary <run_id>
/eval-run 已完成/eval-progress 显示运行已完成/eval-report - 生成报告