用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/aaione/everything-claude-code-zh --skill agent-eval命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
Kubernetes 工作负载模式、资源管理、RBAC、probes、autoscaling、ConfigMap/Secret 处理,以及面向生产级部署的 kubectl 调试。
完成任何非平凡任务后使用。智能体按 5 个维度自评输出——准确性、完整性、清晰度、可执行性、简洁性——每项都给出具体证据。生成结构化 1-5 评分卡和具体改进建议。
在 competitive-platform-analysis 产出分层竞品集合后使用。按九个加权维度(定位、声音、视觉工艺、offer packaging、证据、enterprise-readiness、thought leadership、定价、客户 strategic tension)为每个竞品评分,使用明确 1–5 rubrics 和 tension-plot。位于 competitive-report-structure 之前。
基于 SOC 职业分类
正在显示 SKILL.md
| name | agent-eval |
| description | 在自定义任务上对编码智能体(Claude Code、Aider、Codex 等)进行头对头比较,包含通过率、成本、时间和一致性指标 |
| origin | ECC |
| tools | Read, Write, Edit, Bash, Grep, Glob |
一个轻量级 CLI 工具,用于在可重现任务上对编码智能体进行头对头比较。每个"哪个编码智能体最好?"的比较都基于氛围 — 此工具将其系统化。
注意: 在审查源代码后从其存储库安装 agent-eval。
声明式定义任务。每个任务指定做什么、触摸哪些文件以及如何判断成功:
name: add-retry-logic
description: 为 HTTP 客户端添加指数退避重试
repo: ./my-project
files:
- src/http_client.py
prompt: |
为所有 HTTP 请求添加指数退避的重试逻辑。
最多 3 次重试。初始延迟 1 秒,最大延迟 30 秒。
judge:
- type: pytest
command: pytest tests/test_http_client.py -v
- type: grep
pattern: "exponential_backoff|retry"
files: src/http_client.py
commit: "abc1234" # 固定到特定提交以确保可重现性
每个智能体运行都有自己的 git 工作树 — 不需要 Docker。这提供了可重现性隔离,因此智能体不会相互干扰或损坏基础存储库。
| 指标 | 衡量内容 |
|---|---|
| 通过率 | 智能体是否产生通过判断器的代码? |
| 成本 | 每项任务的 API 开销(如果可用) |
| 时间 | 完成的墙钟秒数 |
| 一致性 | 重复运行的通过率(例如,3/3 = 100%) |
创建一个 tasks/ 目录,每个任务一个 YAML 文件:
mkdir tasks
# 编写任务定义(见上面的模板)
针对您的任务执行智能体:
agent-eval run --task tasks/add-retry-logic.yaml --agent claude-code --agent aider --runs 3
每次运行:
生成比较报告:
agent-eval report --format table
Task: add-retry-logic (各运行 3 次)
┌──────────────┬───────────┬────────┬────────┬─────────────┐
│ Agent │ Pass Rate │ Cost │ Time │ Consistency │
├──────────────┼───────────┼────────┼────────┼─────────────┤
│ claude-code │ 3/3 │ $0.12 │ 45s │ 100% │
│ aider │ 2/3 │ $0.08 │ 38s │ 67% │
└──────────────┴───────────┴────────┴────────┴─────────────┘
judge:
- type: pytest
command: pytest tests/ -v
- type: command
command: npm run build
judge:
- type: grep
pattern: "class.*Retry"
files: src/**/*.py
judge:
- type: llm
prompt: |
此实现是否正确处理指数退避?
检查:最大重试次数、递增延迟、抖动。