| name | agent-eval |
| description | Head-to-head comparison of coding agents (Claude Code, Aider, Codex, etc.) on custom tasks with pass rate, cost, time, and consistency metrics |
| origin | ECC |
| tools | Read, Write, Edit, Bash, Grep, Glob |
Agent Eval Skill
コーディングエージェントを再現可能なタスクで直接比較するための軽量 CLI ツールです。「どのコーディングエージェントが最良か?」という比較はすべて感覚で行われています。このツールはそれを体系化します。
起動条件
- コーディングエージェント(Claude Code、Aider、Codex など)を自分のコードベースで比較する場合
- 新しいツールやモデルを採用する前にエージェントのパフォーマンスを測定する場合
- エージェントがモデルやツーリングを更新した際のリグレッションチェックを実行する場合
- チームのためにデータに基づくエージェント選定を行う場合
インストール
注意: ソースを確認した上で、リポジトリから agent-eval をインストールしてください。
Core Concepts
YAML タスク定義
タスクを宣言的に定義します。各タスクでは、何をするか、どのファイルに触れるか、どのように成功を判定するかを指定します:
name: add-retry-logic
description: Add exponential backoff retry to the HTTP client
repo: ./my-project