| name | eval-harness |
| description | Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles |
| origin | ECC |
| tools | Read, Write, Edit, Bash, Grep, Glob |
Eval ハーネススキル
eval 駆動開発(EDD)原則を実装する Claude Code セッション用の正式な評価フレームワークです。
起動条件
- AI アシストワークフローのための eval 駆動開発(EDD)のセットアップ
- Claude Code タスク完了のための合格/不合格基準の定義
- pass@k メトリクスによるエージェント信頼性の測定
- プロンプトやエージェント変更のためのリグレッションテストスイートの作成
- モデルバージョン間のエージェントパフォーマンスのベンチマーク
哲学
Eval駆動開発はevalを「AI開発のユニットテスト」として扱う:
- 実装前に期待される動作を定義
- 開発中にevalを継続的に実行
- 各変更でリグレッションを追跡
- 信頼性測定にpass@kメトリクスを使用
Evalタイプ
Capability Eval
Claudeが以前できなかったことができるようになったかテスト:
[CAPABILITY EVAL: feature-name]
タスク: Claudeが達成すべきことの説明
成功基準:
- [ ] 基準1
- [ ] 基準2
- [ ] 基準3
期待出力: 期待される結果の説明
Regression Eval
変更が既存機能を壊さないことを確認:
[REGRESSION EVAL: feature-name]
ベースライン: SHAまたはチェックポイント名
テスト:
- existing-test-1: PASS/FAIL
- existing-test-2: PASS/FAIL
- existing-test-3: PASS/FAIL
結果: X/Y 合格(以前はY/Y)