원클릭으로
benchmark
こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
| name | benchmark |
| description | こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。 |
静的レビューだけでは足りないときに、skill が本当に挙動改善を生むかを比較評価する sub-skill です。比較で見る理由は、単発の好例ではなく、baseline / legacy / current の差分として改善を確かめるためです。 ゴール駆動で使うため、最初に達成したいゴール、成功条件、確認手段を短く固定します。
should-trigger と should-not-trigger を、実際の user request に近い形で作ります。near-miss case は false positive を見つけやすいので、明らかに無関係な prompt より重要です。
_eval/agents/runner.md を使い、各ケースを baseline / legacy / current で実行します。条件が揃っていない比較は信用できません。
uv run python plugins/happy-core/skills/skill-eval/_eval/scripts/aggregate_benchmark.py \
--skill-id <skill-id> --run-id <run-id>
baseline / legacy / current の比較と summary delta を集計します。単発ケースでは見えない傾向を、集計で可視化します。
uv run python plugins/happy-core/skills/skill-eval/_eval/scripts/generate_viewer.py \
--skill-id <skill-id>
assets/eval_review.html を使い、人がすばやく結果と履歴を見られる形にします。iteration を回すには、review の速さが重要です。
eval artifact はセッションワークスペースを既定とします。
evals.json が複数 iteration で再利用できそうなら、repo の evals/<skill-id>/evals.json へ昇格候補benchmark_summary.json と benchmark_history.jsonl が共有価値の高い結果なら、repo の evals/<skill-id>/ へ昇格候補viewer.html と raw run artifact は session 側に残す迷ったら session に残します。昇格は後からできますが、repo に入った transient artifact を整理するほうが高コストです。
current が legacy より明確に良ければ accept、悪化していれば revise、evidence が薄ければケース追加、回帰が大きければ escalation を選びます。accept した current は、次回 campaign では legacy に昇格させます。
baseline は常に no-skill の固定基準です。legacy は直前に採用した版です。current は今回の候補です。current を accept したら、その snapshot を次回の legacy にします。legacy は履歴 ledger には残しつつ、active benchmark からは外します。| 段階 | 見るもの |
|---|---|
| ケース設計 | should-trigger、near-miss、false-positive guard |
| 実行 | baseline / legacy / current の条件一致 |
| 集計 | pass rate、summary delta、傾向 |
| artifact | reviewer が追える形か、repo に昇格する価値があるか |
| 判断 | accept / revise / add cases / escalate |
../../_eval/agents/runner.md — baseline / legacy / current 実行../../_eval/scripts/aggregate_benchmark.py — 集計../../_eval/scripts/generate_viewer.py — viewer 生成../../_eval/schemas/schemas.md — artifact スキーマ定義../empirical/ — 指示明瞭性を先に確かめる軽量ルートへの導線こんなときに使う: Ubuntu / Linux サーバーに SSH で接続し、sudo、systemd サービス、HTTP 監視を一連で安全に進めたいとき。 接続前に SSH_AUTH_SOCK を含む認証状態を固定し、認証で止まらずに サーバー接続・権限確認・サービス起動・停止・再起動・状態確認を一気に行いたいとき。
調査→修正→検証→ふりかえり/後続 Issue 化までを 1 つの改善ループで回したいときに使う。 実装前の再現確認や、review 指摘・検証結果をもとに次のアクションへつなぐ。
こんなときに使う: 現在の会話内容をもとに、実装・エージェント発注に直結する PRD を作りたいとき。 追加のインタビューはせず、すでに会話に出ている内容だけから構成する。 情報が不足している場合は捏造せず「未確定」として明示する。
こんなときに使う: ユーザーが「インタビューして」「質問して」「設計を詰めたい」などと言ったら使う。 計画や設計の重要な判断軸を洗い出し、具体例・反例・影響範囲まで深掘りして要件整理に落とす。
Copilot の custom skill / agent / repository instructions の作成・改善・構造確認を 1 つの入口にまとめる。複合スキルとして、対象に応じて適切な authoring ルートへ 分けつつ、実行時のモデル呼び出しを抑止してルーティングを優先する。試作から `plugins/*` 配布へ昇格するときの name / description 整備も扱う。skill / agent / repo-wide instructions / path-specific instructions を新規作成したいとき、既存定義を育てたいとき、公開前に責務や導線を確かめたいとき。
新しい custom agent を既存 agent 群と同じ型で立ち上げる。agent の新規追加、役割分離のための専門 agent 作成、既存群の隙間を埋めたいとき。