بنقرة واحدة
benchmark
こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
こんなときに使う: Ubuntu / Linux サーバーに SSH で接続し、sudo、systemd サービス、HTTP 監視を一連で安全に進めたいとき。 接続前に SSH_AUTH_SOCK を含む認証状態を固定し、認証で止まらずに サーバー接続・権限確認・サービス起動・停止・再起動・状態確認を一気に行いたいとき。
調査→修正→検証→ふりかえり/後続 Issue 化までを 1 つの改善ループで回したいときに使う。 実装前の再現確認や、review 指摘・検証結果をもとに次のアクションへつなぐ。
こんなときに使う: 現在の会話内容をもとに、実装・エージェント発注に直結する PRD を作りたいとき。 追加のインタビューはせず、すでに会話に出ている内容だけから構成する。 情報が不足している場合は捏造せず「未確定」として明示する。
こんなときに使う: ユーザーが「インタビューして」「質問して」「設計を詰めたい」などと言ったら使う。 計画や設計の重要な判断軸を洗い出し、具体例・反例・影響範囲まで深掘りして要件整理に落とす。
Copilot の custom skill / agent / repository instructions の作成・改善・構造確認を 1 つの入口にまとめる。複合スキルとして、対象に応じて適切な authoring ルートへ 分けつつ、実行時のモデル呼び出しを抑止してルーティングを優先する。試作から `plugins/*` 配布へ昇格するときの name / description 整備も扱う。skill / agent / repo-wide instructions / path-specific instructions を新規作成したいとき、既存定義を育てたいとき、公開前に責務や導線を確かめたいとき。
新しい custom agent を既存 agent 群と同じ型で立ち上げる。agent の新規追加、役割分離のための専門 agent 作成、既存群の隙間を埋めたいとき。
| name | benchmark |
| description | こんなときに使う: baseline / legacy / current を比較し、skill の行動変化を測りたいとき。trigger 精度、出力品質、回帰リスクを実証的に確認したいとき。 |
静的レビューだけでは足りないときに、skill が本当に挙動改善を生むかを比較評価する sub-skill です。比較で見る理由は、単発の好例ではなく、baseline / legacy / current の差分として改善を確かめるためです。 ゴール駆動で使うため、最初に達成したいゴール、成功条件、確認手段を短く固定します。
should-trigger と should-not-trigger を、実際の user request に近い形で作ります。near-miss case は false positive を見つけやすいので、明らかに無関係な prompt より重要です。
_eval/agents/runner.md を使い、各ケースを baseline / legacy / current で実行します。条件が揃っていない比較は信用できません。
uv run python plugins/happy-core/skills/skill-eval/_eval/scripts/aggregate_benchmark.py \
--skill-id <skill-id> --run-id <run-id>
baseline / legacy / current の比較と summary delta を集計します。単発ケースでは見えない傾向を、集計で可視化します。
uv run python plugins/happy-core/skills/skill-eval/_eval/scripts/generate_viewer.py \
--skill-id <skill-id>
assets/eval_review.html を使い、人がすばやく結果と履歴を見られる形にします。iteration を回すには、review の速さが重要です。
eval artifact はセッションワークスペースを既定とします。
evals.json が複数 iteration で再利用できそうなら、repo の evals/<skill-id>/evals.json へ昇格候補benchmark_summary.json と benchmark_history.jsonl が共有価値の高い結果なら、repo の evals/<skill-id>/ へ昇格候補viewer.html と raw run artifact は session 側に残す迷ったら session に残します。昇格は後からできますが、repo に入った transient artifact を整理するほうが高コストです。
current が legacy より明確に良ければ accept、悪化していれば revise、evidence が薄ければケース追加、回帰が大きければ escalation を選びます。accept した current は、次回 campaign では legacy に昇格させます。
baseline は常に no-skill の固定基準です。legacy は直前に採用した版です。current は今回の候補です。current を accept したら、その snapshot を次回の legacy にします。legacy は履歴 ledger には残しつつ、active benchmark からは外します。| 段階 | 見るもの |
|---|---|
| ケース設計 | should-trigger、near-miss、false-positive guard |
| 実行 | baseline / legacy / current の条件一致 |
| 集計 | pass rate、summary delta、傾向 |
| artifact | reviewer が追える形か、repo に昇格する価値があるか |
| 判断 | accept / revise / add cases / escalate |
../../_eval/agents/runner.md — baseline / legacy / current 実行../../_eval/scripts/aggregate_benchmark.py — 集計../../_eval/scripts/generate_viewer.py — viewer 生成../../_eval/schemas/schemas.md — artifact スキーマ定義../empirical/ — 指示明瞭性を先に確かめる軽量ルートへの導線