一键导入
skill-eval
こんなときに使う: skill / プロンプト資産の評価を 1 つの入口にまとめたいとき。skill の behavioral A/B 比較(baseline / legacy / current)をしたいとき、または プロンプト指示の明瞭性を実証的に検証したいとき。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
こんなときに使う: skill / プロンプト資産の評価を 1 つの入口にまとめたいとき。skill の behavioral A/B 比較(baseline / legacy / current)をしたいとき、または プロンプト指示の明瞭性を実証的に検証したいとき。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
こんなときに使う: Ubuntu / Linux サーバーに SSH で接続し、sudo、systemd サービス、HTTP 監視を一連で安全に進めたいとき。 接続前に SSH_AUTH_SOCK を含む認証状態を固定し、認証で止まらずに サーバー接続・権限確認・サービス起動・停止・再起動・状態確認を一気に行いたいとき。
調査→修正→検証→ふりかえり/後続 Issue 化までを 1 つの改善ループで回したいときに使う。 実装前の再現確認や、review 指摘・検証結果をもとに次のアクションへつなぐ。
こんなときに使う: 現在の会話内容をもとに、実装・エージェント発注に直結する PRD を作りたいとき。 追加のインタビューはせず、すでに会話に出ている内容だけから構成する。 情報が不足している場合は捏造せず「未確定」として明示する。
こんなときに使う: ユーザーが「インタビューして」「質問して」「設計を詰めたい」などと言ったら使う。 計画や設計の重要な判断軸を洗い出し、具体例・反例・影響範囲まで深掘りして要件整理に落とす。
Copilot の custom skill / agent / repository instructions の作成・改善・構造確認を 1 つの入口にまとめる。複合スキルとして、対象に応じて適切な authoring ルートへ 分けつつ、実行時のモデル呼び出しを抑止してルーティングを優先する。試作から `plugins/*` 配布へ昇格するときの name / description 整備も扱う。skill / agent / repo-wide instructions / path-specific instructions を新規作成したいとき、既存定義を育てたいとき、公開前に責務や導線を確かめたいとき。
新しい custom agent を既存 agent 群と同じ型で立ち上げる。agent の新規追加、役割分離のための専門 agent 作成、既存群の隙間を埋めたいとき。
| name | skill-eval |
| description | こんなときに使う: skill / プロンプト資産の評価を 1 つの入口にまとめたいとき。skill の behavioral A/B 比較(baseline / legacy / current)をしたいとき、または プロンプト指示の明瞭性を実証的に検証したいとき。 |
「この skill は本当に挙動を改善するか」「この指示は別の実行者にも明瞭に届くか」という 2 つの評価問題を、1 本の入口から適切なルートへ案内します。入口を 1 つにする理由は、どちらの評価も「変更前に測る」「iteration を回す」という共通の構造を持ち、用語が紛れやすいためです。 ゴール駆動で使うため、最初に達成したいゴール、成功条件、確認手段を短く固定します。
作成・改善・責務整理そのものは copilot-authoring から始めます。本 skill は 評価方法を選ぶ窓口です。明瞭性だけを実動で測りたいことが最初から明らかな場合は、empirical-prompt-tuning に直行して構いません。
| 問いの種類 | 選ぶルート | 特徴 |
|---|---|---|
| 「新版は旧版より良くなったか?」 | sub_skills/benchmark/ | evals.json を用意して baseline / legacy / current を比較。定量的 verdict を出す。 |
| 「この指示は曖昧さなく伝わるか?」 | sub_skills/empirical/ | 新規 subagent に実行させて両面評価。反復して収束判定。 |
| 「作成や責務整理から始めたい」 | copilot-authoring | authoring の入口へ戻し、構造確認後に必要なら評価へ進む。 |
| どちらか迷う | まず empirical で明瞭性を確認 → 改善後に benchmark で版比較 | empirical は軽量で先に回しやすい。 |
_eval/agents/ — runner / grader / comparator / analyzer の 4 agent_eval/schemas/ — eval artifact のスキーマ定義_eval/scripts/ — aggregate_benchmark.py / generate_viewer.py / materialize_manual_run.py / extract_prompt_corpus.pyassets/eval_review.html — viewer テンプレートevals.json と benchmark_summary / history は再利用価値が確認できてから repo の evals/<skill-id>/ へ昇格します。empirical-prompt-tuning との役割分担: sub_skills/empirical/ は skill 評価文脈の thin pointer です。任意プロンプトに単独で使いたい場合は empirical-prompt-tuning skill を直接呼びます。