一键导入
codex-evaluation
Codex 評估類 Use Case 技能。涵蓋 eval-driven improvement loop 工作流。觸發條件:當需要使用 Codex 進行持續品質改進、 評分迴圈、LLM-as-judge 評估時啟用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
Codex 評估類 Use Case 技能。涵蓋 eval-driven improvement loop 工作流。觸發條件:當需要使用 Codex 進行持續品質改進、 評分迴圈、LLM-as-judge 評估時啟用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
Codex 數據分析類 Use Case 技能。涵蓋數據集分析、報告生成、 評分迴圈等工作流。觸發條件:當需要使用 Codex 進行數據分析、 探索性分析、模型建構、報告輸出時啟用。
Codex 工程類 Use Case 技能。涵蓋投影片生成、PR 審查、 程式碼庫上手、API 遷移等工作流。觸發條件:當需要使用 Codex 進行程式碼審查、文件生成、程式碼庫導覽、API 升級時啟用。
Codex 前端類 Use Case 技能。涵蓋響應式 UI 實作、瀏覽器遊戲開發、 Figma 設計轉碼等工作流。觸發條件:當需要使用 Codex 進行前端 UI 開發、視覺驗證、遊戲建構、設計稿轉碼時啟用。
Codex 整合類 Use Case 技能。涵蓋 ChatGPT 應用開發、Slack 整合 等工作流。觸發條件:當需要使用 Codex 與第三方平台整合、 建構 ChatGPT 應用、從 Slack 觸發任務時啟用。
Codex 行動端 Use Case 技能。涵蓋 iOS/macOS 原生應用開發、 SwiftUI 架構、CLI 優先工作流。觸發條件:當需要使用 Codex 建構 iOS 或 macOS 原生應用、設定 Swift 專案時啟用。
OpenAI Codex Use Cases 完整知識庫。涵蓋 12 個官方 use case, 包含原始與優化 prompt、工作流程、AGENTS.md 配置範例、 技術棧建議。適用於需要參考 Codex 最佳實踐、撰寫 AGENTS.md、 或設計 Codex 自動化工作流的場景。
| name | codex-evaluation |
| description | Codex 評估類 Use Case 技能。涵蓋 eval-driven improvement loop 工作流。觸發條件:當需要使用 Codex 進行持續品質改進、 評分迴圈、LLM-as-judge 評估時啟用。 |
Evaluation 是 Codex 最核心的設計模式之一 — eval-driven improvement loop。 透過確定性評分腳本與 LLM-as-judge 的組合,Codex 可以自動迭代改進任何可量化的任務。
本分類包含 1 個 use case:
| 步驟 | 動作 | 說明 |
|---|---|---|
| 1 | 讀取 AGENTS.md | 了解專案規範 |
| 2 | 找到評分腳本 | 確定性 + LLM 評分 |
| 3 | 運行基準評分 | 記錄初始分數 |
| 4 | 聚焦改進 | 一次改一個維度 |
| 5 | 重新評分 | 比較前後差異 |
| 6 | 記錄變更 | 分數 + 改了什麼 |
| 7 | 視覺檢查 | view_image 確認 |
| 8 | 重複 4-7 | 直到分數 > 90% |
| 9 | 最終報告 | 分數、迭代日誌、風險 |
Role: You are a quality-obsessed engineer running an eval-driven improvement loop.
Context: This workspace has a difficult task with an evaluation script that scores output quality.
Task:
1. Preparation:
- Read `AGENTS.md` and follow all instructions.
- Locate the eval script/command (e.g., `python eval.py`, `npm run eval`).
- Run baseline eval and record initial scores.
- If no eval exists, create one scoring: correctness (0-100), quality (0-100), completeness (0-100).
2. Iteration Loop (repeat until target met):
a. Analyze current scores — identify the weakest dimension.
b. Make ONE focused improvement targeting that dimension.
c. Re-run eval immediately after the change.
d. Log to `iteration_log.md`: timestamp, change description, before/after scores.
e. If output is visual, use `view_image` to inspect.
f. If score regressed, analyze why before reverting.
3. Convergence Criteria:
- Overall score > {{target_score}}% (default: 90).
- LLM average > {{target_score}}%.
- No single dimension below {{min_dimension_score}}% (default: 75).
Constraints:
- Never stop at the first acceptable result.
- Never revert unless new scores are strictly worse AND artifact quality degraded.
- If stuck at a plateau, try a different approach rather than incremental tweaks.
- Maximum {{max_iterations}} iterations (default: 20).
Output Format:
- `iteration_log.md`: Complete history with scores per iteration.
- `final_report.md`: Best scores, approach summary, remaining risks.
- Final artifacts in `outputs/`.
Self-Verification:
Run eval one final time on the best version.
Confirm all scores meet convergence criteria.
一個好的 eval 腳本應該:
確定性 + LLM 混合評分:
多維度評分:
可重現:
# Iteration Conventions
- Run eval after every meaningful change
- Log scores and rationale in iteration_log.md
- Do not stop at the first passing result
- If eval improves but is still below target, explain the bottleneck
- Visual outputs: always use view_image to inspect before proceeding
┌─────────────────────────────────────┐
│ Start: Read AGENTS.md │
│ ↓ │
│ Run Baseline Eval │
│ ↓ │
│ ┌──→ Analyze Weakest Dim ──┐ │
│ │ ↓ │ │
│ │ Make ONE Improvement │ │
│ │ ↓ │ │
│ │ Re-run Eval │ │
│ │ ↓ │ │
│ │ Log Scores │ │
│ │ ↓ │ │
│ │ Score > Target? │ │
│ │ NO ↓ YES ↓ │ │
│ └──────── Final Report │ │
│ │
└─────────────────────────────────────┘
Codex 會自動建立一個基礎 eval 腳本。但建議提前準備好,因為好的 eval 是成功的關鍵。
| 技術 | 用途 |
|---|---|
| Eval scripts | 確定性評分 |
| LLM-as-judge | 主觀品質評分 |
| view_image | 視覺產出檢查 |
| iteration_log.md | 迭代記錄 |