基于 SOC 职业分类
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/lujuncheng1225-cloud/AI_Commercialization--Product-Management-skills --skill llm-evaluation-plan命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | llm-evaluation-plan |
| description | 为 AI 功能定义离线与线上评估方案,包括样本、指标和阻断阈值。适用于上线前需要明确质量标准的场景。 |
| type | component |
| best_for | ["为 AI 功能设计评估方案","把主观质量讨论变成可测方案","定义 LLM 功能上线门槛"] |
| scenarios | ["为 AI 会议纪要做评估方案","怎么评估 AI 支持助手的质量"] |
用一套可执行的评估方案,把“这个 AI 好不好”从感觉题变成证据题。
常见维度:
评估计划不是为了证明“模型不错”,而是为了判断:
测试集至少应覆盖三类样本:
如果只有“正常样本”,评估结果通常会虚高。
在评估计划里,必须主动加入会削弱结论可信度的检查:
如果一个功能在常见样本上表现不错,但在高风险样本上失败代价过高:
## Evaluation Plan
### Feature
[功能]
### Offline Test Set
- [样本场景]
### Metrics
- [指标]
### Failure Thresholds
- [什么情况不能上线]
### Stress Cases
- [最容易翻车的样本]
### Online Signals
- [线上信号]
### What Would Change The Launch Decision
- [哪些额外结果会让 go 变 no-go,或让 no-go 变 limited rollout]
好:
差:
template.md../ai-feature-brief/SKILL.md../ai-risk-review/SKILL.md