원클릭으로
skill-creator
创建新 skills、改造已有 skills、并通过评测闭环持续优化。用户只要提到“做一个 skill”“改造 skill”“跑评测/benchmark”“验证 skill 效果”“优化 description 触发率”等场景,都应优先使用此技能。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
创建新 skills、改造已有 skills、并通过评测闭环持续优化。用户只要提到“做一个 skill”“改造 skill”“跑评测/benchmark”“验证 skill 效果”“优化 description 触发率”等场景,都应优先使用此技能。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
当用户需要创建、读取、编辑或转换 Word 文档(.docx)时必须使用本技能。触发场景包括:提到 Word/docx、报告/备忘录/正式函件输出、目录和页眉页脚、批注或修订模式、替换文档内容、插入或替换图片、从 docx 提取结构化内容等。若目标交付物是 .docx,本技能应优先触发。不要用于 PDF、电子表格、Google Docs API 或无关编程任务。
只要任务涉及 PDF 输入或输出,就应优先使用本技能。包括:读取/抽取文本与表格、合并拆分、旋转页面、加水印、创建新 PDF、填写表单、加解密、提取图片、扫描件 OCR 等。用户提到 `.pdf` 文件名或要求交付 PDF 时都应触发。
只要任务与 .pptx 有关(输入、输出或两者都有),就应触发本技能。包括:创建演示文稿、读取提取内容、修改现有模板、合并拆分页面、处理版式/讲稿/批注等。用户提到 deck/slides/presentation 或具体 .pptx 文件时,即便最终用途是摘要或邮件,也应使用本技能。
当用户任务以电子表格文件为核心输入或输出时必须使用本技能。涵盖 .xlsx/.xlsm/.csv/.tsv 的读取、清洗、修复、建模、公式计算、格式化、图表、模板更新与格式转换。用户只要提到某个表格文件路径并要求处理或产出表格,都应触发本技能。若主要交付物不是电子表格(如 Word/HTML/数据库流水线/Google Sheets API 集成),则不应触发。
使用 p5.js 创建具有确定性随机和交互式参数探索的算法艺术。当用户请求使用代码创作艺术、生成式艺术、算法艺术、流场或粒子系统时使用此技能。创建原创的算法艺术而非复制现有艺术家的作品,以避免版权侵犯。
将 Anthropic 的官方品牌颜色和排版应用于任何可能受益于 Anthropic 外观和感觉的 artifact。当品牌颜色或风格指南、视觉格式或公司设计标准适用时使用它。
SOC 직업 분류 기준
| name | skill-creator |
| description | 创建新 skills、改造已有 skills、并通过评测闭环持续优化。用户只要提到“做一个 skill”“改造 skill”“跑评测/benchmark”“验证 skill 效果”“优化 description 触发率”等场景,都应优先使用此技能。 |
用于“创建 -> 评测 -> 迭代 -> 优化触发”的完整工作流技能。
先判断用户当前在哪个阶段,再补齐下一步:
如果用户明确说“不需要完整评测流程”,可降级为轻量协作;否则默认走标准闭环。
根据用户熟悉度调节术语密度:
evaluation、benchmarkJSON、assertion 等术语,若用户没有明显技术背景,先用一句话解释再使用目标是“专业但不堆术语”。
若当前对话里已包含可复用流程,先从历史中提取:
然后确认以下 4 点:
默认建议:
主动补齐:
测试提示词(eval prompts)在这一步完成前不要急着写。
至少落实:
namedescription(这是触发核心,必须写清“做什么 + 何时用”)description 要稍偏“主动触发”,避免 under-trigger。
示例(表达方式):
用于生成仪表盘用于生成仪表盘。凡是用户提到 dashboard、指标可视化、看板、业务监控、数据展示,即便没说“仪表盘”,也应触发此技能。skill-name/
├── SKILL.md (required)
└── optional resources
├── scripts/
├── references/
└── assets/
渐进披露:
SKILL.md 触发后加载(建议 <500 行,必要时可超)scripts/references/assets 按需读取设计要点:
references/SKILL.md 中要明确指向这些参考文件,告诉模型何时读MUST,多解释“为什么要这样做”写完草稿后,先准备 2-3 条真实用户风格测试提示词,并与用户确认。
把测试集存到 evals/evals.json(先写 prompts,断言可后补):
{
"skill_name": "example-skill",
"evals": [
{
"id": 1,
"prompt": "User's task prompt",
"expected_output": "Description of expected result",
"files": []
}
]
}
完整 schema 见 references/schemas.md。
不要使用 /skill-test 或其他测试 skill;按下面连续完成。
工作目录规范:
<skill-name>-workspace/iteration-1/, iteration-2/eval-0/, eval-1/每个测试用例同轮启动两路:
with_skill基线策略:
without_skillcp -r <skill-path> <workspace>/skill-snapshot/)每个 eval 写 eval_metadata.json(此时 assertions 可先空):
{
"eval_id": 0,
"eval_name": "descriptive-name-here",
"prompt": "The user's task prompt",
"assertions": []
}
不要干等任务结束。并行完成:
eval_metadata.json 与 evals/evals.json主观任务不强行量化;以人工评审为主。
子任务完成通知里会出现 total_tokens 与 duration_ms,这是唯一可靠来源。必须立即写入各运行目录 timing.json:
{
"total_tokens": 84852,
"duration_ms": 23332,
"total_duration_seconds": 23.3
}
评分(grading)
逐 run 生成 grading.json。数组字段必须是 text、passed、evidence(viewer 依赖这些字段名)。
聚合 benchmark
在 skills/skill-creator/ 目录运行:
python -m scripts.aggregate_benchmark <workspace>/iteration-N --skill-name <name>
生成 benchmark.json 与 benchmark.md。
agents/analyzer.md 检查:nohup python <skill-creator-path>/eval-viewer/generate_review.py \
<workspace>/iteration-N \
--skill-name "my-skill" \
--benchmark <workspace>/iteration-N/benchmark.json \
> /dev/null 2>&1 &
VIEWER_PID=$!
如果是第 2 轮及以后,加 --previous-workspace <workspace>/iteration-<N-1>。
无图形/远程环境:使用 --static <output_path> 生成静态 HTML。用户点击提交后会下载 feedback.json,再拷回 workspace。
Outputs 看样例输出并填写反馈Benchmark 看量化对比用户评审完成后读取 feedback.json,优先处理有明确投诉的用例;空反馈视为通过。
结束后关闭 viewer:
kill $VIEWER_PID 2>/dev/null
改进时遵守 4 条:
scripts/迭代循环:
iteration-(N+1) 重新跑全部测试与 baseline--previous-workspace 再开 viewer停止条件:
需要更严格比较两个版本时:
agents/comparator.mdagents/analyzer.md 分析胜因多数场景下,人审 + benchmark 已够用。
SKILL.md frontmatter 的 description 决定触发概率。建议在 skill 稳定后再做。
准备 20 条 query(建议 8-10 条应触发 + 8-10 条不应触发):
[
{"query": "the user prompt", "should_trigger": true},
{"query": "another prompt", "should_trigger": false}
]
质量标准:
用模板 assets/eval_review.html:
__EVAL_DATA_PLACEHOLDER____SKILL_NAME_PLACEHOLDER____SKILL_DESCRIPTION_PLACEHOLDER__/tmp/eval_review_<skill>.html)并打开eval_set.json~/Downloads 读取最新导出文件后台执行:
python -m scripts.run_loop \
--eval-set <path-to-trigger-eval.json> \
--skill-path <path-to-skill> \
--model <model-id-powering-this-session> \
--max-iterations 5 \
--verbose
要点:
best_description,避免过拟合 trainclaude -p 执行,不需要单独配置 ANTHROPIC_API_KEY执行期间需定期向用户同步迭代进度与得分变化。
best_description 回写 SKILL.md技能只会在 Claude 认为“有必要调用 skill”时触发。简单一步请求即使语义匹配,也可能不触发。
因此触发评测 query 要足够“复杂且值得调用 skill”。
如环境支持,执行:
python -m scripts.package_skill <path/to/skill-folder>
然后返回 .skill 产物路径给用户。
在 Claude.ai(无子任务并发)场景:
run_loop.py/run_eval.py 依赖 CLI 能力,受环境限制时可跳过/tmp/<skill-name>/ 再编辑与打包在 Cowork 场景:
generate_review.py --staticrun_loop.py / run_eval.py 通常可用,建议放在技能收敛后执行agents/:
agents/grader.md:断言评分规范agents/comparator.md:盲测比较流程agents/analyzer.md:benchmark 诊断方法references/:
references/schemas.md:evals.json、grading.json、benchmark.json 等结构定义