用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/kwakseongjae/oh-my-design --skill omd-lab-02-design-harness命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | omd-lab-02-design-harness |
| description | OmD Lab |
omd:harness의 정교화 작업을 위한 실험실. 동일한 design task를 서로 다른 하네스 설정 (v1, v2, v3, ...)으로 돌려서 품질·비용·실패모드를 비교한다.
Lab #01이 "DESIGN.md 유무"의 영향을 봤다면, Lab #02는 하네스 자체의 설정(prompt 변형, persona pool, eval rubric, asset 정책 등)이 산출물에 미치는 영향을 본다.
skills/omd-lab-02-design-harness/
├── SKILL.md (this file)
├── playbooks/
│ ├── v1.md (현재 baseline — first full implementation)
│ ├── v2.md (다음 실험 가설)
│ └── ...
├── runs/
│ ├── v1-run-<ts>-<slug>/ ← omd:harness가 v1 설정으로 돌린 산출물 전체
│ ├── v2-run-<ts>-<slug>/
│ └── ...
├── compare/
│ ├── README.md (어떤 task로 어떤 v를 비교했는가)
│ └── <task-id>/
│ ├── index.html (v1 vs v2 vs v3 동시 비교 뷰)
│ └── metrics.json (집계 비교 지표)
└── postmortem-aggregate.md (전 v 누적 학습)
playbooks/v<N>.md 작성. 가설을 한 줄로:
## Hypothesis
v2 raises persona ABANDON budget from 3s → 5s, expecting fewer false-abandon and more useful friction signal.
playbooks/v<N>/agents-overrides/*.md로 patch 보관.# 운영자가 수동 실행
omd harness "<task>" --lab v2
# 또는 사용자가 자연어:
# "이 task를 lab v2 설정으로도 돌려서 v1과 비교해줘"
--lab v<N>이 들어오면:
runs/v<N>-run-<ts>-<slug>/ 디렉토리에 산출물 적재.claude/agents/에 덮어씌운 채 실행 (run 종료 시 원복)lab_version: v<N> 기록운영자가 동일 task에 대해 v1, v2, ..., vN의 run을 끝내면:
omd lab compare --task "<task-slug>" --versions v1,v2,v3
이게 compare/<task-slug>/index.html을 만든다. 4-패널 (또는 N-패널) 비교:
{
"task": "토스 스타일 가족 식단 앱 메인",
"versions": {
"v1": {
"iterations": 2,
"total_tokens_estimated": 320000,
"persona_abandon_rate": 0.5,
"deterministic_pass_rate": 1.0,
"jury_score_normalized": 0.72,
"time_to_handoff_min": 18,
"user_satisfied": "?"
},
"v2": { ... }
},
"delta_v1_v2": "v2 reduced persona_abandon_rate by 0.25 but raised total_tokens by 12% — net win on signal quality"
}
| v | hypothesis | status |
|---|---|---|
| v1 | First full implementation — 8 agents, 10 phases, 3 user checkpoints | active baseline |
| v2 | (TBD) | pending |
| v3 | (TBD) | pending |
playbooks/v1.md가 baseline 정의. 운영자는 매 회 새 가설로 v.md를 추가한다.
매 lab run 종료 시, run의 postmortem.md에서 cross-version-relevant 신호만 발췌해 postmortem-aggregate.md에 누적:
이게 다음 v의 가설을 만들어낸다.
사용자: "토스 스타일 결제 화면 — Lab #02로 v1, v2 비교"
→ Claude: omd harness "..." --lab v1 실행 → v1-run 적재
→ (사용자 체크포인트 진행, ship 결정)
→ Claude: omd harness "..." --lab v2 실행 (동일 brief 재사용 가능)
→ omd lab compare --task <slug> --versions v1,v2
→ compare/<slug>/index.html 결과 제시
基于 SOC 职业分类