fablelayer-benchmark
FableLayer blind benchmark, Fable similarity, 비용 절감, Sonnet/Opus/local LLM 비교, RESULTS.md 자동 생성, rubric 설계 요청이면 반드시 사용한다.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
FableLayer blind benchmark, Fable similarity, 비용 절감, Sonnet/Opus/local LLM 비교, RESULTS.md 자동 생성, rubric 설계 요청이면 반드시 사용한다.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
FableLayer PRD, FableLayer MVP, Claude 모델을 Fable 5급 절차 레이어로 업그레이드하는 툴킷, source ledger, benchmark, local LLM adapter, Claude Code plugin, 재실행, 수정, 보완, status, qa 요청이면 반드시 사용한다. 에이전트 팀으로 FableLayer 하네스를 실행한다.
FableLayer 산출물 검증, 게이트 실행, 유출 프롬프트 금칙 검사, 요구사항 완전성 검사, source ledger와 architecture 교차 검증 요청이면 반드시 사용한다.
FableLayer 참고 저장소, Anthropic 공식 문서, Simon Willison 분석, Fable 관련 오픈소스의 source ledger와 license/provenance 감사를 수행한다. 유출 prompt 원문은 복사하지 않고 reference-only 또는 blocked로 기록한다.
| name | fablelayer-benchmark |
| description | FableLayer blind benchmark, Fable similarity, 비용 절감, Sonnet/Opus/local LLM 비교, RESULTS.md 자동 생성, rubric 설계 요청이면 반드시 사용한다. |
FableLayer의 품질 주장을 재현 가능한 benchmark로 환원한다. “Fable 같다”는 인상평이 아니라 blind pairwise rubric, raw JSON, 비용 추정으로 남긴다.
bench/README.md: 실행 방법, fixture 설명.bench/RESULTS.md: 사람이 읽는 요약. 미실행이면 미실행이라고 표시한다._workspace/benchmark_schema.json: raw run schema.