Skip to main content
Execute qualquer Skill no Manus
com um clique

eval-design

Estrelas2
Forks0
Atualizado12 de julho de 2026 às 00:23

Design an LLM/agentic eval that can change a decision — a task + a model or agent under test producing fresh output + a grader — and separate real capability evals from instrumentation (linters, CI gates, KPIs). For proving a harness skill earns its keep, use /skill-eval instead. Use when: designing or critiquing an eval, building an eval corpus, designing or calibrating an LLM-as-judge, or comparing models/harnesses on a measured capability. Trigger: /eval-design.

Instalação

Instalar com Codex ou Claude Copie este prompt, cole no Codex, Claude ou outro assistente e deixe que ele revise a página da skill e instale para você.

Explorador de arquivos
5 arquivos
SKILL.md
readonly