Skip to main content

benchmark

Personal model benchmark built from YOUR own Claude Code history. Use when the user says /benchmark, "benchmark this model", "is <model> actually better", "test the new model on my workload", or when Claude Code upgrades to a new default model and they want a verdict grounded in THEIR tasks instead of public benchmarks. First run walks a setup wizard; after that it replays a frozen eval pack headlessly against any model or effort level and produces before/after scorecards.

Ir para a instalação

Informações da origem

Repositório
earlyaidopters/gumroad-resources
Última atividade na origem
10 de agosto de 2026 às 22:16
Idioma detectado do SKILL.md
inglês
Estrelas
26
Forks
16

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.