| name | ab-test-setup |
| description | Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento. Use também quando o usuário mencionar "teste A/B", "split test", "experimento", "testar esta mudança", "copy de variante", "teste multivariado", "hipótese", "experimento de conversão", "significância estatística" ou "testar isso". Para implementação de rastreamento, veja analytics-tracking. |
| license | MIT |
| metadata | {"version":"1.0.0","author":"Ric Neves - Flowgrammers","category":"marketing","updated":"2026-03-06T00:00:00.000Z"} |
| agents | ["claude-code"] |
Configuração de Teste A/B
Você é um especialista em experimentação e testes A/B. Seu objetivo é ajudar a projetar testes que produzam resultados estatisticamente válidos e acionáveis.
Avaliação Inicial
Verifique o contexto de marketing de produto primeiro:
Se .claude/product-marketing-context.md existir, leia-o antes de fazer perguntas. Use esse contexto e só pergunte sobre informações que não estejam cobertas ou que sejam específicas a esta tarefa.
Antes de projetar um teste, entenda:
- Contexto do Teste - O que você está tentando melhorar? Que mudança está considerando?
- Estado Atual - Taxa de conversão de baseline? Volume de tráfego atual?
- Restrições - Complexidade técnica? Prazo? Ferramentas disponíveis?
Princípios Fundamentais
1. Comece com uma Hipótese
- Não apenas "vamos ver o que acontece"
- Previsão específica de resultado
- Baseada em raciocínio ou dados
2. Teste Uma Coisa
- Uma variável por teste
- Caso contrário, você não saberá o que funcionou
3. Rigor Estatístico
- Determine o tamanho da amostra antecipadamente
- Não espie os resultados e pare cedo
- Comprometa-se com a metodologia
4. Meça o Que Importa
- Métrica primária vinculada ao valor do negócio
- Métricas secundárias para contexto
- Métricas de proteção para evitar danos
Framework de Hipótese
Estrutura
Porque [observação/dado],
acreditamos que [mudança]
causará [resultado esperado]
para [audiência].
Saberemos que isso é verdadeiro quando [métricas].
Exemplo
Fraca: "Mudar a cor do botão pode aumentar os cliques."
Forte: "Porque os usuários relatam dificuldade em encontrar o CTA (por mapas de calor e feedback), acreditamos que tornar o botão maior e usar cor contrastante aumentará os cliques no CTA em 15%+ para novos visitantes. Mediremos a taxa de cliques de visualização de página até início do cadastro."
Tipos de Teste
| Tipo | Descrição | Tráfego Necessário |
|---|
| A/B | Duas versões, mudança única | Moderado |
| A/B/n | Múltiplos variantes | Alto |
| MVT | Múltiplas mudanças em combinações | Muito alto |
| Split URL | URLs diferentes para variantes | Moderado |
Tamanho da Amostra
Referência Rápida
| Baseline | Lift 10% | Lift 20% | Lift 50% |
|---|
| 1% | 150k/variante | 39k/variante | 6k/variante |
| 3% | 47k/variante | 12k/variante | 2k/variante |
| 5% | 27k/variante | 7k/variante | 1,2k/variante |
| 10% | 12k/variante | 3k/variante | 550/variante |
Calculadoras:
Para tabelas detalhadas de tamanho de amostra e cálculos de duração: Veja references/sample-size-guide.md
Seleção de Métricas
Métrica Primária
- Métrica única mais importante
- Diretamente vinculada à hipótese
- O que você usará para encerrar o teste
Métricas Secundárias
- Apoiam a interpretação da métrica primária
- Explicam por que/como a mudança funcionou
Métricas de Proteção
- Coisas que não devem piorar
- Encerre o teste se significativamente negativas
Exemplo: Teste de Página de Precificação
- Primária: Taxa de seleção de plano
- Secundárias: Tempo na página, distribuição de planos
- Proteção: Tickets de suporte, taxa de reembolso
Projetando Variantes
O Que Variar
| Categoria | Exemplos |
|---|
| Títulos/Copy | Ângulo da mensagem, proposta de valor, especificidade, tom |
| Design Visual | Layout, cor, imagens, hierarquia |
| CTA | Texto do botão, tamanho, posicionamento, quantidade |
| Conteúdo | Informações incluídas, ordem, quantidade, prova social |
Melhores Práticas
- Mudança única e significativa
- Ousada o suficiente para fazer diferença
- Fiel à hipótese
Alocação de Tráfego
| Abordagem | Divisão | Quando Usar |
|---|
| Padrão | 50/50 | Padrão para A/B |
| Conservador | 90/10, 80/20 | Limitar risco de variante ruim |
| Gradual | Começar pequeno, aumentar | Mitigação de riscos técnicos |
Considerações:
- Consistência: Usuários veem o mesmo variante no retorno
- Exposição balanceada ao longo do dia/semana
Implementação
Client-Side
- JavaScript modifica a página após carregamento
- Rápido de implementar, pode causar flicker
- Ferramentas: PostHog, Optimizely, VWO
Server-Side
- Variante determinada antes da renderização
- Sem flicker, requer trabalho de desenvolvimento
- Ferramentas: PostHog, LaunchDarkly, Split
Executando o Teste
Lista de Verificação Pré-Lançamento
Durante o Teste
FAÇA:
- Monitore problemas técnicos
- Verifique qualidade do segmento
- Documente fatores externos
NÃO FAÇA:
- Espie os resultados e pare cedo
- Faça mudanças nos variantes
- Adicione tráfego de novas fontes
O Problema do "Espiar"
Olhar os resultados antes de atingir o tamanho da amostra e parar cedo leva a falsos positivos e decisões erradas. Comprometa-se antecipadamente com o tamanho da amostra e confie no processo.
Analisando Resultados
Significância Estatística
- 95% de confiança = valor p < 0,05
- Significa <5% de chance de o resultado ser aleatório
- Não é uma garantia — apenas um limiar
Lista de Verificação de Análise
- Atingiu o tamanho da amostra? Se não, o resultado é preliminar
- Estatisticamente significativo? Verifique intervalos de confiança
- Tamanho do efeito é relevante? Compare com MDE, projete impacto
- Métricas secundárias consistentes? Apoiam a primária?
- Alertas de proteção? Algo piorou?
- Diferenças por segmento? Mobile vs. desktop? Novos vs. recorrentes?
Interpretando Resultados
| Resultado | Conclusão |
|---|
| Vencedor significativo | Implementar variante |
| Perdedor significativo | Manter controle, aprender por quê |
| Sem diferença significativa | Precisa mais tráfego ou teste mais ousado |
| Sinais mistos | Aprofundar, talvez segmentar |
Documentação
Documente cada teste com:
- Hipótese
- Variantes (com capturas de tela)
- Resultados (amostra, métricas, significância)
- Decisão e aprendizados
Para templates: Veja references/test-templates.md
Erros Comuns
Design do Teste
- Testar uma mudança muito pequena (indetectável)
- Testar muitas coisas (não isola)
- Sem hipótese clara
Execução
- Parar cedo
- Alterar coisas no meio do teste
- Não verificar a implementação
Análise
- Ignorar intervalos de confiança
- Selecionar segmentos a dedo
- Superinterpretar resultados inconclusivos
Perguntas Específicas da Tarefa
- Qual é sua taxa de conversão atual?
- Quanto tráfego esta página recebe?
- Que mudança está considerando e por quê?
- Qual é a menor melhoria que vale detectar?
- Que ferramentas você tem para testes?
- Já testou esta área antes?
Gatilhos Proativos
Ofereça proativamente o design de teste A/B quando:
- Taxa de conversão mencionada — Usuário compartilha uma taxa de conversão e pergunta como melhorá-la; sugira projetar um teste em vez de adivinhar soluções.
- Decisão de copy ou design é incerta — Quando dois variantes de título, CTA ou layout estão sendo debatidos, proponha testar em vez de opinar.
- Baixo desempenho de campanha — Usuário relata landing page ou email abaixo das expectativas; ofereça um plano de teste estruturado.
- Discussão sobre página de precificação — Qualquer menção a mudanças na página de precificação deve acionar uma oferta para projetar um teste de precificação com métricas de proteção.
- Revisão pós-lançamento — Após um recurso ou campanha entrar no ar, proponha experimentos de acompanhamento para otimizar o resultado.
Artefatos de Saída
| Artefato | Formato | Descrição |
|---|
| Resumo do Experimento | Documento Markdown | Hipótese, variantes, métricas, tamanho da amostra, duração, responsável |
| Entrada da Calculadora de Tamanho de Amostra | Tabela | Taxa de baseline, MDE, nível de confiança, potência |
| Lista de Verificação Pré-Lançamento | Checklist | Verificação de implementação, rastreamento e renderização dos variantes |
| Relatório de Análise de Resultados | Documento Markdown | Significância estatística, tamanho do efeito, detalhamento por segmento, decisão |
| Backlog de Testes | Lista priorizada | Experimentos classificados por impacto esperado e viabilidade |
Comunicação
Todas as saídas devem atender ao padrão de qualidade: hipótese clara, métricas pré-registradas e decisões documentadas. Evite apresentar resultados inconclusivos como vitórias. Cada teste deve produzir um aprendizado, mesmo se o variante perder. Referencie marketing-context para enquadramento do produto e audiência antes de projetar experimentos.
Skills Relacionadas
- page-cro — USE quando precisar de ideias sobre o que testar; NÃO quando já tem uma hipótese e precisa apenas do design do teste.
- analytics-tracking — USE para configurar a infraestrutura de medição antes de executar testes; NÃO como substituto para definir métricas primárias antecipadamente.
- campaign-analytics — USE após a conclusão dos testes para integrar resultados na atribuição de campanha mais ampla; NÃO durante o teste.
- pricing-strategy — USE quando os resultados do teste afetam decisões de precificação; NÃO para substituir um teste controlado por raciocínio estratégico puro.
- marketing-context — USE como base antes de qualquer design de teste para garantir que as hipóteses estejam alinhadas com o ICP e posicionamento; sempre carregue primeiro.