1. O que você vai aprender
Comparar versões de forma justa, calcular indicadores e decidir sem escolher apenas a resposta mais bonita. Você construirá um protocolo, uma tabela por caso e uma conclusão com limites.
2. Conceito em 1 minuto
Baseline é a versão de referência. A e B são nomes dados às configurações comparadas; nesta apostila, A é a baseline e B é a candidata.
Um teste offline roda as duas versões nas mesmas entradas guardadas. Um A/B online distribui casos ou usuários entre versões em uma operação real. O primeiro ajuda a comparar qualidade; o segundo pode medir efeito de negócio, desde que a distribuição e os controles sejam adequados. Avaliações precisam considerar a variabilidade das saídas. [S07]
3. Por que isso importa
Adicionar exemplos, mudar o formato ou trocar uma instrução pode melhorar alguns casos e piorar outros. A tabela por caso permite ver regressões, isto é, comportamentos que antes funcionavam e deixaram de funcionar.
4. Quando usar
Use antes de substituir um prompt recorrente, mudar de modelo, reduzir contexto ou ampliar autonomia. Comece offline. Testes com clientes exigem controles de risco e uma unidade de distribuição coerente, como cliente, conversa ou organização.
5. Quando NÃO usar
Não declare vencedor com uma resposta. Não compare versões em datasets diferentes. Não mude rubrica depois de ver o resultado para favorecer sua preferência. Não experimente uma ação insegura com clientes só para medir conversão.
6. Estrutura da técnica
FIXAR → RODAR → AVALIAR → COMPARAR → CONFIRMAR.
Ficha do experimento: objetivo; hipótese; A; B; alteração testada; versão do modelo; interface; data; parâmetros disponíveis; ferramentas; contexto; dataset; rubrica; limites de custo e tempo; regra de decisão.
Mantenha o mesmo modelo e contexto para isolar uma mudança de prompt. Se mudar prompt, modelo e ferramentas juntos, você estará comparando configurações completas: válido para escolher uma solução, mas insuficiente para atribuir o ganho a uma frase específica.
Dataset de teste é o conjunto de entradas usadas na comparação. Um caso de teste reúne entrada, comportamento esperado e critério de aprovação. Inclua casos normais, incompletos, ambíguos, fora do escopo e críticos. Dez casos são suficientes para o exercício desta apostila, não para garantir desempenho em produção.
Separe três conjuntos: desenvolvimento, usado para ajustar; validação, usado para escolher entre variantes; teste final reservado, usado para confirmação. Não coloque respostas desse último conjunto nos exemplos do prompt. Ao reutilizar o teste final para corrigir uma falha, ele passa a fazer parte do desenvolvimento e deve ser complementado por casos novos.
Em tarefas variáveis, repita cada caso nas mesmas condições. Três repetições são uma sugestão de laboratório, não garantia estatística. Trinta saídas de dez entradas continuam representando dez casos distintos; elas não viram trinta situações independentes. [S10]
7. Exemplo ruim
Aqui estão dois prompts. Qual você acha melhor?
Isso compara a redação dos prompts, não demonstra o desempenho das respostas. Pode servir como revisão preliminar, mas não substitui teste.
8. Exemplo melhorado
Compare as respostas de A e B nos mesmos casos.
Use a rubrica definida antes do teste. Não considere o nome da versão.
Registre nota por critério, falha eliminatória e evidência da avaliação.
Informe vitórias, perdas e empates, além da taxa de aprovação.
O julgamento agora tem unidade de comparação e critérios verificáveis.
9. Exemplo profissional
Exemplo calculado e simulado: dez tickets. A é a triagem baseline; B acrescenta tratamento explícito de ausência e conflito de instrução. O laboratório após os playbooks mostra todas as entradas e notas.
| Indicador | A | B |
|---|---|---|
| Casos aprovados | 6/10 | 9/10 |
| Taxa de sucesso | 60% | 90% |
| Qualidade média, 0 a 100 | 76,8 | 95,5 |
| Falhas críticas | 2 | 0 |
| Custo simulado do lote | R$ 0,18 | R$ 0,26 |
| Custo por aprovado | R$ 0,0300 | R$ 0,0289 |
| Latência média simulada | 1,51 s | 2,14 s |
B melhora três aprovações líquidas: passa quatro casos que A erra, mas perde um que A acerta. O ganho observado é 30 pontos percentuais, ou 50% relativo sobre a taxa de A: (90 − 60) ÷ 60. Não é “30% de melhoria relativa”.
Decisão didática: B é a candidata mais promissora para confirmação, mas precisa corrigir o formato de T09 e passar em casos novos. O conjunto foi construído para ensinar; não comprova superioridade real de qualquer modelo.
10. Template reutilizável
Objetivo do experimento: [OBJETIVO]
Configuração mantida igual: [CONTEXTO]
Hipótese: [HIPÓTESE]
Prompt A: [BASELINE]
Prompt B: [VARIANTE]
Casos e saídas reais ou claramente marcadas como simuladas: [DADOS]
Rubrica e critérios eliminatórios: [CRITÉRIOS]
Limites de custo/latência e regra de escolha: [RESTRIÇÕES]
Compare por caso e apresente [FORMATO_DE_SAÍDA].
Não invente execuções, notas, custos ou latências faltantes.
Separe resultado observado, limitação e próxima confirmação necessária.
11. Exercício para o aluno
Crie A e B para resumir um texto. B deve mudar apenas o formato. Teste em três textos diferentes. Entregável: tabela de requisitos preservados. Gabarito: não basta declarar que “B ficou mais organizado”; conte se os fatos obrigatórios permaneceram.
12. Exercício intermediário
Use o dataset T01 a T10. Faça uma execução por versão em ambiente autorizado e registre respostas sem editar. Aceite: mesmas entradas, rubrica prévia e identificação da configuração. Compare seu resultado real com a simulação apenas como exercício de interpretação, não como meta obrigatória.
13. Desafio profissional
Compare três candidatos e confirme o escolhido em um conjunto reservado. Entregável: ficha, resultados por segmento, custo por aprovado e decisão. Aceite: explicar que testar muitas variantes aumenta a chance de um vencedor aparente e que a confirmação precisa de dados não usados na seleção.
14. Checklist
- A baseline foi identificada.
- Existe uma hipótese de mudança.
- A e B recebem entradas comparáveis.
- A rubrica foi definida antes da leitura das respostas.
- Modelo, ferramentas e configurações foram registrados.
- Falhas críticas são analisadas separadamente.
- Os resultados por caso foram preservados.
- Há confirmação em entradas novas antes de promover a versão.
15. Erros comuns
Escolher a melhor entre várias tentativas de B e comparar com a primeira de A; excluir timeouts; misturar conversas com memórias diferentes; ajustar a rubrica para mudar o vencedor; tratar dez repetições do mesmo caso como dez situações novas; confundir ganho offline com impacto causal em vendas.
16. Antes e depois
PROMPT INICIAL: “B parece melhor; publique.”
→ PROMPT OTIMIZADO: “Compare os mesmos casos, verifique regressões e falhas críticas, confirme a versão candidata em dados reservados e só então decida a promoção.”
→ MOTIVO DA MELHORIA: separa preferência, observação e evidência de prontidão.
17. Resumo de bolso
Mesmo caso, mesma régua, condições registradas. Vencedor observado não é garantia de produção.