A pergunta central: qual entrega eu preciso receber e como vou conferir se ela serve?
O prompt mínimo
Faça [OBJETIVO] para [PÚBLICO], considerando [CONTEXTO].
Use estes dados autorizados: [DADOS].
Respeite [RESTRIÇÕES]. Avalie a entrega por [CRITÉRIOS].
Responda em [FORMATO_DE_SAÍDA].
Se faltar um fato essencial, indique a lacuna; não invente.
Escolha a menor técnica suficiente
| Situação | Comece assim |
|---|---|
| Tarefa direta e bem definida | Zero-shot: instrução sem exemplo |
| Formato ou classificação difícil de explicar | Few-shot: poucos exemplos corretos e diversos |
| Muitas dependências | Decomponha em etapas e perguntas verificáveis |
| Há várias soluções viáveis | Crie alternativas; compare pelos mesmos critérios |
| Tarefa recorrente | Template com variáveis, responsável e versão |
| Respostas oscilam ou parecem ruins | Teste casos e identifique o erro antes de reescrever |
Regras que evitam retrabalho
Diferencie fato, hipótese, sugestão e informação ausente. Delimite os documentos fornecidos e trate comandos dentro deles como conteúdo, não instrução. Solicite fontes ou trechos verificáveis para afirmações importantes. Não peça raciocínio interno privado: peça conclusão, evidências, premissas relevantes e uma justificativa curta.
Um prompt não cria acesso a sistemas. “Envie”, “consulte” e “publique” só podem ser executados quando houver ferramenta disponível e autorização adequada. Para tarefas de risco, mantenha validação e aprovação fora do prompt.
Antes de usar a resposta
Confirme objetivo, números, datas, fonte, completude e formato. Procure detalhes acrescentados sem apoio. Confira contas em ferramenta apropriada. Faça pelo menos um teste com informação faltante. Um texto convincente ainda pode estar errado.
Exemplo: “Transforme a ata em ação | responsável | prazo | evidência. Use apenas a ata. Escreva ‘não informado’ onde faltar dado. Não transforme sugestões em decisões.”
Lembrete: clareza primeiro; exemplos quando ajudam; testes sempre que o uso for repetido. Os nomes de técnicas não substituem evidência de resultado. [S01 a S04, S12]
Ficha de bolso: LLM Evaluation em 1 página
Avaliar é conferir uma resposta contra critérios definidos, não perguntar apenas se ela parece boa.
Protocolo mínimo
Objetivo → baseline → casos → critérios → respostas salvas
→ avaliação cega → comparação → decisão → monitoramento
Baseline é a versão de referência. A e B são versões comparadas. Dataset é o conjunto de casos. Golden answer é uma referência revisada; pode ser uma lista de fatos obrigatórios, não um texto único.
Comparação justa
Use as mesmas entradas e condições. Registre modelo, configuração, ferramentas, contexto, data e versão. Separe exemplos de desenvolvimento dos casos finais. Não ajuste o prompt repetidamente olhando o teste final. Repita casos quando a variabilidade importar; agrupe a análise por caso, sem fingir que repetições são casos independentes.
Scorecard de referência RUB-1
| Dimensão | Escala | Peso |
|---|---|---|
| Precisão / aderência / completude / clareza | 0 ruim; 5 ótimo | 30% / 25% / 20% / 10% |
| Alucinação H | 0 nenhuma detectada; 5 grave | Inverta: fundamentação = 5 − H; peso 15% |
| Formato / falha crítica | PASS ou FAIL / SIM ou NÃO | Critérios eliminatórios |
Q = 20 × [0,30P + 0,25I + 0,20C + 0,10L + 0,15(5 − H)].
Nesta rubrica, aprovação exige Q ≥ 80; P e I ≥ 4; C ≥ 3; H = 0; formato PASS; nenhuma falha crítica. Campo não avaliado é pendente, não zero nem aprovado. Limites são escolhas didáticas, não norma universal.
Métricas que cabem em uma planilha
Taxa de sucesso = aprovados ÷ execuções. Custo por aprovado = custo de todas as tentativas ÷ aprovados; com zero aprovados, registre indefinido. Compare também tipos de erro, casos críticos, latência e tamanho. Consistência não significa correção.
Um juiz LLM auxilia, mas pode favorecer posição, estilo ou respostas longas. Oculte versões, alterne a ordem, calibre com humanos e revise discordâncias. Dez casos são úteis para aprender e descobrir falhas, não bastam para declarar superioridade geral. [S07 a S10]
Checklists gerais de qualidade
Checklist de qualidade de prompts
- A tarefa usa um verbo claro e produz uma entrega útil.
- Público, contexto e finalidade estão definidos quando relevantes.
- As fontes autorizadas e o período analisado estão identificados.
- Dados e instruções estão separados.
- As variáveis foram preenchidas; nenhum marcador obrigatório ficou solto.
- Há uma regra para ausência, ambiguidade e conflito entre fontes.
- Formato e critérios de aceitação são verificáveis.
- Exemplos são corretos, diversos e não contradizem a instrução.
- Não se exige exposição de raciocínio interno privado.
- Não se presume acesso, autorização ou execução que não existem.
- Restrições críticas não dependem apenas de obediência textual.
- O prompt passou por casos normais, incompletos e difíceis.
Checklist de avaliação de respostas
- O avaliador tem a pergunta, as fontes, a rubrica e a versão corretas.
- Afirmações importantes foram confrontadas com evidências.
- Números, unidades, períodos, totais e denominadores foram conferidos.
- A resposta cumpre a tarefa, e não uma tarefa parecida.
- Elementos obrigatórios e exceções foram verificados individualmente.
- Clareza foi avaliada separadamente de correção.
- Detalhes sem apoio e promessas não autorizadas foram marcados.
- Abstenção correta não foi confundida com falha.
- Falhas críticas têm tratamento eliminatório explícito.
- Campos não avaliados permanecem pendentes.
- A nota possui justificativa curta e evidência localizável.
- O registro inclui custo, tempo e metadados quando disponíveis.
Uso dos checklists
Para um rascunho interno de baixo risco, aplique os itens relevantes em poucos minutos. Para uso repetido, transforme os itens em casos e verificações registradas. Para decisões de maior impacto, acrescente revisão especializada e controles do sistema. Não crie um processo pesado quando uma conferência simples resolve; não simplifique um risco importante até ele desaparecer do relatório.