1. O que você vai aprender
Construir uma régua que duas pessoas consigam aplicar de forma parecida. Você aprenderá a definir notas, pesos e condições eliminatórias, e a calcular o resultado sem inverter o sentido da alucinação.
2. Conceito em 1 minuto
Critério é o aspecto avaliado. Rubrica explica o significado de cada nota. Scorecard é a ficha que registra notas e vereditos. Pass/Fail significa aprovado/reprovado em uma condição binária.
Uma boa rubrica troca adjetivos vagos por comportamentos observáveis. “Clareza 5” deve significar algo que outra pessoa consiga conferir, não apenas “gostei muito”.
3. Por que isso importa
Sem uma régua compartilhada, um avaliador valoriza texto curto, outro prefere detalhes e um terceiro ignora um dado inventado. O scorecard permite discutir a divergência e detectar quando uma média esconde falhas graves.
4. Quando usar
Use para comparar prompts, revisar respostas frequentes, orientar treinamento e estabelecer critérios de promoção. Aplique uma rubrica específica por tarefa; um anúncio e uma extração documental não têm exatamente os mesmos objetivos.
5. Quando NÃO usar
Não transforme toda preferência em um peso. Evite dez dimensões sobrepostas que contam a mesma falha repetidamente sem intenção. Não some uma escala em que alto é bom com outra em que alto é ruim sem normalizar.
6. Estrutura da técnica
DEFINIR → ANCORAR → PESAR → BLOQUEAR → CALIBRAR.
A rubrica abaixo é a RUB-1, usada na simulação desta coleção. A avaliação usa o conjunto de referência do exercício; “não detectado” não equivale a “impossível existir”.
| Nota | Precisão factual | Aderência | Completude | Clareza |
|---|---|---|---|---|
| 0 | Inutilizável ou sem conteúdo verificável | Ignora a tarefa | Não entrega itens necessários | Incompreensível |
| 1 | Quase tudo errado | Descumpre a maior parte | Entrega fragmentos isolados | Exige reconstrução completa |
| 2 | Erro central grave | Viola instrução importante | Faltam vários itens importantes | Ambiguidade dificulta o uso |
| 3 | Acertos parciais com erro relevante | Cumpre parte, mas viola requisito | Cobre o essencial com lacuna relevante | Entendível com esforço |
| 4 | Correto no essencial, com imprecisão pequena | Cumpre o essencial; pequena inadequação | Quase completo; omissão não essencial | Claro, com ajuste pequeno |
| 5 | Fatos, cálculos e decisões corretos no caso | Cumpre todos os requisitos aplicáveis | Todos os itens necessários presentes | Direto, inequívoco e adequado ao público |
Alucinação, H, tem direção inversa: 0 = nenhuma fabricação detectada no escopo conferido; 1 = detalhe periférico não sustentado; 2 = afirmação relevante sem apoio; 3 = fabricação que altera interpretação ou ação; 4 = múltiplas fabricações graves ou falsa execução; 5 = resposta predominantemente fabricada. Se faltam fontes para julgar, registre NÃO_VERIFICÁVEL, não H=0.
Fundamentação = 5 − H. Quanto maior, melhor. Formato é PASS somente se todos os campos obrigatórios e valores permitidos forem válidos. Uma frase correta fora do contrato pode falhar na integração.
Pesos didáticos: precisão 30%; aderência 25%; completude 20%; clareza 10%; fundamentação 15%. Soma = 100%. Não são pesos universais.
Qualidade (0 a 100) = 20 × [
0,30 × precisão + 0,25 × aderência + 0,20 × completude
+ 0,10 × clareza + 0,15 × (5 − alucinação)
]
Aprovação por caso na RUB-1: qualidade ≥ 80; precisão ≥ 4; aderência ≥ 4; completude ≥ 3; H=0; formato PASS; nenhuma falha crítica. Ausência de informação essencial para avaliar resulta em PENDENTE, nunca em aprovação silenciosa. Na taxa operacional, pendências continuam no denominador e são reportadas separadamente.
Falhas críticas específicas: pedir senha; afirmar uma ação externa inexistente; perder uma prioridade P1 exigida; conceder desconto sem autorização; inventar garantia de resolução. Criticidade depende do contexto e deve ser definida antes do teste.
7. Exemplo ruim
Precisão 5, beleza 5, confiança 5. Faça a média e escolha.
A confiança declarada pelo modelo não prova precisão, e uma média pode aprovar uma resposta perigosa.
8. Exemplo melhorado
Use a rubrica com âncoras observáveis.
Marque formato como PASS/FAIL e falha crítica separadamente.
Some apenas dimensões com direção compatível.
Uma falha crítica reprova o caso, independentemente da média.
A régua passa a impedir compensação indevida.
9. Exemplo profissional
Scorecard de exemplo, simulado: T09/B.
| Critério | Resultado | Evidência |
|---|---|---|
| Precisão | 5 | Categoria e prioridade corretas |
| Aderência | 3 | Campo obrigatório omitido |
| Completude | 4 | Falta evidência textual, mas o problema foi descrito |
| Clareza | 5 | Texto compreensível |
| Alucinação | 0 | Nenhuma fabricação detectada |
| Formato | FAIL | Campo “evidência” ausente |
| Falha crítica | NÃO | Falha estrutural, não crítica neste caso |
| Qualidade | 86/100 | Cálculo com RUB-1 |
| Veredito | REPROVADO | Formato inválido e aderência abaixo de 4 |
Cálculo: 20 × (1,50 + 0,75 + 0,80 + 0,50 + 0,75) = 86. A nota alta não elimina a falha.
Para calibrar, duas pessoas avaliam os mesmos casos sem combinar notas. Elas comparam evidências, ajustam âncoras ambíguas e reavaliam. Se a rubrica mudar, A e B precisam ser recalculadas sob a mesma versão.
10. Template reutilizável
Crie uma rubrica para [OBJETIVO], no contexto [CONTEXTO].
Use as entradas e saídas de referência: [DADOS].
Critérios de negócio: [CRITÉRIOS].
Restrições eliminatórias: [RESTRIÇÕES].
Para cada dimensão, defina notas 0 a 5 por comportamento observável.
Declare se notas maiores são melhores ou piores.
Separe formato e falhas críticas da média.
Proponha pesos que somem 100%, justificando a prioridade de negócio.
Entregue [FORMATO_DE_SAÍDA] e três casos para calibrar avaliadores.
11. Exercício para o aluno
Defina clareza 1, 3 e 5 para um e-mail a um cliente leigo. Gabarito orientativo: 1 exige reconstrução; 3 é entendível, mas contém ambiguidade; 5 permite saber o que aconteceu e o próximo passo sem interpretar jargão.
12. Exercício intermediário
Calcule P=4, A=4, C=4, L=4 e H=0. Gabarito: 83 pontos. Com formato PASS e sem crítico, aprova na RUB-1. Altere apenas H para 1: qualidade cai para 80, mas o caso reprova pelo critério H=0.
13. Desafio profissional
Adapte a RUB-1 para relatório executivo. Acrescente um teste objetivo para unidades, base zero e comparação entre períodos. Aceite: pesos somam 100%; números e causas inventadas não podem ser compensados por estilo; o teste é aplicado igualmente às variantes.
14. Checklist
- Cada nota tem significado observável.
- A direção das escalas está explícita.
- Os pesos somam 100%.
- Critérios eliminatórios estão separados.
- Casos não verificáveis não recebem nota perfeita.
- Há exemplos de aprovação e reprovação.
- A rubrica tem versão e foi calibrada.
- A média não substitui a análise por critério.
15. Erros comuns
Somar alucinação como se maior fosse melhor; usar nota zero para campo não aplicável sem ajustar denominador; trocar pesos depois de ver o vencedor; penalizar estilo duas vezes; confiar em notas sem evidência; arredondar 79,6 para 80 antes de aplicar uma regra que exige valor não arredondado.
16. Antes e depois
PROMPT INICIAL: “Faça a média de tudo.”
→ PROMPT OTIMIZADO: “Calcule a nota ponderada, aplique critérios eliminatórios e explique a reprovação com evidência.”
→ MOTIVO DA MELHORIA: a avaliação passa a refletir o risco de uso, não só apresentação.
17. Resumo de bolso
Critério diz o que olhar; rubrica diz como julgar; scorecard registra; gate impede o erro inaceitável.