Os termos abaixo ajudam a ler documentação e conversar com equipes técnicas. Não é necessário memorizá-los todos antes de começar.
| Termo | Significado e uso prático |
|---|---|
| Prompt | Pedido que orienta a tarefa enviada ao modelo. |
| Prompt Engineering | Projeto, teste e melhoria de instruções para uma finalidade. |
| LLM | Modelo de linguagem de grande porte: sistema treinado para processar e gerar linguagem, entre outras capacidades. |
| Modelo | Componente que produz a resposta; não é necessariamente o aplicativo inteiro. |
| Aplicativo de IA | Interface e recursos que envolvem o modelo, como arquivos, memória e ferramentas. |
| API | Meio pelo qual um software faz pedidos a outro; permite integrar modelos a sistemas. |
| Contexto | Informações disponíveis ao modelo no pedido e no histórico enviado. |
| Janela de contexto | Limite de conteúdo que um modelo pode considerar em determinada chamada/configuração. |
| Token | Unidade de processamento de texto; não equivale sempre a uma palavra ou caractere. |
| Instrução de sistema/desenvolvedor | Orientação configurada pelo aplicativo para definir comportamento e limites, conforme a plataforma. |
| Zero-shot | Pedido sem exemplos demonstrativos da tarefa. |
| Few-shot | Pedido com alguns exemplos de entrada e saída desejadas. |
| Exemplo contrastante | Caso parecido com outro, mas com resposta diferente por uma regra relevante. |
| Decomposição | Separar um problema em partes mais simples e verificáveis. |
| Self-Ask | Abordagem que usa perguntas auxiliares para resolver uma pergunta maior; nesta coleção, com respostas verificáveis. |
| Chain-of-Thought | Conceito de raciocínio intermediário encadeado. Não exige acesso ao processo interno privado do modelo. |
| Tree of Thoughts | Exploração e avaliação de caminhos alternativos de solução; um único pedido com três opções é apenas uma adaptação simplificada. |
| Template | Modelo de prompt com campos variáveis para reutilização. |
| Variável | Campo substituído pelo dado do caso, como [DADOS]. |
| Baseline | Versão de referência usada como ponto de comparação. |
| Variante | Versão alterada para testar uma hipótese de melhoria. |
| A/B test | Comparação controlada de duas versões; pode ser avaliação offline pareada ou experimento online com grupos. |
| Avaliação offline | Teste em casos preparados, sem expor necessariamente clientes à resposta. |
| Experimento online | Comparação no uso real, com desenho de distribuição e controles adequados. |
| Dataset | Conjunto organizado de dados ou casos. |
| Caso de teste | Entrada e comportamento esperado usados para verificar uma situação específica. |
| Golden answer | Referência revisada; pode definir fatos, campos e comportamentos, sem exigir uma frase exata. |
| Ground truth | Referência tratada como verdade para avaliação; deve ser verificada e pode conter erros. |
| Rubrica | Descrição dos critérios e do significado de cada nota. |
| Scorecard | Registro organizado das notas e verificações de uma resposta. |
| Scoring | Atribuição de pontos segundo a rubrica. |
| Pass/Fail | Aprovado ou reprovado por uma regra objetiva. |
| Gate | Condição eliminatória que precisa ser cumprida para avançar. |
| Taxa de sucesso | Proporção de execuções ou casos aprovados; declare qual denominador está usando. |
| Precisão factual | Grau de correção das afirmações em relação às fontes pertinentes. |
| Precision em classificação | Entre itens previstos como positivos, proporção realmente positiva; não é sinônimo de acurácia geral. |
| Recall | Entre positivos reais, proporção encontrada pelo sistema; útil para não perder incidentes críticos. |
| Acurácia | Proporção de classificações corretas entre todos os casos. |
| Completude | Presença das informações necessárias, sem exigir conteúdo irrelevante. |
| Aderência | Cumprimento das instruções e restrições aplicáveis. |
| Relevância | Quanto a resposta ajuda a resolver a necessidade solicitada. |
| Clareza | Facilidade de compreender e usar a resposta. |
| Alucinação | Informação apresentada sem sustentação ou incorreta; a rubrica deve definir exatamente o que será contado. |
| Fundamentação | Apoio de uma afirmação nas fontes; na RUB-1, indicador derivado de 5 menos H. |
| Abstenção | Não dar uma conclusão que os dados não permitem, sinalizando a lacuna. |
| Consistência | Estabilidade de comportamento entre execuções; pode haver estabilidade no erro. |
| Latência | Tempo até a resposta ou conclusão da tarefa; especifique onde começa e termina a medição. |
| Mediana | Valor central das observações ordenadas; ajuda a resumir uma distribuição sem depender só da média. |
| p95 | Percentil 95: medida de cauda da distribuição. Seu cálculo e interpretação exigem cuidado em amostras pequenas. |
| Custo por aprovado | Custo de todas as tentativas dividido pela quantidade aprovada; não confundir com custo só das tentativas boas. |
| Avaliação cega | Avaliação que oculta qual versão ou modelo gerou a resposta. |
| LLM-as-a-judge | Uso de um modelo para auxiliar na avaliação de outro resultado. |
| Calibração de avaliadores | Ajuste de entendimento da rubrica comparando exemplos e divergências. |
| Viés de posição | Preferência indevida por resposta apresentada primeiro ou em certa posição. |
| Viés de verbosidade | Preferência indevida por resposta longa, mesmo quando ela não é melhor. |
| Confundidor | Fator que mudou junto com o prompt e pode explicar a diferença observada. |
| Contaminação/vazamento | Uso indevido de informação do teste durante ajuste ou geração, produzindo avaliação excessivamente favorável. |
| Conjunto de desenvolvimento | Casos utilizados para criar e corrigir o prompt. |
| Conjunto de validação | Casos usados para escolher entre versões durante o desenvolvimento. |
| Holdout / teste final | Conjunto separado da otimização para uma avaliação final mais honesta. |
| Regressão | Caso antes correto que piora após uma mudança. |
| Intervalo de confiança | Faixa calculada sob hipóteses estatísticas para expressar incerteza; não garante que a operação futura estará na faixa. |
| Significância estatística | Evidência contra uma hipótese estatística segundo um critério; não mede sozinha importância prática. |
| Prompt injection | Instrução não confiável dentro de conteúdo que tenta desviar o comportamento do sistema. |
| RAG | Recuperação de documentos para apoiar a geração. Melhorar busca e melhorar resposta são problemas relacionados, mas distintos. |
| Saída estruturada | Resposta seguindo um esquema de campos. Forma válida não garante conteúdo correto. |
| JSON | Formato de dados estruturados. Nesta coleção, tabelas podem substituí-lo nas atividades sem programação. |
| Ferramenta determinística | Componente com regras explícitas, como cálculo ou validação de campos, em vez de geração livre. |
| HITL / revisão humana | Participação humana em decisão, aprovação ou verificação importante. |
| Observabilidade | Registros que permitem entender o que entrou, o que ocorreu, o resultado e onde houve falha. |
| Versionamento | Registro identificável de alterações para comparar, reproduzir e recuperar versões. |
| Drift / mudança de distribuição | Mudança no tipo de entrada ou condições de uso que pode alterar desempenho. |
| Rollback | Retorno a uma versão ou estado anterior conhecido. |
| Piloto assistido | Uso limitado com supervisão e escopo definido antes de ampliar a operação. |
Atenção à ambiguidade: nesta apostila, “precisão: 0 a 5” significa precisão factual avaliada por rubrica. Quando a discussão for sobre classificação binária, use os nomes precision, recall e acurácia com suas fórmulas, para não misturar conceitos. [S07 a S10]
Plano de estudos: 7 dias
Ritmo sugerido: 45 a 75 minutos de estudo e prática por dia, ajustável à disponibilidade. Esta é uma trilha inicial: não significa dominar todas as técnicas nem liberar um sistema de produção em uma semana. Escolha uma tarefa pequena e mantenha o mesmo projeto ao longo dos dias.
| Dia | Estudo e prática | Entregável | Como conferir |
|---|---|---|---|
| 1 | Playbook 01; exercícios 01 a 03 | Prompt baseline para uma tarefa de baixo risco | Objetivo, fonte, limite e formato definidos; nenhum fato novo |
| 2 | Playbooks 02 a 03; exercícios 04 a 06 | Versão zero-shot e versão few-shot | Exemplos corretos e separados dos casos de teste |
| 3 | Playbooks 04 a 07; exercícios 07 a 10 | Template com decomposição ou alternativas, somente se necessário | Premissas, contas e lacunas verificáveis |
| 4 | Playbooks 08 a 10; exercícios 11 a 13 | Cinco a dez casos e uma rubrica | Referências revisadas antes das respostas |
| 5 | Laboratório A/B; exercícios 14 a 17 | Comparação registrada de A e B | Taxa, pontuação, regressões e custos separados |
| 6 | Playbooks 11 a 14; exercícios 18 a 19 | Correção prioritária, nova versão e ficha da biblioteca | Sem usar teste final repetidamente para otimizar |
| 7 | Playbook 15; exercício 20 | Miniprojeto apresentado a outra pessoa | Outra pessoa entende a decisão e as limitações |
Critério de conclusão: apresentar prompt, casos, respostas e avaliação que outra pessoa consiga verificar. Um empate ou uma variante pior também concluem o estudo com sucesso, desde que a análise esteja correta. Depois, aprofunde os módulos menos compreendidos em vez de acrescentar técnicas por obrigação.
Plano de estudos: 30 dias
Ritmo sugerido: 30 a 60 minutos por dia, com mais tempo opcional nos projetos. Os primeiros dias privilegiam clareza; a segunda metade privilegia evidência e uso repetível. O calendário é uma proposta de aprendizagem, não um prazo de implantação comercial.
| Dia | Foco | Produção do dia | Critério de avanço |
|---|---|---|---|
| 01 | Escolher tarefa e finalidade | Cartão do problema | Uma decisão ou entrega concreta, de baixo risco |
| 02 | Objetivo, contexto e fonte | Baseline v0.1 | Outra pessoa entende o pedido |
| 03 | Ausências e formato | Três casos simples | Nenhum preenchimento fictício |
| 04 | Zero-shot | Classificador com definições | Categorias permitidas e caso indefinido |
| 05 | Few-shot | Três exemplos revisados | Exemplos corretos e distintos |
| 06 | Exemplos contrastantes | Dois pares próximos | A diferença relevante está explicada |
| 07 | Revisão da primeira semana | Baseline v0.2 e registro | Mudanças pequenas e justificadas |
| 08 | Decomposição | Perguntas auxiliares | Cada parte ajuda a resolver a tarefa |
| 09 | Contas e premissas | Cálculo conferido | Unidade e fórmula corretas |
| 10 | Alternativas | Matriz de decisão | Restrições eliminatórias primeiro |
| 11 | Robustez | Template preenchível | Lacunas e conflitos tratados |
| 12 | Injeção de prompt | Dois testes adversos | Conteúdo não vira autorização |
| 13 | Critérios objetivos | Checklist de aceite | Itens observáveis |
| 14 | Rubrica 0 a 5 | Rubrica com âncoras | Notas têm descrições e exemplos |
| 15 | Dataset | Dez casos diversos | Referências revisadas |
| 16 | Separação de conjuntos | Registro de origem/uso | Teste final separado do ajuste |
| 17 | Hipótese de variante | Prompt B | Principal alteração identificável |
| 18 | Execução controlada | Respostas A/B salvas | Mesmas entradas e condições |
| 19 | Avaliação humana | Notas com evidência | Avaliador não sabe a versão, quando viável |
| 20 | Juiz LLM | Avaliação auxiliar | Comparada à revisão humana |
| 21 | Métricas | Taxas, médias e regressões | Denominadores explícitos |
| 22 | Custo e latência | Indicadores operacionais | Medição ou simulação identificada |
| 23 | Variabilidade | Repetições de casos difíceis | Consistência separada de correção |
| 24 | Análise de erros | Três causas prioritárias | Evidências e impacto documentados |
| 25 | Iteração mínima | Nova candidata | Correção não quebra os casos anteriores |
| 26 | Avaliação final | Teste ainda não usado | Sem ajuste orientado ao resultado final |
| 27 | Versionamento | Ficha completa | Prompt, fonte, modelo e rubrica identificados |
| 28 | Uso assistido | Plano de revisão e retorno | Responsável e gatilhos de interrupção |
| 29 | Apresentação | Relatório de uma página | Decisão, provas e limites claros |
| 30 | Revisão e próximos passos | Backlog de melhoria | Prioridade por falha real, não por técnica da moda |
Autoavaliação final
Você consegue explicar por que uma resposta foi aprovada? Consegue reproduzir um teste? Diferencia opinião do juiz de evidência? Sabe dizer quando faltam dados? Consegue manter uma versão simples porque uma mais longa não melhorou? Se as respostas forem positivas, você tem uma base prática sólida para continuar.
Escolha o próximo nível pela matriz de maturidade, não pela quantidade de dias cumpridos. Não é necessário adotar automação ou programação para alcançar bons resultados em tarefas assistidas.