Consulta técnica realizada em 6 de setembro de 2026. Foram priorizadas documentações oficiais e pesquisas dos próprios autores. Os links abaixo identificam a base conceitual; as tabelas, exercícios, mnemônicos, rubrica RUB-1 e dados didáticos desta coleção são construções originais para ensino.
S01: OpenAI
Prompt engineering.
Fonte: https://developers.openai.com/api/docs/guides/prompt-engineering
Uso nesta coleção: Instruções, contexto e exemplos; orientação de prompting, não garantia de qualidade.
S02: OpenAI
Reasoning best practices.
Fonte: https://developers.openai.com/api/docs/guides/reasoning-best-practices
Uso nesta coleção: Pedidos diretos para modelos de raciocínio; não depender de exposição de cadeia interna.
S03: Anthropic
Prompt engineering overview.
Fonte: https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/overview
Uso nesta coleção: Critérios de sucesso e avaliação antes de otimizar; limites do prompting.
S04: Google
Prompt design strategies: Gemini API.
Fonte: https://ai.google.dev/gemini-api/docs/prompting-strategies
Uso nesta coleção: Exemplos variados e consistentes; necessidade de experimentar por modelo e tarefa.
S05: Press et al.
Measuring and Narrowing the Compositionality Gap in Language Models (2022).
Fonte: https://arxiv.org/abs/2210.03350
Uso nesta coleção: Origem do Self-Ask; decomposição e perguntas auxiliares.
S06: Yao et al.
Tree of Thoughts: Deliberate Problem Solving with Large Language Models (2023).
Fonte: https://arxiv.org/abs/2305.10601
Uso nesta coleção: Exploração de estados intermediários, avaliação e busca; não equivale a pedir três opiniões.
S07: OpenAI
Evaluation best practices.
Fonte: https://developers.openai.com/api/docs/guides/evaluation-best-practices
Uso nesta coleção: Conjuntos de avaliação, critérios e combinação de avaliadores. Usado pelos princípios, não como recomendação de uma plataforma específica.
S08: Anthropic
Define success criteria and build evaluations.
Fonte: https://platform.claude.com/docs/en/test-and-evaluate/develop-tests
Uso nesta coleção: Critérios mensuráveis e avaliação por regras, pessoas e modelos.
S09: Zheng et al.
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (2023).
Fonte: https://arxiv.org/abs/2306.05685
Uso nesta coleção: Limitações do juiz: vieses de posição, extensão e preferência por suas próprias respostas.
S10: Anthropic
A statistical approach to model evaluations (2024).
Fonte: https://www.anthropic.com/research/statistical-approach-to-model-evals
Uso nesta coleção: Incerteza de avaliações; dependência entre casos e comparação estatística.
S11: OpenAI
Structured model outputs.
Fonte: https://developers.openai.com/api/docs/guides/structured-outputs
Uso nesta coleção: Estrutura conforme esquema não garante correção do conteúdo; tratar falhas e respostas incompletas.
S12: OWASP Gen AI Security Project
LLM01:2025 Prompt Injection.
Fonte: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
Uso nesta coleção: Conteúdo não confiável pode manipular instruções; proteção exige controles além do prompt.
S13: Anthropic
Demystifying evals for AI agents (2026).
Fonte: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
Uso nesta coleção: Avaliar resultado e estado do ambiente; múltiplas execuções e comportamento operacional.
Limites e interpretação das fontes
Documentação de produto pode mudar após a consulta. Os princípios não dispensam conferir o comportamento do modelo, da interface e das ferramentas disponíveis no momento do uso. A documentação de um fornecedor não comprova desempenho universal nem significa equivalência entre produtos.
Self-Ask e Tree of Thoughts são apresentados a partir das pesquisas citadas. Os exercícios empresariais são adaptações didáticas, não reprodução experimental dos artigos. As orientações sobre comparação, julgamento e estatística foram traduzidas para procedimentos acessíveis; esta coleção não substitui apoio estatístico especializado quando uma decisão exigir evidência inferencial robusta.
As escalas, pesos, limiares, políticas empresariais e metas dos desafios são exemplos que devem ser revisados no contexto de uma organização. Não representam normas legais, garantias de segurança ou padrões obrigatórios de fornecedores. Para dados ou decisões de impacto elevado, use análise específica e revisão qualificada.
A edição não executou comparações reais entre APIs. Respostas A/B, notas, custos e latências dos laboratórios foram construídos para demonstrar cálculo e interpretação. Os arquivos de dados preservam essa identificação. Os cálculos e fórmulas foram conferidos contra os registros do próprio material.