LLM Engenharia de contexto: Prompting, recuperação e RAG

Controle o que o modelo vê e como o fluxo de trabalho usa essas informações.

Saiba como personas, exemplos, cadeias de prompts, documentos recuperados, RAG, agentes, temperatura e controles de decodificação moldam um fluxo de trabalho repetível com LLMs. Este guia se concentra em contexto e controle; o próximo nível explica a arquitetura subjacente.

Prompting por persona explicado

O prompting por persona pede ao modelo que responda a partir de uma perspectiva profissional específica. A persona deve ser relevante para a tarefa, não teatral. “Atue como gerente sênior de operações de suporte” é útil para fluxos de tickets; “atue como um gênio” normalmente acrescenta pouco.

Exemplo: Para uma resposta padrão da central de ajuda: “Atue como responsável pela qualidade do suporte. Reescreva esta resposta para deixá-la mais curta, mais acolhedora e compatível com a política. Mantenha inalterada a condição de reembolso.”
Comparação lado a lado de prompting com e sem uma instrução de persona.
O prompting por persona fornece ao modelo uma perspectiva, um tom e um nível de detalhe antes da tarefa.

Prompting few-shot explicado

Prompting few-shot significa fornecer alguns exemplos da entrada e do resultado desejado. É especialmente útil quando o formato, o tom ou os limites de classificação são difíceis de descrever. De dois a cinco exemplos precisos costumam ser melhores do que uma explicação abstrata longa.

Exemplo: Uma equipe de produto fornece três exemplos de solicitações confusas de funcionalidades e o formato organizado correspondente para tickets do Jira, e depois pede ao modelo que converta a próxima solicitação seguindo a mesma estrutura.
Diagrama mostrando como exemplos orientam um LLM antes que a tarefa real seja respondida.
O prompting few-shot ensina ao modelo o padrão desejado mostrando exemplos primeiro.

Encadeamento de prompts explicado

O encadeamento de prompts divide uma tarefa complexa em etapas menores. Em vez de pedir pesquisa, estrutura, rascunho, crítica e versão final de uma só vez, você executa uma sequência: extrair fatos, criar a estrutura, escrever o rascunho, avaliar e revisar. Isso melhora o controle e facilita a identificação de erros.

Exemplo: Para uma landing page: Etapa 1, resuma as dificuldades dos clientes. Etapa 2, crie a estrutura da página. Etapa 3, redija as seções. Etapa 4, critique o texto com base nos critérios de conversão. Etapa 5, produza a versão final.
Diagrama passo a passo de encadeamento de prompts com etapas de pesquisa, organização, rascunho e refinamento.
O encadeamento de prompts divide uma tarefa complexa em etapas menores, nas quais cada saída alimenta o prompt seguinte.
Crie um fluxo de trabalho repetível

Combine técnicas de prompting em sistemas que você possa testar, refinar, consultar e reutilizar.

Uma ideia mais forte: crie um sistema operacional de prompts

Para trabalhos recorrentes, o melhor prompt raramente é uma única frase engenhosa. Trate-o como um pequeno sistema operacional: persona, entradas, regras sobre fontes, nível de qualidade, formato de saída e etapa de revisão. Isso torna o fluxo de trabalho ensinável e mais fácil de depurar.

Prompt isolado

“Escreva nosso e-mail de integração.” O modelo adivinha o público, o tom, os detalhes do produto e os critérios de sucesso.

Sistema operacional de prompts

“Use o segmento de clientes, a promessa do produto, o guia de tom, as alegações proibidas, os exemplos de e-mails e a lista de verificação abaixo. Crie um rascunho, faça uma autoavaliação e então apresente o e-mail final.”

Exemplo prático: uma equipe de suporte de SaaS pode encadear: classificar o ticket → recuperar a política → redigir a resposta → verificar alegações sem fonte → produzir a resposta final. Cada etapa tem uma função mais restrita, por isso os erros são mais fáceis de encontrar.

Engenharia de contexto explicada

Engenharia de contexto é a disciplina de decidir quais informações entram no modelo no momento certo. Ela inclui seleção de fontes, hierarquia de instruções, memória, recuperação, exemplos, ferramentas e esquemas de saída. O objetivo não é “contexto máximo”; é o menor contexto confiável.

Exemplo: Um assistente jurídico deve receber a cláusula relevante, a jurisdição, a pergunta da pessoa e as restrições de saída — não o contrato inteiro de 80 páginas para cada resposta simples.

Como testar prompts

Testar prompts significa executar a mesma tarefa com exemplos representativos e pontuar as saídas. Use uma rubrica: precisão, completude, conformidade com o formato, tom, segurança e tempo de edição. Mantenha um pequeno conjunto de regressão para perceber quando uma alteração no prompt melhora um caso, mas prejudica outro.

Exemplo: Teste 20 tickets de suporte com três variações de prompt. Dê a cada resposta uma nota de 1 a 5 para correção em relação à política e tempo economizado. O melhor prompt nem sempre é o mais longo.

Como obter respostas melhores da IA

Respostas melhores normalmente vêm de objetivos mais claros, contexto melhor, restrições explícitas, exemplos e uma etapa de revisão. Peça ao modelo que declare suas premissas, use um formato específico e sinalize incertezas. Para fatos importantes, forneça fontes ou exija citações do material recuperado.

Exemplo: Em vez de “analise isto”, peça: “Encontre as três premissas de maior risco neste plano de lançamento, explique por que cada uma importa e indique um teste que podemos executar nesta semana.”

RAG explicado de forma simples

RAG significa geração aumentada por recuperação. O sistema primeiro pesquisa uma base de conhecimento, depois fornece ao modelo os trechos relevantes e, por fim, o modelo escreve uma resposta fundamentada nesses trechos. RAG é útil quando as respostas dependem de documentos privados, mutáveis ou extensos. É desnecessário para tarefas simples de escrita.

Exemplo: Um bot de suporte de SaaS recupera o parágrafo mais recente da política de reembolso antes de redigir uma resposta, para não depender da memória nem de exemplos desatualizados.
Fluxo simples de RAG, da pergunta da pessoa ao contexto recuperado e à resposta gerada.
O RAG recupera primeiro informações úteis e depois o modelo responde usando esse contexto.

O que são agentes de IA?

Até aqui, você escreveu prompts que retornam uma resposta. Um agente de IA vai além: ele pode planejar várias etapas, usar ferramentas (como busca ou calculadora), observar o resultado e decidir o que fazer em seguida — repetindo o processo até a tarefa terminar. Pense na diferença entre pedir instruções de caminho e entregar as chaves para alguém resolver a tarefa por você.

Agentes são úteis para trabalhos em várias etapas que, de outra forma, exigiriam muitos prompts separados: pesquisar em várias páginas e depois resumir; ou buscar uma informação e então redigir uma resposta com base nela. A desvantagem é o controle — como um agente age por conta própria, você precisa definir limites mais claros e, muitas vezes, uma etapa de revisão antes de qualquer ação importante. Para conhecer os detalhes técnicos sobre como agentes, ferramentas e Large Action Models funcionam, o Guia avançado aborda esses temas em profundidade.

Exemplo: “Encontre três artigos recentes sobre este assunto e depois escreva um resumo curto com links” é uma boa primeira tarefa para um agente — delimitada, verificável e de baixo risco.

Temperatura explicada de forma simples

A temperatura controla o grau de aleatoriedade usado pelo modelo ao escolher tokens. Uma temperatura menor tende a produzir resultados mais previsíveis e consistentes. Uma temperatura maior pode gerar mais variedade e criatividade, mas também aumentar o desvio em relação às instruções. Não é um controle de qualidade; é um controle de variação.

Exemplo: Para extrair dados de faturas, use temperatura baixa. Para criar dez ideias de nomes de marca, use temperatura mais alta e depois filtre os resultados.

Como o modelo escolhe cada palavra: greedy, top-k e top-p

A temperatura é um dos controles de uma etapa maior chamada decodificação (ou amostragem). Em cada posição, o modelo atribui uma probabilidade a cada possível próximo token, e o método de decodificação decide qual candidato será realmente escolhido. Essas configurações explicam por que o mesmo prompt pode parecer rígido, levemente repetitivo ou muito criativo, dependendo da configuração da API.

Os métodos mais comuns, do mais restrito ao mais flexível:

Greedy

Seleciona o token com maior probabilidade em cada etapa. Isso remove a aleatoriedade da amostragem para esse decodificador, mas uma saída idêntica não é garantida entre versões do modelo, implementações numéricas, alterações no backend ou infraestrutura não determinística.

Top-k

Mantém apenas os k tokens mais prováveis, por exemplo 40, e depois escolhe entre eles. É uma lista de tamanho fixo, independentemente do grau de certeza do modelo.

Top-p (núcleo)

Mantém o menor conjunto de tokens cujas probabilidades somam p, como 0,9. A lista diminui quando o modelo está confiante e aumenta quando ele está incerto.

Min-p

Uma opção mais recente: mantém os tokens que alcançam pelo menos uma fração da probabilidade do token mais provável. Tende a permanecer mais estável do que top-p quando a temperatura é alta.

Essas configurações interagem, mas a ordem exata e os controles disponíveis dependem da implementação. Em um pipeline comum, a temperatura redimensiona os logits antes de um filtro top-k ou top-p; outros ambientes de execução podem combinar ou ordenar os processadores de maneiras diferentes. Alguns fornecedores recomendam alterar a temperatura ou o top-p, em vez de ambos, mas siga a documentação do modelo e da API específicos.

Exemplo: Para extração em JSON ou argumentos de ferramentas, prefira saída estruturada limitada por esquema ou chamadas de função/ferramenta quando o fornecedor oferecer esse recurso. Uma temperatura baixa pode ser uma configuração secundária de estabilidade, não um substituto para validação. Para brainstorming, uma configuração de amostragem compatível com o fornecedor pode aumentar a variedade. Temperatura 0 significa “tão determinístico quanto a implementação permitir”, não uma garantia absoluta.
Comparação das estratégias de decodificação greedy, top-k e top-p para selecionar o próximo token.
A amostragem greedy, top-k e top-p mantém conjuntos diferentes de tokens candidatos antes de escolher a próxima palavra.

Explore exemplos reais de prompts a seguir

Use o gerador universal de prompts para transformar esses conceitos de IA em prompts práticos para escrita, pesquisa, trabalho, aprendizado e tarefas do dia a dia.

Compartilhar este guia

Adicionar o PromptingEasy à sua tela

Use o menu do navegador e escolha a opção para instalar este site ou adicioná-lo à tela inicial.