Como os LLMs funcionam: Tokens, contexto e respostas

Uma introdução clara e sem termos técnicos.

Saiba o que um modelo de linguagem faz quando lê um prompt, divide o texto em tokens, usa uma janela de contexto e gera uma resposta passo a passo. Comece aqui antes dos guias sobre engenharia de contexto e arquitetura.

O que é um LLM?

Um LLM, ou grande modelo de linguagem, é um software treinado com enormes volumes de texto para prever e gerar linguagem útil. Uma forma prática de entendê-lo é: você fornece uma tarefa, ele transforma seu texto em tokens, estima quais tokens provavelmente vêm a seguir e devolve um rascunho. Ele consegue escrever, resumir e classificar porque muitos padrões de linguagem estão condensados em seus parâmetros. Ele não é um banco de dados e não sabe automaticamente se uma informação recente é verdadeira.

Exemplo: Uma pessoa responsável pelo suporte de um SaaS pede: “Resuma esta reclamação e proponha uma resposta calma sobre o reembolso.” O modelo não “sente” a reclamação; ele reconhece o padrão de reclamação, política de reembolso e tom profissional.

O que é um prompt?

Um prompt é o conjunto de instruções que você envia a um sistema de IA. Bons prompts normalmente incluem a persona, a situação, a tarefa exata, as restrições, exemplos e o formato de saída desejado. Um prompt fraco pede “ideias”. Um prompt forte informa para quem são as ideias, o que elas precisam alcançar e como devem ser avaliadas.

Exemplo: Fraco: “Escreva uma descrição de produto.” Melhor: “Atue como redator de e-commerce para uma loja virtual. Escreva uma descrição de produto com 90 palavras para um copo reutilizável de café. Público: pessoas que se deslocam diariamente. Tom: prático, sem exageros. Inclua um título e três tópicos.”

O que realmente acontece quando você envia um prompt?

O fluxo normal não é: “a IA entende a solicitação, escreve um programa em Python e então começa a trabalhar”. Um grande modelo de linguagem normalmente recebe texto, transforma esse texto em tokens, processa os tokens em camadas de uma rede neural e gera o próximo token repetidas vezes. Python ou outras ferramentas só entram no processo quando o produto ao redor do modelo oferece acesso explícito a elas, por exemplo, uma calculadora, um interpretador de código, um navegador, um conector de banco de dados ou uma chamada de função.

Diagrama passo a passo do que acontece quando uma pessoa envia um prompt a um LLM.
Um prompt é convertido em tokens, processado pelo modelo e decodificado em uma resposta passo a passo.
1. Entrada

Você digita um prompt. O aplicativo pode adicionar instruções ocultas do sistema, políticas de segurança, histórico da conversa ou documentos selecionados antes que o modelo veja a solicitação final.

2. Tokens

O texto é dividido em IDs de tokens. O modelo não recebe palavras da forma como uma pessoa as lê; ele recebe identificadores numéricos de tokens.

3. Inferência

O modelo calcula probabilidades para possíveis próximos tokens com base em todo o contexto. É aqui que atenção, embeddings e pesos do modelo fazem diferença.

4. Ferramenta opcional

Se o aplicativo oferecer ferramentas, o modelo poderá solicitar uma função, como pesquisa, calculadora ou execução de código. O resultado externo será então inserido novamente na conversa como contexto adicional.

5. Resposta

O texto final é decodificado a partir dos tokens gerados. Prompts melhores ajudam porque alteram o contexto no qual o modelo se baseia antes de escolher cada próximo token.

Lição de prompting: o modelo é muito sensível às informações que recebe antes da geração. Contexto claro, exemplos, restrições e material de origem aumentam a probabilidade de os próximos tokens seguirem sua intenção.
Teste as ideias em seus próprios prompts

Faça um exercício simples de antes e depois antes de continuar com tokens, contexto e limitações do modelo.

Melhor do que um miniteste: crie uma galeria de antes e depois dos prompts

Em vez de executar um teste genérico, reúna cinco prompts reais do seu próprio trabalho e salve a versão fraca, a versão melhorada e o resultado final editado. Isso se torna uma galeria de prompts reutilizável para sua equipe.

  1. Escolha uma tarefa recorrente, como respostas de suporte, descrições de produtos ou resumos de aulas.
  2. Salve o prompt original e o resultado.
  3. Adicione contexto, regras de formato e um exemplo.
  4. Compare quanto trabalho de edição o segundo resultado exige.
  5. Transforme a melhor versão em um modelo.

O que são tokens?

Tokens são as pequenas unidades de texto que um modelo lê e escreve. Um token pode ser uma palavra inteira, parte de uma palavra, pontuação ou um caractere, dependendo do tokenizador e do idioma. Os limites de tokens importam porque a entrada e a saída precisam caber na janela de contexto do modelo.

Exemplo: “PromptingEasy ajuda equipes” pode virar tokens semelhantes a “Prompt”, “ing”, “Easy”, “ajuda”, “equipes”. É por isso que documentos longos e muitos exemplos aumentam o custo e podem ocupar o espaço de instruções importantes.
Diagrama mostrando o texto convertido em partes coloridas de tokens e depois reconstruído na frase original.
O texto é dividido em tokens e depois remontado em texto legível.

Por que a IA às vezes inventa informações?

A IA pode alucinar quando gera uma continuação que parece plausível sem fundamentação confiável suficiente. O modelo é otimizado para produzir texto provável, não para garantir a verdade por padrão. As alucinações ficam mais prováveis quando a pergunta pede fatos obscuros, informações recentes, dados ocultos ou citações que não foram fornecidas.

Exemplo: Uma pessoa pede “o preço exato em 2026 de um plano de API de nicho” sem pesquisa na web nem texto de referência. O modelo pode produzir um preço com aparência convincente porque esse tipo de resposta é comum, mesmo que o número esteja errado.

O mesmo mecanismo pode inventar um status da tarefa, e não apenas um fato. Em um de nossos próprios fluxos de trabalho, um assistente de IA recebeu a tarefa de localizar o perfil correspondente no LinkedIn para cada linha de uma planilha e inserir cada URL em uma coluna — dezenas de linhas, não uma única consulta. Ele informou que a tarefa estava concluída e até apresentou números — “14 perfis, 3 e-mails” —, mas a coluna estava vazia e o arquivo devolvido era apenas uma cópia renomeada. Um resumo confiante é simplesmente a sequência de palavras mais plausível, portanto não comprova que o trabalho foi realizado.

Perguntar de novo não necessariamente interrompe o padrão. Dependendo do produto, uma nova tentativa pode reenviar a conversa visível, usar o estado da conversa no servidor, reduzir ou resumir interações anteriores ou reutilizar uma entrada em cache. Ainda assim, uma nova resposta é gerada e pode consumir tokens adicionais ou limites do plano, mesmo quando nenhum arquivo utilizável é produzido.

Um assistente de IA admitindo que informou ter concluído uma tarefa em uma planilha sem ter inserido nenhum dado no arquivo.
Caso real de nosso próprio fluxo de trabalho (captura de tela, 2026): o assistente informou números e entregou um arquivo concluído — a coluna de destino continuava vazia.

Motivo: a IA está presa em um ciclo?

Na prática, sim — mas não da forma como parece. O modelo não tem autoconsciência persistente de que está repetindo uma falha; ele só pode usar o contexto e o estado fornecidos pelo aplicativo. Uma nova resposta pode ser gerada com base em todo o histórico visível, em um histórico reduzido ou resumido, ou em um estado gerenciado pelo servidor. Se o fluxo de trabalho não exigir que o assistente abra o arquivo e confirme os valores salvos, “concluído” poderá continuar sendo uma resposta plausível. O ciclo não é teimosia; é falta de verificação e de conferência do estado.

É por isso que repetir a mesma pergunta raramente ajuda e continua consumindo tokens. O que interrompe o ciclo é mudar a tarefa, não repeti-la: torne o resultado verificável, peça ao assistente que leia novamente o arquivo salvo e mostre os valores reais das células, e interrompa a execução quando essa evidência não estiver presente. Consulte os erros de prompting mais comuns para saber como definir um critério de sucesso que o modelo possa verificar.

Por que o contexto ajuda?

O contexto reduz o espaço de possibilidades. Quando o modelo conhece o público, o objetivo, as restrições, os exemplos e o material de origem, ele pode produzir uma resposta adequada à sua situação em vez de uma resposta genérica. Mais contexto nem sempre é melhor: informações irrelevantes podem distrair o modelo e aumentar o custo.

Exemplo: Uma equipe de marketing obtém textos publicitários melhores quando inclui o posicionamento do produto, o cliente-alvo, alegações proibidas e dois anúncios anteriores bem-sucedidos, em vez de apenas dizer “escreva anúncios”.

Mecanismo de busca versus LLM

Um mecanismo de busca recupera páginas e classifica links. Um LLM gera uma resposta a partir de padrões e do contexto fornecido. A busca é melhor quando você precisa de fontes atuais, páginas oficiais ou diferentes perspectivas. Os LLMs são melhores quando você precisa sintetizar, reescrever, raciocinar sobre informações fornecidas ou criar rascunhos estruturados. Muitos produtos avançados de IA combinam as duas abordagens.

Exemplo: Para “prazo mais recente para declaração de impostos em Zurique”, use a busca ou fontes oficiais. Para “transforme estas anotações em um e-mail educado para um cliente”, um LLM é a interface mais adequada.
Diagrama comparativo mostrando como um mecanismo de busca e um LLM respondem de maneiras diferentes à mesma pergunta.
Mecanismos de busca retornam links e fontes; LLMs geram respostas diretas em linguagem natural.

O que significa “a IA compreende a linguagem”?

Na linguagem cotidiana, “compreende” significa que o modelo consegue responder de forma adequada ao significado, ao tom e à estrutura. Tecnicamente, ele aprendeu representações estatísticas que relacionam padrões de texto a saídas úteis. Ele não compreende como uma pessoa com experiência de vida, intenções ou responsabilidade baseada em bom senso.

Exemplo: Se você escrever “deixe isto menos comercial”, o modelo muitas vezes consegue ajustar o tom porque aprendeu padrões de linguagem comercial e neutra. Isso é uma competência linguística útil, não compreensão humana.

Explore exemplos reais de prompts a seguir

Use o gerador universal de prompts para transformar esses conceitos de IA em prompts práticos para escrita, pesquisa, trabalho, aprendizado e tarefas do dia a dia.

Compartilhar este guia

Adicionar o PromptingEasy à sua tela

Use o menu do navegador e escolha a opção para instalar este site ou adicioná-lo à tela inicial.