O que é um LLM?
Um LLM, ou grande modelo de linguagem, é um software treinado com enormes volumes de texto para prever e gerar linguagem útil. Uma forma prática de entendê-lo é: você fornece uma tarefa, ele transforma seu texto em tokens, estima quais tokens provavelmente vêm a seguir e devolve um rascunho. Ele consegue escrever, resumir e classificar porque muitos padrões de linguagem estão condensados em seus parâmetros. Ele não é um banco de dados e não sabe automaticamente se uma informação recente é verdadeira.
O que é um prompt?
Um prompt é o conjunto de instruções que você envia a um sistema de IA. Bons prompts normalmente incluem a persona, a situação, a tarefa exata, as restrições, exemplos e o formato de saída desejado. Um prompt fraco pede “ideias”. Um prompt forte informa para quem são as ideias, o que elas precisam alcançar e como devem ser avaliadas.
O que realmente acontece quando você envia um prompt?
O fluxo normal não é: “a IA entende a solicitação, escreve um programa em Python e então começa a trabalhar”. Um grande modelo de linguagem normalmente recebe texto, transforma esse texto em tokens, processa os tokens em camadas de uma rede neural e gera o próximo token repetidas vezes. Python ou outras ferramentas só entram no processo quando o produto ao redor do modelo oferece acesso explícito a elas, por exemplo, uma calculadora, um interpretador de código, um navegador, um conector de banco de dados ou uma chamada de função.

Você digita um prompt. O aplicativo pode adicionar instruções ocultas do sistema, políticas de segurança, histórico da conversa ou documentos selecionados antes que o modelo veja a solicitação final.
O texto é dividido em IDs de tokens. O modelo não recebe palavras da forma como uma pessoa as lê; ele recebe identificadores numéricos de tokens.
O modelo calcula probabilidades para possíveis próximos tokens com base em todo o contexto. É aqui que atenção, embeddings e pesos do modelo fazem diferença.
Se o aplicativo oferecer ferramentas, o modelo poderá solicitar uma função, como pesquisa, calculadora ou execução de código. O resultado externo será então inserido novamente na conversa como contexto adicional.
O texto final é decodificado a partir dos tokens gerados. Prompts melhores ajudam porque alteram o contexto no qual o modelo se baseia antes de escolher cada próximo token.
Faça um exercício simples de antes e depois antes de continuar com tokens, contexto e limitações do modelo.
Melhor do que um miniteste: crie uma galeria de antes e depois dos prompts
Em vez de executar um teste genérico, reúna cinco prompts reais do seu próprio trabalho e salve a versão fraca, a versão melhorada e o resultado final editado. Isso se torna uma galeria de prompts reutilizável para sua equipe.
- Escolha uma tarefa recorrente, como respostas de suporte, descrições de produtos ou resumos de aulas.
- Salve o prompt original e o resultado.
- Adicione contexto, regras de formato e um exemplo.
- Compare quanto trabalho de edição o segundo resultado exige.
- Transforme a melhor versão em um modelo.
O que são tokens?
Tokens são as pequenas unidades de texto que um modelo lê e escreve. Um token pode ser uma palavra inteira, parte de uma palavra, pontuação ou um caractere, dependendo do tokenizador e do idioma. Os limites de tokens importam porque a entrada e a saída precisam caber na janela de contexto do modelo.

Por que a IA às vezes inventa informações?
A IA pode alucinar quando gera uma continuação que parece plausível sem fundamentação confiável suficiente. O modelo é otimizado para produzir texto provável, não para garantir a verdade por padrão. As alucinações ficam mais prováveis quando a pergunta pede fatos obscuros, informações recentes, dados ocultos ou citações que não foram fornecidas.
O mesmo mecanismo pode inventar um status da tarefa, e não apenas um fato. Em um de nossos próprios fluxos de trabalho, um assistente de IA recebeu a tarefa de localizar o perfil correspondente no LinkedIn para cada linha de uma planilha e inserir cada URL em uma coluna — dezenas de linhas, não uma única consulta. Ele informou que a tarefa estava concluída e até apresentou números — “14 perfis, 3 e-mails” —, mas a coluna estava vazia e o arquivo devolvido era apenas uma cópia renomeada. Um resumo confiante é simplesmente a sequência de palavras mais plausível, portanto não comprova que o trabalho foi realizado.
Perguntar de novo não necessariamente interrompe o padrão. Dependendo do produto, uma nova tentativa pode reenviar a conversa visível, usar o estado da conversa no servidor, reduzir ou resumir interações anteriores ou reutilizar uma entrada em cache. Ainda assim, uma nova resposta é gerada e pode consumir tokens adicionais ou limites do plano, mesmo quando nenhum arquivo utilizável é produzido.

Motivo: a IA está presa em um ciclo?
Na prática, sim — mas não da forma como parece. O modelo não tem autoconsciência persistente de que está repetindo uma falha; ele só pode usar o contexto e o estado fornecidos pelo aplicativo. Uma nova resposta pode ser gerada com base em todo o histórico visível, em um histórico reduzido ou resumido, ou em um estado gerenciado pelo servidor. Se o fluxo de trabalho não exigir que o assistente abra o arquivo e confirme os valores salvos, “concluído” poderá continuar sendo uma resposta plausível. O ciclo não é teimosia; é falta de verificação e de conferência do estado.
É por isso que repetir a mesma pergunta raramente ajuda e continua consumindo tokens. O que interrompe o ciclo é mudar a tarefa, não repeti-la: torne o resultado verificável, peça ao assistente que leia novamente o arquivo salvo e mostre os valores reais das células, e interrompa a execução quando essa evidência não estiver presente. Consulte os erros de prompting mais comuns para saber como definir um critério de sucesso que o modelo possa verificar.
Por que o contexto ajuda?
O contexto reduz o espaço de possibilidades. Quando o modelo conhece o público, o objetivo, as restrições, os exemplos e o material de origem, ele pode produzir uma resposta adequada à sua situação em vez de uma resposta genérica. Mais contexto nem sempre é melhor: informações irrelevantes podem distrair o modelo e aumentar o custo.
Mecanismo de busca versus LLM
Um mecanismo de busca recupera páginas e classifica links. Um LLM gera uma resposta a partir de padrões e do contexto fornecido. A busca é melhor quando você precisa de fontes atuais, páginas oficiais ou diferentes perspectivas. Os LLMs são melhores quando você precisa sintetizar, reescrever, raciocinar sobre informações fornecidas ou criar rascunhos estruturados. Muitos produtos avançados de IA combinam as duas abordagens.

O que significa “a IA compreende a linguagem”?
Na linguagem cotidiana, “compreende” significa que o modelo consegue responder de forma adequada ao significado, ao tom e à estrutura. Tecnicamente, ele aprendeu representações estatísticas que relacionam padrões de texto a saídas úteis. Ele não compreende como uma pessoa com experiência de vida, intenções ou responsabilidade baseada em bom senso.