Cache de chave-valor (KV)
O cache KV armazena tensores de chave e valor de tokens anteriores durante a geração autorregressiva. Em vez de recalcular todo o prefixo para cada novo token, o modelo reutiliza representações armazenadas. Isso reduz a latência em saídas longas, mas aumenta a pressão sobre a memória por solicitação ativa.

O plano de controle em produção para aplicativos com LLMs
Sistemas de LLMs em nível especializado dependem menos de um único modelo perfeito e mais de roteamento, cache, avaliação, verificações de segurança e ciclos de feedback. Uma plataforma confiável decide qual modelo chamar, qual contexto recuperar, quando usar um modelo mais barato, quando escalar e como detectar regressões.
Normaliza solicitações, aplica limites de taxa, anexa metadados do cliente e seleciona modelos candidatos.
Escolhe um modelo pequeno, grande ou especializado com base na dificuldade da tarefa, no orçamento de latência e no risco.
Pontua a qualidade da recuperação, a qualidade da resposta, a fidelidade das citações, a segurança e a validade do esquema.
Acompanha prompts, trechos recuperados, versões do modelo, contagens de tokens, percentis de latência e modos de falha.
Mixture of Experts (MoE)
Mixture of Experts direciona tokens ou exemplos por um subconjunto de redes especialistas. Isso pode aumentar o número de parâmetros sem usar todos os parâmetros para cada token. As desvantagens são a complexidade do roteamento, o balanceamento de carga, o custo de comunicação e uma depuração mais difícil.
Decodificação especulativa
A decodificação especulativa usa um modelo de rascunho ou um procedimento de rascunho para propor tokens e um modelo-alvo para verificá-los. Algoritmos exatos de amostragem especulativa podem preservar a distribuição de saída do modelo-alvo; variações heurísticas podem trocar exatidão por velocidade. Os ganhos dependem da taxa de aceitação, do custo do rascunho, do formato da sequência e do lote, do ambiente de execução e do hardware.

Quantização
A quantização reduz a precisão dos pesos, das ativações ou dos caches do modelo, por exemplo, de 16 bits para 8 ou 4 bits. Ela pode reduzir o uso de memória e melhorar a taxa de processamento quando o hardware, os kernels, o ambiente de execução e a carga de trabalho aceitam o formato escolhido; também pode prejudicar a qualidade, a calibração ou a confiabilidade das chamadas de ferramentas.

LoRA e ajuste fino
O LoRA normalmente mantém o modelo-base congelado e treina parâmetros adaptadores de baixo posto, reduzindo o número de parâmetros treináveis e, muitas vezes, os requisitos de memória em comparação com um ajuste fino completo. Ele é útil para comportamento, estilo, formato ou adaptação a uma tarefa ou domínio, mas não substitui de forma confiável a recuperação quando os fatos mudam com frequência; qualquer adaptação de conhecimento ainda depende dos dados, da configuração de treinamento e da avaliação.
Passe da otimização do modelo para ajuste de preferências, observabilidade, avaliação, segurança, roteamento e controle de custos.
Otimização direta de preferências (DPO) e aprendizado por reforço com feedback humano (RLHF)
RLHF e DPO otimizam o comportamento do modelo usando dados humanos ou de preferência. O RLHF normalmente envolve modelagem de recompensa e otimização de políticas. O DPO otimiza diretamente as preferências com um objetivo mais simples. Ambos dependem da qualidade das preferências e podem se ajustar demais ao que os avaliadores recompensam.
Observabilidade de LLMs
A observabilidade de LLMs acompanha prompts, resultados de recuperação, chamadas de ferramentas, latência, custo, feedback dos usuários, eventos de segurança e pontuações de avaliação. Os registros precisam respeitar a privacidade: capture o suficiente para depurar, mas evite armazenar dados sensíveis desnecessários.

Avaliação da geração aumentada por recuperação (RAG)
A avaliação de RAG separa a qualidade da recuperação da qualidade da resposta. Meça se os documentos corretos foram encontrados, se a resposta os utilizou, se as citações sustentam as alegações e se a saída final atende à tarefa.
Roteamento de modelos
O roteamento de modelos envia cada tarefa ao modelo ou fluxo de trabalho mais barato que seja suficiente. Uma classificação simples pode usar um modelo pequeno; um raciocínio complexo pode usar um modelo mais robusto; respostas arriscadas podem exigir recuperação e revisão. O roteamento só economiza custos quando os controles de qualidade detectam encaminhamentos incorretos.
Red teaming de segurança em IA
Red teaming testa como os sistemas falham diante de entradas adversariais ou incomuns. Para aplicativos com LLMs, teste injeção de prompt, vazamento de dados, uso inseguro de ferramentas, tentativas de burlar políticas, instruções ocultas e prompts de engenharia social. O objetivo é melhorar os controles, não provar perfeição.
Otimização de custos para aplicativos com grandes modelos de linguagem (LLMs)
A otimização de custos combina compressão de prompts, cache, roteamento, processamento em lote, redução de contexto, qualidade da recuperação, quantização e avaliação. Otimize o custo por tarefa concluída com sucesso, não apenas o custo por token. Um modelo barato que exige três tentativas pode custar mais do que executar a tarefa uma única vez com um modelo mais robusto.