Cache clé-valeur (KV)
La mise en cache KV stocke les tenseurs clé-valeur des tokens précédents pendant la génération autorégressive. Au lieu de recalculer tout le préfixe pour chaque nouveau token, le modèle réutilise les représentations mises en cache. Cela réduit la latence pour les longues sorties, mais augmente la pression sur la mémoire pour chaque requête active.

Le plan de contrôle en production pour les applications LLM
Les systèmes LLM de niveau expert reposent moins sur un modèle parfait que sur le routage, la mise en cache, l’évaluation, les contrôles de sécurité et les boucles de rétroaction. Une plateforme fiable décide quel modèle appeler, quel contexte récupérer, quand utiliser un modèle moins coûteux, quand escalader et comment détecter les régressions.
Normalise les requêtes, applique les limites de débit, ajoute les métadonnées du locataire et sélectionne les modèles candidats.
Choisit un modèle petit, grand ou spécialisé selon la difficulté de la tâche, le budget de latence et le risque.
Évalue la qualité de la récupération, la qualité de la réponse, la fidélité des citations, la sécurité et la validité du schéma.
Suit les prompts, les fragments récupérés, les versions des modèles, le nombre de tokens, les percentiles de latence et les modes de défaillance.
Mixture of Experts
Mixture of Experts achemine les tokens ou les exemples vers un sous-ensemble de réseaux experts spécialisés. Cela peut augmenter le nombre de paramètres sans utiliser chaque paramètre pour chaque token. Les compromis concernent la complexité du routage, l’équilibrage de charge, la surcharge de communication et un débogage plus difficile.
Décodage spéculatif
Le décodage spéculatif utilise un modèle brouillon ou une procédure de brouillon pour proposer des tokens, puis un modèle cible pour les vérifier. Les algorithmes exacts d’échantillonnage spéculatif peuvent préserver la distribution de sortie du modèle cible ; les variantes heuristiques peuvent échanger de l’exactitude contre de la vitesse. Les gains de vitesse dépendent du taux d’acceptation, du coût du brouillon, de la forme des séquences et des lots, de l’environnement d’exécution et du matériel.

Quantification
La quantification réduit la précision des poids, des activations ou des caches du modèle, par exemple de 16 bits à 8 bits ou 4 bits. Elle peut réduire l’utilisation de la mémoire et améliorer le débit lorsque le matériel, les noyaux, l’environnement d’exécution et la charge de travail prennent en charge le format choisi ; elle peut aussi dégrader la qualité, la calibration ou la fiabilité des appels d’outils.

LoRA et ajustement fin
LoRA gèle généralement le modèle de base et entraîne les paramètres d’adaptateurs de faible rang, ce qui réduit le nombre de paramètres entraînables et souvent les besoins en mémoire par rapport à un ajustement fin complet. Cette méthode est utile pour adapter le comportement, le style, le format, une tâche ou un domaine, mais elle ne remplace pas de manière fiable la récupération lorsque les faits changent fréquemment ; toute adaptation des connaissances dépend toujours des données, de la configuration d’entraînement et de l’évaluation.
Passez de l’optimisation du modèle à l’ajustement des préférences, à l’observabilité, à l’évaluation, à la sécurité, au routage et au contrôle des coûts.
Direct Preference Optimization (DPO) et apprentissage par renforcement à partir de retours humains (RLHF)
Le RLHF et le DPO optimisent le comportement du modèle à partir de données humaines ou de préférences. Le RLHF implique généralement une modélisation de la récompense et une optimisation de la politique. Le DPO optimise directement les préférences avec un objectif plus simple. Les deux dépendent de la qualité des préférences et peuvent surapprendre ce que les évaluateurs récompensent.
Observabilité des LLM
L’observabilité des LLM suit les prompts, les résultats de récupération, les appels d’outils, la latence, les coûts, les retours des utilisateurs, les événements de sécurité et les scores d’évaluation. Les journaux doivent respecter la confidentialité : collectez assez d’informations pour déboguer, mais évitez de stocker des données sensibles inutiles.

Évaluation de la génération augmentée par récupération (RAG)
L’évaluation du RAG sépare la qualité de la récupération de celle de la réponse. Mesurez si les bons documents ont été trouvés, si la réponse les a utilisés, si les citations étayent les affirmations et si le résultat final satisfait la tâche.
Routage des modèles
Le routage des modèles envoie chaque tâche vers le modèle ou le flux de travail suffisant le moins coûteux. Une classification simple peut utiliser un petit modèle ; un raisonnement complexe peut nécessiter un modèle plus puissant ; les réponses à risque peuvent exiger une récupération et une relecture. Le routage ne réduit les coûts que si les contrôles qualité détectent les mauvais acheminements.
Red teaming pour la sécurité de l’IA
Le red teaming teste la manière dont les systèmes échouent face à des entrées adverses ou inhabituelles. Pour les applications LLM, testez l’injection de prompt, les fuites de données, l’utilisation dangereuse d’outils, le contournement de règles, les instructions cachées et les prompts d’ingénierie sociale. L’objectif est d’améliorer les contrôles, pas de prouver la perfection.
Optimisation des coûts pour les applications à grands modèles de langage (LLM)
L’optimisation des coûts combine la compression des prompts, la mise en cache, le routage, le traitement par lots, l’élagage du contexte, la qualité de récupération, la quantification et l’évaluation. Optimisez le coût par tâche réussie, pas seulement le coût par token. Un modèle bon marché nécessitant trois nouvelles tentatives peut coûter plus cher qu’un modèle puissant utilisé une seule fois.