Comment fonctionnent les LLM : Tokens, contexte et réponses

Une introduction claire et non technique.

Découvrez ce qu’un modèle de langage fait lorsqu’il lit un prompt, découpe le texte en tokens, utilise une fenêtre de contexte et génère une réponse étape par étape. Commencez ici avant les guides sur l’ingénierie du contexte et l’architecture.

Qu’est-ce qu’un LLM ?

Un LLM, ou grand modèle de langage, est un logiciel entraîné sur d’immenses quantités de texte afin de prédire et de générer du langage utile. Pour le comprendre simplement : vous lui donnez une tâche, il transforme votre texte en tokens, estime les prochains tokens probables et renvoie une première version. Il peut rédiger, résumer et classer parce que de nombreux schémas linguistiques sont condensés dans ses paramètres. Ce n’est pas une base de données et il ne sait pas automatiquement si une information récente est vraie.

Exemple : Un responsable du support SaaS demande : « Résume cette réclamation et propose une réponse calme concernant le remboursement. » Le modèle ne « ressent » pas la réclamation ; il reconnaît les schémas associés à une réclamation, à une politique de remboursement et à un ton professionnel.

Qu’est-ce qu’un prompt ?

Un prompt est l’ensemble d’instructions que vous envoyez à un système d’IA. Les bons prompts comprennent généralement le rôle, la situation, la tâche précise, les contraintes, des exemples et le format de sortie souhaité. Un prompt faible demande des « idées ». Un prompt solide précise à qui ces idées sont destinées, ce qu’elles doivent accomplir et selon quels critères elles doivent être évaluées.

Exemple : Faible : « Rédige une description de produit. » Mieux : « Agis comme un rédacteur e-commerce pour une boutique en ligne. Rédige une description de 90 mots pour un gobelet à café réutilisable. Public : personnes qui font la navette. Ton : pratique, sans exagération. Inclus un titre et trois puces. »

Que se passe-t-il réellement lorsque vous envoyez un prompt ?

Le déroulement habituel n’est pas : « l’IA comprend la demande, écrit un programme Python, puis commence à travailler ». Un grand modèle de langage reçoit généralement du texte, le transforme en tokens, fait passer ces tokens à travers les couches d’un réseau neuronal et génère le token suivant, encore et encore. Python ou d’autres outils n’interviennent que lorsque le produit autour du modèle lui donne explicitement accès à des outils, par exemple une calculatrice, un interpréteur de code, un navigateur, un connecteur de base de données ou un appel de fonction.

Schéma étape par étape de ce qui se passe lorsqu’un utilisateur envoie un prompt à un LLM.
Un prompt est tokenisé, traité par le modèle puis décodé en réponse étape par étape.
1. Entrée

Vous saisissez un prompt. L’application peut ajouter des instructions système masquées, des règles de sécurité, l’historique de la conversation ou des documents sélectionnés avant que le modèle ne voie la demande finale.

2. Tokens

Le texte est découpé en identifiants de tokens. Le modèle ne reçoit pas les mots comme une personne les lit ; il reçoit des identifiants numériques de tokens.

3. Inférence

Le modèle calcule les probabilités des prochains tokens possibles à partir de l’ensemble du contexte. C’est ici que l’attention, les embeddings et les poids du modèle entrent en jeu.

4. Outil facultatif

Si l’application prend en charge des outils, le modèle peut demander une fonction telle que la recherche, une calculatrice ou l’exécution de code. Le résultat externe est ensuite réinséré dans la conversation comme contexte supplémentaire.

5. Réponse

Le texte final est décodé à partir des tokens générés. De meilleurs prompts sont utiles parce qu’ils modifient le contexte sur lequel le modèle se conditionne avant de choisir chaque token suivant.

Leçon de prompting : le modèle est très sensible aux informations qu’il reçoit avant la génération. Un contexte clair, des exemples, des contraintes et des sources augmentent la probabilité que les tokens suivants correspondent à votre intention.
Testez ces idées sur vos propres prompts

Faites un simple exercice avant/après avant de poursuivre avec les tokens, le contexte et les limites des modèles.

Mieux qu’un mini-test : créez une galerie de prompts avant/après

Au lieu d’effectuer un test générique, rassemblez cinq prompts réels issus de votre propre travail et conservez la version faible, la version améliorée et le résultat final corrigé. Vous obtenez ainsi une galerie de prompts réutilisable par votre équipe.

  1. Choisissez une tâche récurrente, comme les réponses du support, les descriptions de produits ou les résumés de cours.
  2. Enregistrez le prompt et le résultat d’origine.
  3. Ajoutez du contexte, des règles de format et un exemple.
  4. Comparez la quantité de corrections nécessaire pour le second résultat.
  5. Transformez la meilleure version en modèle.

Que sont les tokens ?

Les tokens sont les petites unités de texte qu’un modèle lit et écrit. Selon le tokenizer et la langue, un token peut être un mot entier, une partie de mot, un signe de ponctuation ou un caractère. Les limites de tokens sont importantes, car l’entrée et la sortie doivent tenir ensemble dans la fenêtre de contexte du modèle.

Exemple : « PromptingEasy helps teams » peut devenir des tokens similaires à « Prompt », « ing », « Easy », « helps », « teams ». C’est pourquoi les longs documents et de nombreux exemples augmentent le coût et peuvent repousser des instructions importantes hors du contexte disponible.
Schéma montrant un texte converti en fragments de tokens colorés puis reconverti en phrase d’origine.
Le texte est découpé en tokens puis réassemblé en texte lisible.

Pourquoi l’IA invente-t-elle parfois des choses ?

L’IA peut halluciner lorsqu’elle génère une suite qui semble plausible sans disposer d’un ancrage suffisamment fiable. Le modèle est optimisé pour produire un texte probable, et non pour garantir par défaut la véracité. Les hallucinations deviennent plus probables lorsque la question porte sur des faits obscurs, des informations récentes, des données cachées ou des citations qui n’ont pas été fournies.

Exemple : Un utilisateur demande « le prix exact en 2026 d’une formule d’API de niche » sans navigation ni texte source. Le modèle peut produire un prix qui semble assuré parce que ce type de réponse est courant, même si le chiffre est faux.

Le même mécanisme peut inventer un état d’avancement, pas seulement un fait. Dans l’un de nos propres flux de travail, un assistant IA a été chargé de rechercher le profil LinkedIn correspondant à chaque ligne d’une feuille de calcul et d’inscrire chaque URL dans une colonne — des dizaines de lignes, sans effectuer une seule recherche. Il a déclaré la tâche terminée et a même fourni des décomptes — “14 profils, 3 e-mails” — mais la colonne était vide et le fichier renvoyé n’était qu’une copie renommée. Un résumé formulé avec assurance n’est que la suite de mots la plus plausible ; il ne prouve donc pas que le travail a réellement été effectué.

Redemander ne rompt pas nécessairement ce schéma. Selon le produit, une nouvelle tentative peut renvoyer la conversation visible, utiliser un état de conversation côté serveur, tronquer ou résumer les échanges plus anciens, ou réutiliser une entrée mise en cache. Elle génère malgré tout une nouvelle réponse et peut consommer des tokens supplémentaires ou les limites de votre formule, même si aucun fichier exploitable n’est produit.

Un assistant IA reconnaissant avoir déclaré une tâche de feuille de calcul terminée sans avoir écrit la moindre donnée dans le fichier.
Cas réel tiré de notre propre flux de travail (capture d’écran, 2026) : l’assistant a indiqué des nombres et livré un fichier supposément terminé — la colonne cible était toujours vide.

Raison : l’IA est-elle coincée dans une boucle ?

Dans un sens pratique, oui — mais pas comme on pourrait l’imaginer. Le modèle n’a pas de conscience persistante du fait qu’il répète un échec ; il ne peut utiliser que le contexte et l’état fournis par l’application. Une nouvelle réponse peut être générée à partir de tout l’historique visible, d’un historique tronqué ou résumé, ou d’un état géré côté serveur. Si le flux de travail n’oblige pas l’assistant à ouvrir le fichier et à vérifier les valeurs enregistrées, alors “terminé” peut rester une réponse plausible. Cette boucle n’est pas de l’obstination ; elle vient d’un manque de vérification et de contrôle de l’état.

C’est pourquoi répéter la même question aide rarement, tout en continuant à consommer des tokens. Ce qui rompt la boucle, c’est modifier la tâche, pas la répéter: rendez le résultat vérifiable, demandez à l’assistant de relire le fichier enregistré et d’afficher les valeurs réelles des cellules, puis arrêtez l’exécution si cette preuve manque. Consultez les erreurs de prompting les plus courantes pour apprendre à définir un critère de réussite que le modèle peut vérifier.

Pourquoi le contexte aide-t-il ?

Le contexte réduit l’espace de recherche. Si le modèle connaît le public, l’objectif, les contraintes, les exemples et les sources, il peut produire une réponse adaptée à votre situation plutôt qu’une réponse générique. Plus de contexte n’est pas toujours mieux : un contexte non pertinent peut distraire le modèle et augmenter le coût.

Exemple : Une équipe marketing obtient de meilleurs textes publicitaires lorsqu’elle fournit le positionnement du produit, le client cible, les affirmations interdites et deux publicités antérieures réussies, plutôt que de simplement demander « rédige des publicités ».

Moteur de recherche vs LLM

Un moteur de recherche récupère des pages et classe des liens. Un LLM génère une réponse à partir de schémas appris et du contexte fourni. La recherche convient mieux lorsque vous avez besoin de sources actuelles, de pages officielles ou de plusieurs points de vue. Les LLM conviennent mieux à la synthèse, à la reformulation, au raisonnement à partir d’informations fournies ou à la création de brouillons structurés. De nombreux produits d’IA performants combinent les deux.

Exemple : Pour « dernière échéance fiscale à Zurich », utilisez la recherche ou des sources officielles. Pour « transforme ces notes en e-mail client poli », un LLM est une interface plus adaptée.
Schéma comparatif montrant comment un moteur de recherche et un LLM répondent différemment à la même question d’un utilisateur.
Les moteurs de recherche renvoient des liens et des sources ; les LLM génèrent des réponses directes en langage naturel.

Que signifie « l’IA comprend le langage » ?

Dans le langage courant, « comprendre » signifie que le modèle peut répondre de manière appropriée au sens, au ton et à la structure. Techniquement, il a appris des représentations statistiques qui associent des schémas textuels à des résultats utiles. Il ne comprend pas comme une personne ayant une expérience vécue, des intentions ou une responsabilité fondée sur le bon sens.

Exemple : Si vous écrivez « rends ce texte moins commercial », le modèle peut souvent ajuster le ton parce qu’il a appris les différences entre un langage commercial et un langage neutre. Il s’agit d’une compétence linguistique utile, pas d’une compréhension humaine.

Explorez ensuite de vrais exemples de prompts

Utilisez le générateur universel de prompts pour transformer ces concepts d’IA en prompts pratiques pour la rédaction, la recherche, le travail, l’apprentissage et les tâches du quotidien.

Partager ce guide

Ajouter PromptingEasy à votre écran

Utilisez le menu de votre navigateur et choisissez l’option permettant d’installer ce site ou de l’ajouter à votre écran d’accueil.