Ingénierie du contexte pour les LLM : Prompting, recherche d’informations et RAG

Contrôlez ce que le modèle voit et la façon dont le flux de travail l’utilise.

Découvrez comment les rôles, les exemples, les chaînes de prompts, les documents récupérés, le RAG, les agents, la température et les paramètres de décodage façonnent un flux de travail LLM reproductible. Ce guide se concentre sur le contexte et le contrôle ; le niveau suivant explique l’architecture sous-jacente.

Le role prompting expliqué

Le role prompting demande au modèle de répondre depuis une perspective professionnelle précise. Le rôle doit être pertinent pour la tâche, pas théâtral. « Agis comme un responsable senior des opérations de support » est utile pour les flux de tickets ; « agis comme un génie » apporte généralement peu.

Exemple : Pour une macro de centre d’assistance : « Agis comme responsable qualité du support. Réécris cette réponse pour la rendre plus courte, plus chaleureuse et conforme à la politique. Ne modifie pas la condition de remboursement. »
Comparaison côte à côte d’un prompting avec et sans instruction de rôle.
Le role prompting donne au modèle une perspective, un ton et un niveau de détail avant la tâche.

Le few-shot prompting expliqué

Le few-shot prompting consiste à fournir quelques exemples de l’entrée et du résultat souhaité. Il est particulièrement utile lorsque le format, le ton ou les frontières de classification sont difficiles à décrire. Deux à cinq exemples précis sont souvent plus efficaces qu’une longue explication abstraite.

Exemple : Une équipe produit fournit trois exemples de demandes de fonctionnalité désordonnées et leur format nettoyé de ticket Jira, puis demande au modèle de convertir la demande suivante selon la même structure.
Schéma montrant comment des exemples guident un LLM avant qu’il ne réponde à la tâche réelle.
Le few-shot prompting apprend au modèle le schéma souhaité en lui montrant d’abord des exemples.

Le chaînage de prompts expliqué

Le chaînage de prompts découpe une tâche complexe en étapes plus petites. Au lieu de demander en une fois la recherche, le plan, le brouillon, la critique et la version finale, vous exécutez une séquence : extraire les faits, créer la structure, rédiger un brouillon, évaluer, réviser. Cela améliore le contrôle et facilite la détection des erreurs.

Exemple : Pour une page de destination : étape 1, résumer les problèmes des clients. Étape 2, créer le plan de la page. Étape 3, rédiger les sections. Étape 4, critiquer selon les critères de conversion. Étape 5, produire le texte final.
Schéma étape par étape du chaînage de prompts avec les phases recherche, organisation, rédaction et amélioration.
Le chaînage de prompts divise une tâche complexe en petites étapes où chaque résultat alimente le prompt suivant.
Construire un flux de travail reproductible

Combinez des techniques de prompting dans des systèmes que vous pouvez tester, affiner, alimenter par récupération et réutiliser.

Une idée plus robuste : concevez un système d’exploitation de prompts

Pour un travail récurrent, le meilleur prompt est rarement une seule phrase ingénieuse. Traitez-le comme un petit système d’exploitation : rôle, entrées, règles relatives aux sources, niveau de qualité, format de sortie et étape de relecture. Le flux de travail devient ainsi transmissible et plus facile à déboguer.

Prompt ponctuel

« Rédige notre e-mail d’intégration. » Le modèle devine le public, le ton, les détails du produit et les critères de réussite.

Système d’exploitation de prompts

« Utilise le segment de clientèle, la promesse du produit, le guide de ton, les affirmations interdites, les exemples d’e-mails et la checklist ci-dessous. Rédige un brouillon, relis-le toi-même, puis produis l’e-mail final. »

Exemple pratique : une équipe de support SaaS peut enchaîner : classer le ticket → récupérer la politique → rédiger la réponse → vérifier les affirmations non étayées → produire la réponse finale. Chaque étape a une tâche plus étroite, ce qui facilite la détection des erreurs.

L’ingénierie du contexte expliquée

L’ingénierie du contexte consiste à décider quelles informations entrent dans le modèle au bon moment. Elle comprend la sélection des sources, la hiérarchie des instructions, la mémoire, la récupération, les exemples, les outils et les schémas de sortie. L’objectif n’est pas le « contexte maximal », mais le plus petit contexte fiable.

Exemple : Un assistant juridique devrait recevoir la clause pertinente, la juridiction, la question de l’utilisateur et les contraintes de sortie — pas l’intégralité d’un contrat de 80 pages pour chaque petite réponse.

Comment tester les prompts

Tester un prompt signifie exécuter la même tâche sur des exemples représentatifs et noter les résultats. Utilisez une grille : exactitude, exhaustivité, respect du format, ton, sécurité et temps de correction. Conservez un petit jeu de régression afin de repérer lorsqu’une modification du prompt améliore un cas mais en dégrade un autre.

Exemple : Testez 20 tickets de support avec trois variantes de prompt. Notez chaque réponse de 1 à 5 pour le respect de la politique et le temps gagné. Le meilleur prompt n’est pas toujours le plus long.

Comment obtenir de meilleures réponses de l’IA

De meilleures réponses viennent généralement d’objectifs plus clairs, d’un meilleur contexte, de contraintes explicites, d’exemples et d’une étape de relecture. Demandez au modèle d’indiquer ses hypothèses, d’utiliser un format défini et de signaler l’incertitude. Pour les faits importants, fournissez des sources ou exigez des citations provenant des contenus récupérés.

Exemple : Au lieu de « analyse ceci », demandez : « Identifie les trois hypothèses les plus risquées de ce plan de lancement, explique pourquoi chacune est importante et propose un test que nous pouvons réaliser cette semaine. »

Le RAG expliqué simplement

RAG signifie génération augmentée par récupération. Le système recherche d’abord dans une base de connaissances, transmet ensuite les passages pertinents au modèle, puis le modèle rédige une réponse fondée sur ces passages. Le RAG est utile lorsque les réponses dépendent de documents privés, changeants ou volumineux. Il est inutile pour les tâches de rédaction simples.

Exemple : Un bot de support SaaS récupère le dernier paragraphe de la politique de remboursement avant de rédiger une réponse, afin de ne pas dépendre de sa mémoire ou d’exemples obsolètes.
Flux RAG simple allant de la question de l’utilisateur au contexte récupéré puis à la réponse générée.
Le RAG récupère d’abord les informations utiles, puis le modèle répond à partir de ce contexte.

Que sont les agents d’IA ?

Jusqu’ici, vous avez rédigé des prompts qui renvoient une réponse. Un agent d’IA va plus loin : il peut planifier plusieurs étapes, utiliser des outils (comme la recherche ou une calculatrice), examiner le résultat et décider quoi faire ensuite — en répétant le processus jusqu’à ce que la tâche soit terminée. Imaginez la différence entre demander un itinéraire et confier à quelqu’un les clés pour effectuer la course à votre place.

Les agents sont utiles pour les tâches en plusieurs étapes qui nécessiteraient autrement de nombreux prompts séparés : effectuer des recherches sur plusieurs pages puis résumer ; ou rechercher une information puis rédiger une réponse à partir de celle-ci. Le compromis concerne le contrôle — puisqu’un agent agit de lui-même, vous devez lui donner des limites plus claires et souvent prévoir une étape de relecture avant toute action importante. Pour les détails techniques sur le fonctionnement des agents, des outils et des Large Action Models, le guide avancé les présente en détail.

Exemple : « Trouve trois articles récents sur ce sujet, puis rédige un court résumé avec des liens » est une bonne première tâche pour un agent — limitée, vérifiable et à faible risque.

La température expliquée simplement

La température contrôle le degré d’aléatoire utilisé par le modèle lors du choix des tokens. Une température plus basse tend à produire des résultats plus prévisibles et cohérents. Une température plus élevée peut apporter davantage de variété et de créativité, mais aussi accroître l’écart par rapport aux instructions. Ce n’est pas un réglage de qualité ; c’est un réglage de variation.

Exemple : Pour extraire des données de factures, utilisez une température basse. Pour obtenir dix idées de noms de marque, utilisez une température plus élevée puis filtrez les résultats.

Comment le modèle choisit chaque mot : greedy, top-k et top-p

La température est un réglage d’une étape plus large appelée décodage (ou échantillonnage). À chaque position, le modèle attribue une probabilité à chaque token suivant possible, et la méthode de décodage décide quel candidat est effectivement choisi. Ces réglages expliquent pourquoi le même prompt peut sembler rigide, légèrement répétitif ou extrêmement créatif selon la configuration de l’API.

Les méthodes courantes, de la plus stricte à la plus flexible :

Greedy

Sélectionne à chaque étape le token ayant la probabilité la plus élevée. Cela supprime l’aléatoire de l’échantillonnage pour ce décodeur, mais ne garantit pas un résultat identique entre différentes versions du modèle, implémentations numériques, modifications du backend ou infrastructures non déterministes.

Top-k

Ne conserve que les k tokens les plus probables, par exemple 40, puis choisit parmi eux. La liste restreinte garde une taille fixe quel que soit le niveau de certitude du modèle.

Top-p (nucleus)

Conserve le plus petit ensemble de tokens dont les probabilités cumulées atteignent p, par exemple 0,9. La liste se réduit lorsque le modèle est confiant et s’élargit lorsqu’il l’est moins.

Min-p

Une option plus récente : conserver les tokens qui atteignent au moins une fraction de la probabilité du token le plus probable. Elle tend à rester plus stable que top-p lorsque la température est élevée.

Ces réglages interagissent, mais l’ordre exact et les contrôles disponibles dépendent de l’implémentation. Dans un pipeline courant, la température redimensionne les logits avant un filtre top-k ou top-p ; d’autres environnements d’exécution peuvent combiner ou ordonner les processeurs différemment. Certains fournisseurs recommandent de modifier la température ou ou top-p plutôt que les deux, mais suivez la documentation du modèle et de l’API concernés.

Exemple : Pour l’extraction JSON ou les arguments d’outils, privilégiez une sortie structurée contrainte par schéma ou les appels de fonction/d’outil lorsque le fournisseur les prend en charge. Une température basse peut constituer un réglage secondaire de stabilité, mais ne remplace pas la validation. Pour le brainstorming, un réglage d’échantillonnage pris en charge par le fournisseur peut accroître la variété. Une température de 0 signifie « aussi déterministe que l’implémentation le permet », et non une garantie absolue.
Comparaison des stratégies de décodage greedy, top-k et top-p pour sélectionner le token suivant.
Les méthodes greedy, top-k et top-p conservent des candidats différents avant de choisir le mot suivant.

Explorez ensuite de vrais exemples de prompts

Utilisez le générateur universel de prompts pour transformer ces concepts d’IA en prompts pratiques pour la rédaction, la recherche, le travail, l’apprentissage et les tâches du quotidien.

Partager ce guide

Ajouter PromptingEasy à votre écran

Utilisez le menu de votre navigateur et choisissez l’option permettant d’installer ce site ou de l’ajouter à votre écran d’accueil.