Comment nous évaluons les réponses IA avec CLEAR

Contexte. Limites. Réponse et résultat attendus.

CLEAR est le cadre compact qui sous-tend nos tests de qualité des réponses. Les trois mêmes éléments servent à définir un prompt puis à évaluer dans quelle mesure la première réponse l’a satisfait.

Un cadre, deux usages

CLEAR est volontairement compact. Il utilise les trois mêmes questions lors de la rédaction d’un prompt et lors de l’évaluation de la réponse. Les critères du test sont ainsi visibles avant qu’un modèle réponde, au lieu d’inventer un système de notation après coup.

C — Contexte

Lors de la rédaction du prompt : Que doit savoir l’IA ? Lors de l’évaluation : La réponse a-t-elle correctement compris et utilisé le contexte pertinent ?

L — Limites

Lors de la rédaction du prompt : Quelles règles s’appliquent ? Lors de l’évaluation : La réponse a-t-elle respecté les règles, contraintes et limites demandées ?

EAR

Lors de la rédaction du prompt : Que doit exactement fournir l’IA ? Lors de l’évaluation : La réponse a-t-elle réellement fourni la réponse et le résultat attendus ?

Pourquoi rester compact ? Une note n’est utile que si les lecteurs peuvent voir pourquoi elle a été attribuée. CLEAR garde des dimensions suffisamment larges pour être mémorisées, mais chaque note doit toujours être accompagnée d’une explication concrète et visible.

C — Contexte

Le Contexte vérifie si la réponse a compris la situation qui lui était donnée. Cela peut inclure l’objectif de l’utilisateur, le public, les sources, le niveau de connaissances, les faits qui doivent rester inchangés ou toute autre information nécessaire pour répondre correctement à la tâche.

Exemple : Si un prompt demande une explication pour une personne de 15 ans qui n’a jamais étudié les statistiques, une bonne réponse doit simplifier le concept pour ce public sans le remplacer par quelque chose d’inexact.

Une note élevée en Contexte ne signifie pas que chaque affirmation factuelle de la réponse a été vérifiée indépendamment. Elle signifie que la réponse a correctement utilisé le contexte fourni pour cette tâche.

L — Limites

Les Limites sont les règles explicites qui structurent la réponse. Lorsque c’est possible, nous les rendons objectivement vérifiables : nombre de mots, nombre de puces, nombre de paragraphes, libellés obligatoires, phrase finale imposée ou contrainte telle que l’utilisation exclusive de ressources gratuites.

Mesurer d’abord

Les vérifications mécaniques, comme le nombre de mots ou d’éléments requis, sont enregistrées comme des faits et non estimées à l’apparence.

Puis évaluer

Les contraintes qui exigent un jugement — par exemple préserver le sens ou maintenir le ton demandé — sont expliquées dans l’évaluation visible.

Important : Un respect parfait du format ne garantit pas automatiquement un résultat de haute qualité. Une réponse peut obtenir 10/10 en Limites et perdre des points en Réponse et résultat attendus si elle modifie le sens ou manque la tâche réelle.

EAR — Réponse et résultat attendus

EAR pose la question la plus pratique : la réponse a-t-elle réellement donné à l’utilisateur ce dont il avait besoin ? Nous évaluons ici la complétude, l’utilité, la préservation du sens et l’adéquation du résultat à l’usage demandé.

Bon format, résultat faible

Une réponse peut rester sous la limite de mots et utiliser les bons libellés tout en omettant une dépendance importante, en modifiant le degré de certitude ou en produisant un résultat qui n’est pas prêt pour l’usage prévu.

Résultat solide

La réponse satisfait la tâche dans son ensemble : elle utilise le contexte pertinent, respecte les règles et préserve le sens ainsi que le résultat pratique demandé par l’utilisateur.

Exemple d’e-mail : Dans notre test de réécriture d’e-mail, un e-mail professionnel peut conserver tous les faits requis et sembler malgré tout incomplet s’il omet une formule de fin normale. Ce n’est pas nécessairement un échec de Limites lorsque le prompt ne l’exigeait pas explicitement, mais cela peut affecter EAR.

Comment une note CLEAR est produite

Chaque test de qualité des réponses suit la même séquence de base. L’objectif est la répétabilité et la transparence, et non de prétendre qu’un seul test manuel constitue un benchmark scientifique.

1
Figer le prompt exact
Le même texte de prompt est utilisé pour chaque assistant dans ce test.
2
Capturer la première réponse complète
Nouvelle conversation, sans régénération ni relance. La capture d’écran originale est conservée comme preuve.
3
Consigner les conditions visibles
La date, le modèle affiché, le compte, l’état du web/de la recherche et les autres réglages pertinents sont documentés.
4
Vérifier les limites mesurables
Le nombre de mots, le nombre de puces, les libellés et les autres contraintes objectives sont vérifiés directement.
5
Noter C, L et EAR séparément
Chaque note reçoit une justification visible. Nous ne masquons pas le raisonnement derrière une note globale.

L’échelle de 1 à 10

1–3

Insuffisant : l’exigence est largement manquée.

4–6

Partiel : des insuffisances importantes subsistent.

7–8

Bon : l’exigence est largement satisfaite, mais le problème est suffisamment important pour compter.

9

Très bon : presque entièrement satisfaite, avec seulement un problème mineur.

10

Entièrement satisfait : aucun problème significatif n’a été trouvé pour cette dimension.

N/A

Utilisé lorsqu’une dimension ne s’applique réellement pas. Nous ne transformons pas « non applicable » en 10/10 artificiel.

Pourquoi pas de note globale pour désigner un vainqueur ? Garder C, L et EAR séparés rend les échecs plus visibles. Une note de format parfaite ne doit pas diluer une modification matérielle du sens.

Exemple réel : format parfait, sens modifié

In Test 5, quatre assistants devaient résumer une note de projet pour un responsable. La source indiquait que la refonte du site web « is planned for launch on 12 September. » ChatGPT l’a résumé ainsi : « Website redesign launches 12 September. »

Pourquoi c’est important : la date est conservée, mais pas le statut. « Planned for launch » est une information conditionnelle sur le projet ; « launches » présente l’événement comme certain. Dans un résumé destiné au management, cela peut modifier de manière importante les décisions, les échéances et les attentes fondées sur l’état du projet.

Contexte 10/10

La réponse a compris qu’il fallait produire un résumé de management concis et a conservé les sujets pertinents du projet.

Limites 10/10

Elle est restée sous 75 mots, a utilisé exactement trois puces et a employé Status:, Risk: et Next action: comme demandé.

EAR 5/10

Le résultat est concis et correctement formaté, mais il transforme un lancement prévu en lancement certain. Dans un résumé destiné à un responsable, cela modifie l’état du projet utile à la décision et peut induire la planification en erreur de manière importante.

C’est pourquoi CLEAR sépare les Limites de EAR : la réponse peut respecter toutes les règles de format visibles tout en présentant un problème de qualité substantiel.

Ce que fait CLEAR — et ce qu’il ne prétend pas

CLEAR est conçu pour montrer

si une réponse a compris la tâche, respecté les limites demandées et fourni le résultat attendu — avec une justification visible pour chaque note.

CLEAR n’est pas conçu pour prouver

que chaque affirmation factuelle est vraie, qu’un assistant est généralement « le meilleur » ou qu’un seul test manuel constitue un benchmark scientifique d’un modèle.

Lorsque la vérification factuelle compte, les sources ou les affirmations peuvent être contrôlées séparément et documentées comme preuves. CLEAR reste centré sur la qualité de la réponse par rapport au prompt effectivement testé.

Voir CLEAR appliqué à des réponses réelles

Ouvrez les Tests de qualité des réponses pour comparer 24 réponses capturées manuellement sur cinq prompts pratiques et un bonus éthique.

Partager ce guide CLEAR

Ajouter PromptingEasy à votre écran

Utilisez le menu de votre navigateur et choisissez l’option permettant d’installer ce site ou de l’ajouter à votre écran d’accueil.