Un cadre, deux usages
CLEAR est volontairement compact. Il utilise les trois mêmes questions lors de la rédaction d’un prompt et lors de l’évaluation de la réponse. Les critères du test sont ainsi visibles avant qu’un modèle réponde, au lieu d’inventer un système de notation après coup.
Lors de la rédaction du prompt : Que doit savoir l’IA ? Lors de l’évaluation : La réponse a-t-elle correctement compris et utilisé le contexte pertinent ?
Lors de la rédaction du prompt : Quelles règles s’appliquent ? Lors de l’évaluation : La réponse a-t-elle respecté les règles, contraintes et limites demandées ?
Lors de la rédaction du prompt : Que doit exactement fournir l’IA ? Lors de l’évaluation : La réponse a-t-elle réellement fourni la réponse et le résultat attendus ?
C — Contexte
Le Contexte vérifie si la réponse a compris la situation qui lui était donnée. Cela peut inclure l’objectif de l’utilisateur, le public, les sources, le niveau de connaissances, les faits qui doivent rester inchangés ou toute autre information nécessaire pour répondre correctement à la tâche.
Une note élevée en Contexte ne signifie pas que chaque affirmation factuelle de la réponse a été vérifiée indépendamment. Elle signifie que la réponse a correctement utilisé le contexte fourni pour cette tâche.
L — Limites
Les Limites sont les règles explicites qui structurent la réponse. Lorsque c’est possible, nous les rendons objectivement vérifiables : nombre de mots, nombre de puces, nombre de paragraphes, libellés obligatoires, phrase finale imposée ou contrainte telle que l’utilisation exclusive de ressources gratuites.
Les vérifications mécaniques, comme le nombre de mots ou d’éléments requis, sont enregistrées comme des faits et non estimées à l’apparence.
Les contraintes qui exigent un jugement — par exemple préserver le sens ou maintenir le ton demandé — sont expliquées dans l’évaluation visible.
EAR — Réponse et résultat attendus
EAR pose la question la plus pratique : la réponse a-t-elle réellement donné à l’utilisateur ce dont il avait besoin ? Nous évaluons ici la complétude, l’utilité, la préservation du sens et l’adéquation du résultat à l’usage demandé.
Une réponse peut rester sous la limite de mots et utiliser les bons libellés tout en omettant une dépendance importante, en modifiant le degré de certitude ou en produisant un résultat qui n’est pas prêt pour l’usage prévu.
La réponse satisfait la tâche dans son ensemble : elle utilise le contexte pertinent, respecte les règles et préserve le sens ainsi que le résultat pratique demandé par l’utilisateur.
Comment une note CLEAR est produite
Chaque test de qualité des réponses suit la même séquence de base. L’objectif est la répétabilité et la transparence, et non de prétendre qu’un seul test manuel constitue un benchmark scientifique.
L’échelle de 1 à 10
Insuffisant : l’exigence est largement manquée.
Partiel : des insuffisances importantes subsistent.
Bon : l’exigence est largement satisfaite, mais le problème est suffisamment important pour compter.
Très bon : presque entièrement satisfaite, avec seulement un problème mineur.
Entièrement satisfait : aucun problème significatif n’a été trouvé pour cette dimension.
Utilisé lorsqu’une dimension ne s’applique réellement pas. Nous ne transformons pas « non applicable » en 10/10 artificiel.
Exemple réel : format parfait, sens modifié
In Test 5, quatre assistants devaient résumer une note de projet pour un responsable. La source indiquait que la refonte du site web « is planned for launch on 12 September. » ChatGPT l’a résumé ainsi : « Website redesign launches 12 September. »
Pourquoi c’est important : la date est conservée, mais pas le statut. « Planned for launch » est une information conditionnelle sur le projet ; « launches » présente l’événement comme certain. Dans un résumé destiné au management, cela peut modifier de manière importante les décisions, les échéances et les attentes fondées sur l’état du projet.
La réponse a compris qu’il fallait produire un résumé de management concis et a conservé les sujets pertinents du projet.
Elle est restée sous 75 mots, a utilisé exactement trois puces et a employé Status:, Risk: et Next action: comme demandé.
Le résultat est concis et correctement formaté, mais il transforme un lancement prévu en lancement certain. Dans un résumé destiné à un responsable, cela modifie l’état du projet utile à la décision et peut induire la planification en erreur de manière importante.
Ce que fait CLEAR — et ce qu’il ne prétend pas
si une réponse a compris la tâche, respecté les limites demandées et fourni le résultat attendu — avec une justification visible pour chaque note.
que chaque affirmation factuelle est vraie, qu’un assistant est généralement « le meilleur » ou qu’un seul test manuel constitue un benchmark scientifique d’un modèle.
Lorsque la vérification factuelle compte, les sources ou les affirmations peuvent être contrôlées séparément et documentées comme preuves. CLEAR reste centré sur la qualité de la réponse par rapport au prompt effectivement testé.