Un marco, dos funciones
CLEAR es deliberadamente sencillo. Utiliza las mismas tres preguntas al redactar un prompt y al evaluar la respuesta. Así, los criterios de la prueba son visibles antes de que responda el modelo, en lugar de inventar un sistema de puntuación después.
Al redactar el prompt: ¿Qué debe saber la IA? Al evaluar: ¿La respuesta entendió y utilizó correctamente el contexto relevante?
Al redactar el prompt: ¿Qué reglas se aplican? Al evaluar: ¿La respuesta respetó las reglas, restricciones y límites solicitados?
Al redactar el prompt: ¿Qué debe devolver exactamente la IA? Al evaluar: ¿La respuesta entregó realmente la respuesta y el resultado esperados?
C — Contexto
Contexto pregunta si la respuesta entendió la situación proporcionada. Puede incluir el objetivo del usuario, la audiencia, el material de origen, el nivel de conocimientos, hechos que deben permanecer sin cambios u otra información necesaria para resolver correctamente la tarea.
Una puntuación alta en Contexto no significa que cada afirmación factual de la respuesta se haya verificado de forma independiente. Significa que la respuesta utilizó correctamente el contexto proporcionado para esa tarea.
L — Límites
Los Límites son las reglas explícitas que dan forma a la respuesta. Siempre que es posible, hacemos que puedan comprobarse objetivamente: número de palabras, cantidad de viñetas, número de párrafos, etiquetas obligatorias, una frase final requerida o una restricción como usar únicamente recursos gratuitos.
Las comprobaciones mecánicas, como el número de palabras o de elementos requeridos, se registran como hechos y no se estiman por apariencia.
Las restricciones que requieren criterio —por ejemplo, conservar el significado o mantener el tono solicitado— se explican en la evaluación visible.
EAR — Respuesta y Resultado Esperados
EAR plantea la pregunta más práctica: ¿la respuesta dio realmente al usuario lo que necesitaba? Aquí evaluamos la integridad, la utilidad, la conservación del significado y si el resultado es adecuado para el propósito solicitado.
Una respuesta puede mantenerse por debajo del límite de palabras y usar las etiquetas correctas, pero aun así omitir una dependencia importante, cambiar el grado de certeza o producir algo que no esté listo para el uso previsto.
La respuesta cumple la tarea en su conjunto: usa el contexto relevante, respeta las reglas y conserva el significado y el resultado práctico solicitado por el usuario.
Cómo se obtiene una puntuación CLEAR
Cada Prueba de Calidad de Respuestas sigue la misma secuencia básica. El objetivo es la repetibilidad y la transparencia, no afirmar que una única ejecución manual sea un benchmark científico.
La escala del 1 al 10
Deficiente: el requisito se incumplió en gran medida.
Parcial: siguen existiendo carencias importantes.
Buena: el requisito se cumplió en gran medida, pero el problema es lo bastante significativo como para importar.
Muy buena: casi completamente cumplido, con solo un problema menor.
Cumplido por completo: no se encontró ningún problema relevante en esa dimensión.
Se utiliza cuando una dimensión realmente no aplica. No convertimos «no aplicable» en un 10/10 artificial.
Un ejemplo real: formato perfecto, significado cambiado
In Test 5, se pidió a cuatro asistentes que resumieran una nota de proyecto para un responsable. La fuente decía que el rediseño del sitio web «is planned for launch on 12 September». ChatGPT lo resumió como «Website redesign launches 12 September».
Por qué importa: la fecha se mantuvo, pero el estado no. «Planned for launch» expresa información condicional del proyecto; «launches» presenta el evento como seguro. En un resumen para responsables, eso puede cambiar de forma material las decisiones, los plazos y las expectativas basadas en el estado del proyecto.
La respuesta entendió que la tarea era un resumen conciso para responsables y conservó los temas relevantes del proyecto.
Se mantuvo dentro de 75 palabras, utilizó exactamente tres viñetas y empleó Status:, Risk: y Next action: tal como se solicitó.
El resultado es conciso y está correctamente formateado, pero convierte un lanzamiento planificado en uno definitivo. En un resumen dirigido a responsables, eso cambia el estado del proyecto relevante para la toma de decisiones y puede inducir materialmente a error en la planificación.
Lo que CLEAR hace — y lo que no afirma
Si una respuesta entendió la tarea, siguió los límites solicitados y entregó el resultado esperado, con un motivo visible para cada puntuación.
Que cada afirmación factual sea verdadera, que un asistente sea «el mejor» en general o que una única ejecución manual sea un benchmark científico de un modelo.
Cuando la verificación factual importa, las fuentes o afirmaciones pueden comprobarse por separado y documentarse como evidencia. CLEAR se centra en la calidad de la respuesta en relación con el prompt que realmente se probó.