Cómo evaluamos respuestas de IA con CLEAR

Contexto. Límites. Respuesta y Resultado Esperados.

CLEAR es el marco compacto que utilizamos en nuestras Pruebas de Calidad de Respuestas. Los mismos tres elementos ayudan a definir un prompt y después a evaluar hasta qué punto la primera respuesta lo cumplió.

Un marco, dos funciones

CLEAR es deliberadamente sencillo. Utiliza las mismas tres preguntas al redactar un prompt y al evaluar la respuesta. Así, los criterios de la prueba son visibles antes de que responda el modelo, en lugar de inventar un sistema de puntuación después.

C — Contexto

Al redactar el prompt: ¿Qué debe saber la IA? Al evaluar: ¿La respuesta entendió y utilizó correctamente el contexto relevante?

L — Límites

Al redactar el prompt: ¿Qué reglas se aplican? Al evaluar: ¿La respuesta respetó las reglas, restricciones y límites solicitados?

EAR

Al redactar el prompt: ¿Qué debe devolver exactamente la IA? Al evaluar: ¿La respuesta entregó realmente la respuesta y el resultado esperados?

¿Por qué mantenerlo compacto? Una puntuación solo es útil si el lector puede ver por qué se otorgó. CLEAR mantiene dimensiones lo bastante amplias para recordarlas, pero cada puntuación sigue necesitando una explicación concreta y visible.

C — Contexto

Contexto pregunta si la respuesta entendió la situación proporcionada. Puede incluir el objetivo del usuario, la audiencia, el material de origen, el nivel de conocimientos, hechos que deben permanecer sin cambios u otra información necesaria para resolver correctamente la tarea.

Ejemplo: Si un prompt pide una explicación para una persona de 15 años que nunca ha estudiado estadística, una buena respuesta debe simplificar el concepto para esa audiencia sin sustituirlo por algo inexacto.

Una puntuación alta en Contexto no significa que cada afirmación factual de la respuesta se haya verificado de forma independiente. Significa que la respuesta utilizó correctamente el contexto proporcionado para esa tarea.

L — Límites

Los Límites son las reglas explícitas que dan forma a la respuesta. Siempre que es posible, hacemos que puedan comprobarse objetivamente: número de palabras, cantidad de viñetas, número de párrafos, etiquetas obligatorias, una frase final requerida o una restricción como usar únicamente recursos gratuitos.

Primero, medir

Las comprobaciones mecánicas, como el número de palabras o de elementos requeridos, se registran como hechos y no se estiman por apariencia.

Después, evaluar

Las restricciones que requieren criterio —por ejemplo, conservar el significado o mantener el tono solicitado— se explican en la evaluación visible.

Importante: Cumplir perfectamente el formato no implica automáticamente un resultado de alta calidad. Una respuesta puede obtener 10/10 en Límites y aun así perder puntos en Respuesta y Resultado Esperados si cambia el significado o no resuelve la tarea real.

EAR — Respuesta y Resultado Esperados

EAR plantea la pregunta más práctica: ¿la respuesta dio realmente al usuario lo que necesitaba? Aquí evaluamos la integridad, la utilidad, la conservación del significado y si el resultado es adecuado para el propósito solicitado.

Buen formato, resultado débil

Una respuesta puede mantenerse por debajo del límite de palabras y usar las etiquetas correctas, pero aun así omitir una dependencia importante, cambiar el grado de certeza o producir algo que no esté listo para el uso previsto.

Resultado sólido

La respuesta cumple la tarea en su conjunto: usa el contexto relevante, respeta las reglas y conserva el significado y el resultado práctico solicitado por el usuario.

Ejemplo de correo electrónico: En nuestra prueba de reescritura de correo, un correo profesional puede conservar todos los hechos requeridos y aun así parecer incompleto si omite una despedida habitual. No es necesariamente un fallo de Límites si el prompt no la exigía explícitamente, pero puede afectar a EAR.

Cómo se obtiene una puntuación CLEAR

Cada Prueba de Calidad de Respuestas sigue la misma secuencia básica. El objetivo es la repetibilidad y la transparencia, no afirmar que una única ejecución manual sea un benchmark científico.

1
Fijar el prompt exacto
Se utiliza exactamente el mismo texto del prompt para cada asistente de esa prueba.
2
Capturar la primera respuesta completa
Chat nuevo, sin regenerar y sin seguimiento. La captura de pantalla original se conserva como prueba.
3
Registrar las condiciones visibles
Se documentan la fecha, el modelo mostrado, la cuenta, el estado de web/búsqueda y otros ajustes relevantes.
4
Comprobar los límites medibles
El número de palabras, las viñetas, las etiquetas y otras restricciones objetivas se comprueban directamente.
5
Puntuar C, L y EAR por separado
Cada puntuación tiene un motivo visible. No ocultamos la justificación detrás de una puntuación total.

La escala del 1 al 10

1–3

Deficiente: el requisito se incumplió en gran medida.

4–6

Parcial: siguen existiendo carencias importantes.

7–8

Buena: el requisito se cumplió en gran medida, pero el problema es lo bastante significativo como para importar.

9

Muy buena: casi completamente cumplido, con solo un problema menor.

10

Cumplido por completo: no se encontró ningún problema relevante en esa dimensión.

N/A

Se utiliza cuando una dimensión realmente no aplica. No convertimos «no aplicable» en un 10/10 artificial.

¿Por qué no hay una puntuación global de ganador? Mantener C, L y EAR separados facilita ver los fallos. Una puntuación perfecta de formato no debe diluir un cambio material de significado al calcular una media.

Un ejemplo real: formato perfecto, significado cambiado

In Test 5, se pidió a cuatro asistentes que resumieran una nota de proyecto para un responsable. La fuente decía que el rediseño del sitio web «is planned for launch on 12 September». ChatGPT lo resumió como «Website redesign launches 12 September».

Por qué importa: la fecha se mantuvo, pero el estado no. «Planned for launch» expresa información condicional del proyecto; «launches» presenta el evento como seguro. En un resumen para responsables, eso puede cambiar de forma material las decisiones, los plazos y las expectativas basadas en el estado del proyecto.

Contexto 10/10

La respuesta entendió que la tarea era un resumen conciso para responsables y conservó los temas relevantes del proyecto.

Límites 10/10

Se mantuvo dentro de 75 palabras, utilizó exactamente tres viñetas y empleó Status:, Risk: y Next action: tal como se solicitó.

EAR 5/10

El resultado es conciso y está correctamente formateado, pero convierte un lanzamiento planificado en uno definitivo. En un resumen dirigido a responsables, eso cambia el estado del proyecto relevante para la toma de decisiones y puede inducir materialmente a error en la planificación.

Esta es la razón por la que CLEAR separa Límites de EAR: la respuesta puede cumplir todas las reglas visibles de formato y aun así tener un problema sustancial de calidad.

Lo que CLEAR hace — y lo que no afirma

CLEAR está diseñado para mostrar

Si una respuesta entendió la tarea, siguió los límites solicitados y entregó el resultado esperado, con un motivo visible para cada puntuación.

CLEAR no está diseñado para demostrar

Que cada afirmación factual sea verdadera, que un asistente sea «el mejor» en general o que una única ejecución manual sea un benchmark científico de un modelo.

Cuando la verificación factual importa, las fuentes o afirmaciones pueden comprobarse por separado y documentarse como evidencia. CLEAR se centra en la calidad de la respuesta en relación con el prompt que realmente se probó.

Ver CLEAR aplicado a respuestas reales

Abre las Pruebas de Calidad de Respuestas para comparar 24 respuestas capturadas manualmente en cinco prompts prácticos y un bonus ético.

Compartir esta guía de CLEAR

Añadir PromptingEasy a tu pantalla

Abre el menú del navegador y selecciona la opción para instalar este sitio o añadirlo a la pantalla de inicio.