Um framework, duas funções
O CLEAR é deliberadamente compacto. Ele usa as mesmas três perguntas ao escrever um prompt e ao avaliar a resposta. Assim, os critérios do teste ficam visíveis antes de um modelo responder, em vez de se inventar um sistema de pontuação depois.
Ao criar o prompt: O que a IA precisa saber? Ao avaliar: A resposta entendeu e usou corretamente o contexto relevante?
Ao criar o prompt: Quais regras se aplicam? Ao avaliar: A resposta respeitou as regras, restrições e limites solicitados?
Ao criar o prompt: O que exatamente a IA deve retornar? Ao avaliar: A resposta realmente entregou a resposta e o resultado esperados?
C — Contexto
O Contexto verifica se a resposta entendeu a situação apresentada. Isso pode incluir o objetivo do usuário, o público, o material de origem, o nível de conhecimento, fatos que precisam permanecer inalterados ou outras informações necessárias para responder corretamente à tarefa.
Uma nota alta em Contexto não significa que toda afirmação factual da resposta foi verificada de forma independente. Significa que a resposta usou corretamente o contexto fornecido para aquela tarefa.
L — Limites
Limites são as regras explícitas que moldam a resposta. Sempre que possível, nós os tornamos verificáveis de forma objetiva: número de palavras, quantidade de tópicos, número de parágrafos, rótulos obrigatórios, uma frase final exigida ou uma restrição como usar apenas recursos gratuitos.
Verificações mecânicas, como contagem de palavras e quantidade obrigatória de itens, são registradas como fatos, e não estimadas pela aparência.
Restrições que exigem julgamento — por exemplo, preservar o significado ou manter o tom solicitado — são explicadas na avaliação visível.
EAR — Resposta e resultado esperados
EAR faz a pergunta mais prática: a resposta realmente entregou ao usuário o que ele precisava? É aqui que avaliamos completude, utilidade, preservação do significado e se o resultado é adequado ao objetivo solicitado.
Uma resposta pode ficar abaixo do limite de palavras e usar os rótulos corretos, mas ainda omitir uma dependência importante, alterar o grau de certeza ou produzir algo que não esteja pronto para o uso pretendido.
A resposta cumpre a tarefa como um todo: usa o contexto relevante, respeita as regras e preserva o significado e o resultado prático pedido pelo usuário.
Como uma nota CLEAR é produzida
Cada Teste de qualidade das respostas segue a mesma sequência básica. O objetivo é repetibilidade e transparência, não afirmar que uma única execução manual seja um benchmark científico.
A escala de 1–10
Fraco: o requisito foi em grande parte descumprido.
Parcial: ainda existem falhas importantes.
Bom: o requisito foi atendido em grande parte, mas o problema é relevante o suficiente para ser considerado.
Muito bom: quase totalmente atendido, com apenas um problema pequeno.
Totalmente atendido: não foi encontrado nenhum problema relevante nessa dimensão.
Usado quando uma dimensão realmente não se aplica. Não transformamos “não se aplica” artificialmente em 10/10.
Um exemplo real: formato perfeito, significado alterado
In Test 5, quatro assistentes receberam a tarefa de resumir uma nota de projeto para um gerente. A fonte dizia que o redesign do site “is planned for launch on 12 September.” O ChatGPT resumiu isso como “Website redesign launches 12 September.”
Por que isso importa: a data foi preservada, mas o status não. “Planned for launch” é uma informação condicional do projeto; “launches” apresenta o evento como certo. Em um resumo gerencial, isso pode alterar de forma relevante decisões, prazos e expectativas baseados no status do projeto.
A resposta entendeu que a tarefa era produzir um resumo gerencial conciso e manteve os tópicos relevantes do projeto.
Ela ficou dentro de 75 palavras, usou exatamente três tópicos e usou Status:, Risk: e Next action: como solicitado.
O resultado é conciso e está formatado corretamente, mas transforma um lançamento planejado em um lançamento certo. Em um resumo para um gerente, isso altera um status de projeto relevante para decisões e pode induzir o planejamento a erro de forma material.
O que o CLEAR faz — e o que ele não afirma
Se uma resposta entendeu a tarefa, seguiu os limites solicitados e entregou o resultado esperado — com um motivo visível para cada nota.
Que toda afirmação factual é verdadeira, que um assistente é geralmente “o melhor” ou que uma única execução manual seja um benchmark científico de um modelo.
Quando a verificação factual importa, fontes ou afirmações podem ser verificadas separadamente e documentadas como evidência. O CLEAR em si permanece focado na qualidade da resposta em relação ao prompt que foi realmente testado.