Como testamos respostas de IA com CLEAR

Contexto. Limites. Resposta e resultado esperados.

CLEAR é o framework compacto por trás dos nossos Testes de qualidade das respostas. Os mesmos três elementos ajudam primeiro a definir um prompt e depois a avaliar até que ponto a primeira resposta o cumpriu.

Um framework, duas funções

O CLEAR é deliberadamente compacto. Ele usa as mesmas três perguntas ao escrever um prompt e ao avaliar a resposta. Assim, os critérios do teste ficam visíveis antes de um modelo responder, em vez de se inventar um sistema de pontuação depois.

C — Contexto

Ao criar o prompt: O que a IA precisa saber? Ao avaliar: A resposta entendeu e usou corretamente o contexto relevante?

L — Limites

Ao criar o prompt: Quais regras se aplicam? Ao avaliar: A resposta respeitou as regras, restrições e limites solicitados?

EAR

Ao criar o prompt: O que exatamente a IA deve retornar? Ao avaliar: A resposta realmente entregou a resposta e o resultado esperados?

Por que manter o método compacto? Uma nota só é útil quando o leitor consegue ver por que ela foi dada. O CLEAR mantém as dimensões amplas o suficiente para serem fáceis de lembrar, mas cada nota ainda precisa de uma explicação concreta e visível.

C — Contexto

O Contexto verifica se a resposta entendeu a situação apresentada. Isso pode incluir o objetivo do usuário, o público, o material de origem, o nível de conhecimento, fatos que precisam permanecer inalterados ou outras informações necessárias para responder corretamente à tarefa.

Exemplo: Se um prompt pedir uma explicação para uma pessoa de 15 anos que nunca estudou estatística, uma resposta forte deve simplificar o conceito para esse público sem substituir o conceito por algo incorreto.

Uma nota alta em Contexto não significa que toda afirmação factual da resposta foi verificada de forma independente. Significa que a resposta usou corretamente o contexto fornecido para aquela tarefa.

L — Limites

Limites são as regras explícitas que moldam a resposta. Sempre que possível, nós os tornamos verificáveis de forma objetiva: número de palavras, quantidade de tópicos, número de parágrafos, rótulos obrigatórios, uma frase final exigida ou uma restrição como usar apenas recursos gratuitos.

Meça primeiro

Verificações mecânicas, como contagem de palavras e quantidade obrigatória de itens, são registradas como fatos, e não estimadas pela aparência.

Depois avalie

Restrições que exigem julgamento — por exemplo, preservar o significado ou manter o tom solicitado — são explicadas na avaliação visível.

Importante: Seguir perfeitamente o formato não significa automaticamente produzir um resultado de alta qualidade. Uma resposta pode tirar 10/10 em Limites e ainda perder pontos em Resposta e resultado esperados se alterar o significado ou não cumprir a tarefa real.

EAR — Resposta e resultado esperados

EAR faz a pergunta mais prática: a resposta realmente entregou ao usuário o que ele precisava? É aqui que avaliamos completude, utilidade, preservação do significado e se o resultado é adequado ao objetivo solicitado.

Bom formato, resultado fraco

Uma resposta pode ficar abaixo do limite de palavras e usar os rótulos corretos, mas ainda omitir uma dependência importante, alterar o grau de certeza ou produzir algo que não esteja pronto para o uso pretendido.

Resultado forte

A resposta cumpre a tarefa como um todo: usa o contexto relevante, respeita as regras e preserva o significado e o resultado prático pedido pelo usuário.

Exemplo de e-mail: No nosso teste de reescrita de e-mail, um e-mail profissional pode preservar todos os fatos exigidos e ainda parecer incompleto se não tiver uma despedida normal. Isso não é necessariamente uma falha em Limites quando o prompt não exigiu explicitamente uma despedida, mas pode afetar EAR.

Como uma nota CLEAR é produzida

Cada Teste de qualidade das respostas segue a mesma sequência básica. O objetivo é repetibilidade e transparência, não afirmar que uma única execução manual seja um benchmark científico.

1
Fixe o prompt exato
O mesmo texto de prompt é usado para todos os assistentes naquele teste.
2
Registre a primeira resposta completa
Nova conversa, sem regenerar e sem prompt de continuação. A captura de tela original é mantida como evidência.
3
Registre as condições visíveis
Data, modelo exibido, conta, estado da web/pesquisa e outras configurações relevantes são documentados.
4
Verifique os limites mensuráveis
Contagens de palavras, tópicos, rótulos e outras restrições objetivas são verificadas diretamente.
5
Avalie C, L e EAR separadamente
Cada nota recebe um motivo visível. Não escondemos a justificativa atrás de uma nota total.

A escala de 1–10

1–3

Fraco: o requisito foi em grande parte descumprido.

4–6

Parcial: ainda existem falhas importantes.

7–8

Bom: o requisito foi atendido em grande parte, mas o problema é relevante o suficiente para ser considerado.

9

Muito bom: quase totalmente atendido, com apenas um problema pequeno.

10

Totalmente atendido: não foi encontrado nenhum problema relevante nessa dimensão.

N/A

Usado quando uma dimensão realmente não se aplica. Não transformamos “não se aplica” artificialmente em 10/10.

Por que não há uma nota geral ou um vencedor? Manter C, L e EAR separados torna as falhas mais fáceis de enxergar. Uma nota perfeita de formato não deve diluir, em uma média, uma alteração relevante de significado.

Um exemplo real: formato perfeito, significado alterado

In Test 5, quatro assistentes receberam a tarefa de resumir uma nota de projeto para um gerente. A fonte dizia que o redesign do site “is planned for launch on 12 September.” O ChatGPT resumiu isso como “Website redesign launches 12 September.”

Por que isso importa: a data foi preservada, mas o status não. “Planned for launch” é uma informação condicional do projeto; “launches” apresenta o evento como certo. Em um resumo gerencial, isso pode alterar de forma relevante decisões, prazos e expectativas baseados no status do projeto.

Contexto 10/10

A resposta entendeu que a tarefa era produzir um resumo gerencial conciso e manteve os tópicos relevantes do projeto.

Limites 10/10

Ela ficou dentro de 75 palavras, usou exatamente três tópicos e usou Status:, Risk: e Next action: como solicitado.

EAR 5/10

O resultado é conciso e está formatado corretamente, mas transforma um lançamento planejado em um lançamento certo. Em um resumo para um gerente, isso altera um status de projeto relevante para decisões e pode induzir o planejamento a erro de forma material.

Esse é o motivo pelo qual o CLEAR separa Limites de EAR: a resposta pode seguir todas as regras visíveis de formato e ainda ter um problema substancial de qualidade.

O que o CLEAR faz — e o que ele não afirma

O CLEAR foi criado para mostrar

Se uma resposta entendeu a tarefa, seguiu os limites solicitados e entregou o resultado esperado — com um motivo visível para cada nota.

O CLEAR não foi criado para provar

Que toda afirmação factual é verdadeira, que um assistente é geralmente “o melhor” ou que uma única execução manual seja um benchmark científico de um modelo.

Quando a verificação factual importa, fontes ou afirmações podem ser verificadas separadamente e documentadas como evidência. O CLEAR em si permanece focado na qualidade da resposta em relação ao prompt que foi realmente testado.

Veja o CLEAR aplicado a respostas reais

Abra os Testes de qualidade das respostas para comparar 24 respostas registradas manualmente em cinco prompts práticos e um bônus ético.

Compartilhar este guia CLEAR

Adicionar o PromptingEasy à sua tela

Use o menu do navegador e escolha a opção para instalar este site ou adicioná-lo à tela inicial.