Mismos prompts, 4 respuestas de IA

Prompts idénticos — respuestas reales — evaluaciones CLEAR

Damos los mismos prompts a cuatro asistentes de IA y comparamos sus primeras respuestas
con CLEAR: Context (Contexto), Limits (Límites) y Expected Answer & Result (Respuesta y Resultado Esperados) — el sistema de PromptingEasy para evaluar la calidad de las respuestas. Cada respuesta se captura manualmente y se conserva con una captura de pantalla como evidencia.

Prompt de prueba original 1 de 5

Do you hallucinate from time to time?

If so, why does it happen, and what can a user do to reduce the risk from the beginning? Answer in 100 words or fewer. Use exactly 3 bullet points. Do not add any text before or after the bullets.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro
  • Yes. I can sometimes produce plausible-sounding but false information—often called a hallucination.
  • It happens because language models predict likely text rather than retrieve guaranteed facts; training and evaluation can also reward guessing instead of admitting uncertainty.
  • Reduce the risk by giving precise context, asking me to state uncertainty, requesting sources or web verification, and independently checking important claims—especially for medical, legal, financial, or time-sensitive decisions.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Aborda directamente las alucinaciones, por qué se producen y cómo prevenirlas, sin desviarse hacia capacidades de IA no relacionadas.

L
Límites10/10

Se cumplieron las tres restricciones explícitas de formato.

65 / 100 palabras ✓3 viñetas ✓Solo viñetas ✓

Evaluación: Se cumplen todas las restricciones explícitas.

EAR
Respuesta y Resultado Esperados10/10

Explica la generación probabilística y ofrece medidas concretas de prevención, como aportar contexto, señalar la incertidumbre, pedir fuentes o verificación web y revisar de forma independiente.

Claude

Modelo:
Opus 5
Cuentas:
Pro
  • Yes. I generate plausible text rather than looking facts up, so when my training data is thin, outdated, or ambiguous, I can produce confident-sounding errors — fabricated citations, quotes, statistics, or details.
  • Why: I'm optimized to give an answer, not to detect my own gaps; obscure specifics, precise numbers, and niche sources are the riskiest territory.
  • What helps: ask me to search or paste the source material; request uncertainty flags and citations you can verify; keep questions specific; and independently check anything with real consequences.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende la tarea como una explicación concisa de las causas de las alucinaciones acompañada de acciones preventivas para el usuario.

L
Límites10/10

Se cumplieron las tres restricciones explícitas de formato.

84 / 100 palabras ✓3 viñetas ✓Solo viñetas ✓

Evaluación: Se cumplen todas las restricciones explícitas.

EAR
Respuesta y Resultado Esperados10/10

Explica claramente el mecanismo, identifica situaciones de mayor riesgo y ofrece varias medidas prácticas de prevención, desde aportar material de origen hasta realizar revisiones independientes.

Grok

Modelo:
Grok 4.5
Cuentas:
Free
  • Yes, AI models can generate inaccurate or fabricated information occasionally.
  • It stems from probabilistic pattern matching on training data, not true understanding or perfect recall.
  • Users can reduce risk by verifying claims against reliable sources, requesting citations, and supplying precise context from the start.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Responde directamente a las tres partes y mantiene el foco en el riesgo práctico de las alucinaciones.

L
Límites10/10

Se cumplieron las tres restricciones explícitas de formato.

44 / 100 palabras ✓3 viñetas ✓Solo viñetas ✓

Evaluación: Se cumplen todas las restricciones explícitas.

EAR
Respuesta y Resultado Esperados9/10

Explica con claridad la causa y la prevención, aunque con menos detalle sobre situaciones de mayor riesgo y técnicas preventivas que las otras respuestas.

Perplexity

Modelo:
Auto
Cuentas:
Free
  • Yes. I can occasionally hallucinate—produce plausible-sounding but incorrect, fabricated, or outdated information.
  • This happens because I generate likely text from patterns rather than directly “knowing” facts; ambiguity, incomplete context, rare topics, conflicting sources, and rapidly changing information increase the risk.
  • Reduce it by asking precise, contextual questions; requesting citations, dates, and uncertainty; asking me to verify important claims; providing authoritative source material; and independently checking high-stakes information.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Usa correctamente el contexto solicitado y cubre el fenómeno, los factores que contribuyen a él y la prevención.

L
Límites10/10

Se cumplieron las tres restricciones explícitas de formato.

67 / 100 palabras ✓3 viñetas ✓Solo viñetas ✓

Evaluación: Se cumplen todas las restricciones explícitas.

EAR
Respuesta y Resultado Esperados10/10

Explica varios factores de riesgo y ofrece un conjunto amplio de acciones preventivas, como citas, fechas, fuentes autorizadas, indicación de incertidumbre y revisiones independientes.

Lo que aprendimos

Los cuatro asistentes respondieron al mismo prompt con las mismas restricciones visibles de formato. La primera ejecución muestra un seguimiento consistente de las instrucciones; las diferencias más útiles aparecieron en el grado de precisión con que cada respuesta explicó el riesgo y cómo reducirlo.

1
Los cuatro cumplieron los tres límites

Todas las respuestas se mantuvieron por debajo de 100 palabras, usaron exactamente tres viñetas y no agregaron texto antes ni después de ellas.

2
El cumplimiento del formato no diferenció a los asistentes

El número de palabras osciló entre 44 para Grok y 84 para Claude, por lo que las diferencias relevantes estuvieron en la profundidad de la explicación y los consejos de prevención, no en el seguimiento de instrucciones.

3
Los consejos de prevención coincidieron en gran medida

Los cuatro recomendaron aportar mejor contexto y algún tipo de verificación. ChatGPT, Claude y Perplexity agregaron orientaciones más explícitas sobre incertidumbre, citas o material de origen.

4
Grok fue el más conciso

Su respuesta de 44 palabras explicó con claridad la causa y la prevención, pero con menos detalle sobre cuándo son más probables las alucinaciones y cómo verificar afirmaciones de mayor impacto.

Conclusión de la prueba 1

Para este prompt, los cuatro asistentes respetaron los límites medibles. La principal diferencia de calidad fue la especificidad: las respuestas más largas ofrecieron técnicas de prevención más concretas, mientras que Grok priorizó la brevedad.

Prompt de prueba original 2 de 5

Rewrite an email without changing its facts

Vista previa exacta del prompt: Rewrite this email so it sounds professional, clear, and calm without changing the meaning — use 80 words or fewer, exactly 2 paragraphs, and preserve all three facts.

Rewrite this email so it sounds professional, clear, and calm without changing the meaning:

Hi Alex, just wanted to say the report is late because the supplier sent the figures only today. I can finish it Friday. The budget is still €5,000 and our meeting stays Monday at 10:00. Sorry for the delay.

Use 80 words or fewer. Use exactly 2 paragraphs. Preserve all three facts.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro

Hi Alex, the report is delayed because the supplier only provided the figures today. I will be able to complete it by Friday.

The budget remains €5,000, and our meeting is still scheduled for Monday at 10:00. Apologies for the delay, and thank you for your understanding.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Conserva la situación y la intención del correo original y hace que la redacción sea más profesional, clara y tranquila.

L
Límites10/10

Se cumplieron los tres límites medibles.

47 / 80 palabras ✓2 párrafos de cuerpo ✓Friday ✓€5,000 ✓Monday at 10:00 ✓

Evaluación: Se cumplen los tres límites del prompt; la conservación de los hechos se muestra mediante tres revisiones separadas.

EAR
Respuesta y Resultado Esperados8/10

Los hechos y el tono están bien conservados, pero el saludo queda integrado en el primer párrafo del cuerpo y no hay despedida, por lo que el resultado parece menos completo como correo convencional listo para enviar.

Claude

Modelo:
Opus 5
Cuentas:
Pro

Hi Alex,

The report has been delayed because the supplier sent the figures only today. I expect to have it completed by Friday.

The budget remains €5,000, and our meeting is still set for Monday at 10:00. Apologies for the delay.

Best regards,

(Two body paragraphs, 42 words; greeting and sign-off excluded.)

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Conserva la situación y el significado originales y convierte el mensaje en un correo profesional y sereno.

L
Límites10/10

El correo se mantiene por debajo de 80 palabras, usa dos párrafos de cuerpo y conserva los tres hechos.

52 / 80 palabras ✓2 párrafos de cuerpo ✓Friday ✓€5,000 ✓Monday at 10:00 ✓

Evaluación: Se cumplen los tres límites del prompt; la conservación de los hechos se muestra mediante tres revisiones separadas.

EAR
Respuesta y Resultado Esperados9/10

El correo en sí es sólido y es la única respuesta con despedida, pero la revisión adicional entre paréntesis hace que el resultado sea menos directo para copiar y enviar.

Grok

Modelo:
Grok 4.5
Cuentas:
Free

Hi Alex,

The report is delayed because the supplier sent the figures only today. I will finish it by Friday.

The budget remains €5,000 and our meeting is still scheduled for Monday at 10:00. I apologize for the delay.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende la tarea como una reescritura de tono y claridad y mantiene sin cambios el mensaje de fondo.

L
Límites10/10

Se cumplieron los tres límites medibles al considerar el saludo separado de los dos párrafos de cuerpo.

39 / 80 palabras ✓2 párrafos de cuerpo ✓Friday ✓€5,000 ✓Monday at 10:00 ✓

Evaluación: Se cumplen los tres límites del prompt; la conservación de los hechos se muestra mediante tres revisiones separadas.

EAR
Respuesta y Resultado Esperados9/10

El saludo está correctamente separado y los dos párrafos del cuerpo son claros, pero el mensaje no tiene despedida pese a disponer de margen suficiente dentro del límite de palabras.

Perplexity

Modelo:
Auto
Cuentas:
Free

Hi Alex, the report is delayed because the supplier provided the figures only today. I can complete it by Friday.

The budget remains €5,000, and our meeting is still scheduled for Monday at 10:00. Apologies for the delay.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Reescribe directamente el mensaje original y mantiene el tono profesional, claro y tranquilo solicitado.

L
Límites10/10

Se cumplieron los tres límites medibles.

38 / 80 palabras ✓2 párrafos de cuerpo ✓Friday ✓€5,000 ✓Monday at 10:00 ✓

Evaluación: Se cumplen los tres límites del prompt; la conservación de los hechos se muestra mediante tres revisiones separadas.

EAR
Respuesta y Resultado Esperados8/10

La reescritura conserva los hechos y el tono, pero el saludo se integra en el primer párrafo y no hay despedida, por lo que el correo parece menos completo.

Lo que aprendimos

Los cuatro asistentes conservaron los tres hechos requeridos y se mantuvieron holgadamente por debajo de 80 palabras. La diferencia de calidad más clara fue la integridad del correo: un mensaje convencional listo para enviar suele separar el saludo, el cuerpo y la despedida.

1
Los tres hechos se conservaron en todas las reescrituras

ChatGPT, Claude, Grok y Perplexity conservaron Friday, €5,000 y Monday at 10:00.

2
Los cuatro se mantuvieron muy por debajo de 80 palabras

Las respuestas completas oscilaron entre 38 palabras para Perplexity y 52 para Claude. Todos los asistentes tenían margen para devolver una estructura de correo completa sin acercarse al límite.

3
Solo Claude devolvió la estructura completa de un correo

Claude separó «Hi Alex,» de los dos párrafos del cuerpo y agregó «Best regards,». Grok separó el saludo pero omitió la despedida; ChatGPT y Perplexity integraron el saludo en el primer párrafo y también omitieron la despedida.

4
El prompt reveló una expectativa de calidad útil

La despedida no se definió como un Límite estricto, por lo que su ausencia no se puntúa como un fallo de Límites. Sin embargo, sí es relevante para Respuesta y Resultado Esperados porque la tarea pedía reescribir un correo profesional, no solo producir texto de cuerpo aislado.

Conclusión de la prueba 2

La conservación de los hechos y las restricciones explícitas fue sólida en las cuatro respuestas. Claude fue el único asistente que devolvió un saludo, dos párrafos de cuerpo y una despedida; su único inconveniente fue la nota explicativa adicional después del correo.

Prompt de prueba original 3 de 5

Explain correlation vs. causation to a 15-year-old

Vista previa exacta del prompt: Explain the difference between correlation and causation to a 15-year-old — use 200 words or fewer, exactly 2 everyday examples, and finish with “Rule of thumb:”.

Explain the difference between correlation and causation to a 15-year-old who has never studied statistics. Use 200 words or fewer. Include exactly 2 everyday examples. End with one sentence beginning “Rule of thumb:”.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro

Correlation means two things are connected or tend to happen together. Causation means one thing actually makes the other happen.

Example 1: On hot days, more people buy ice cream, and more people get sunburned. Ice cream sales and sunburns are correlated—they both increase at the same time. But buying ice cream does not cause sunburn. The real reason behind both is hot, sunny weather.

Example 2: Imagine students who sleep more usually get better test scores. Sleep and test scores are correlated. But that alone doesn’t prove extra sleep causes better scores. Maybe those students also study more, have less stress, or follow better routines. You would need stronger evidence to show that sleep itself causes the improvement.

So, correlation is like saying, “These two things move together,” while causation is saying, “This thing makes that thing happen.”

Rule of thumb: Just because two things happen together doesn’t mean one caused the other.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Explica el concepto para una audiencia principiante y distingue directamente asociación de causalidad sin presuponer conocimientos previos de estadística.

L
Límites10/10

Se cumplieron los tres límites explícitos.

154 / 200 palabras ✓2 ejemplos cotidianos ✓Termina con «Rule of thumb:» ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Definiciones claras, dos ejemplos familiares y una regla final sencilla hacen que la respuesta sea fácil de entender y aplicar.

Claude

Modelo:
Opus 5
Cuentas:
Pro

Correlation means two things tend to show up together. When one goes up, the other goes up (or down) too. Causation means one thing actually makes the other happen.

The tricky part: things can move together without one causing the other.

Example 1: In a city, ice cream sales and swimming pool drownings rise at the same time. Ice cream doesn't cause drowning. Hot weather causes both — more people buy ice cream and more people swim. That hidden third factor is called a confounder.

Example 2: Kids with bigger feet tend to read better. Bigger feet don't make you a better reader. Older kids just have bigger feet and more years of school behind them. Age is doing the real work.

Notice both examples have the same shape: a sneaky third thing explains the pattern. Sometimes there's no third thing at all and it's pure coincidence — with enough data, random pairs will line up by chance.

The only reliable way to prove causation is to actually change one thing while holding everything else steady, then see what happens. That's what an experiment is.

Rule of thumb: when two things move together, ask "what else could be causing both?" before assuming one caused the other.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende la tarea didáctica para principiantes y explica la distinción con lenguaje sencillo, ejemplos y la idea de una variable de confusión.

L
Límites9/10

Se cumplieron dos límites estructurales, pero la respuesta superó el máximo de 200 palabras por 6.

206 / 200 palabras ✕2 ejemplos cotidianos ✓Termina con «Rule of thumb:» ✓

Evaluación: Se cumplen dos de los tres límites medibles; se supera el máximo de palabras.

EAR
Respuesta y Resultado Esperados9/10

Completa e instructiva, pero más detallada de lo necesario para este prompt y ligeramente por encima de la longitud solicitada.

Grok

Modelo:
Grok 4.5
Cuentas:
Free

Correlation means two things happen together or change at the same time. Causation means one thing actually makes the other happen.

Example 1: Ice-cream sales and sunglasses sales both rise in summer. Buying ice cream doesn’t make people buy sunglasses—the hot, sunny weather drives both.

Example 2: The more fire trucks that arrive at a blaze, the bigger the damage usually is. Extra trucks don’t cause more destruction; bigger fires simply need more trucks.

Rule of thumb: Just because two things move together does not mean one causes the other.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Adapta directamente la explicación a una persona principiante y distingue correlación de causalidad sin introducir terminología innecesaria.

L
Límites10/10

Se cumplieron los tres límites explícitos, con un margen amplio respecto al máximo de palabras.

90 / 200 palabras ✓2 ejemplos cotidianos ✓Termina con «Rule of thumb:» ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados9/10

Muy concisa y clara, con dos ejemplos útiles. Ofrece menos profundidad explicativa que las respuestas más largas, pero aun así completa la tarea solicitada.

Perplexity

Modelo:
Auto
Cuentas:
Free

Correlation means two things tend to happen together; causation means one thing actually makes the other happen. Just because two patterns line up doesn’t mean one causes the other—there could be a hidden third factor, or it could be coincidence.

Everyday example 1: Ice cream and sunburn

On hot days, more people buy ice cream and more people get sunburned. Ice cream sales and sunburns are correlated, but eating ice cream doesn’t cause sunburn. The hidden cause is sunny, hot weather: it makes people crave cold treats and also spend more time outside without enough sunscreen.

Everyday example 2: Homework time and grades

Students who spend more time on homework often get better grades. That’s a correlation. Sometimes extra study really does cause higher grades (causation). But other times, a third factor—like being more organized or having a quieter home—makes both longer homework time and better grades more likely.

To tell correlation from causation, ask: “If I change just this one thing, will the other thing change because of it?” Scientists test this with experiments or by carefully ruling out other explanations.

Rule of thumb: If two things move together, look for a real mechanism or an experiment before saying one causes the other.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Explica la distinción con lenguaje accesible, introduce explícitamente la idea de un factor oculto y mantiene ejemplos adecuados para una persona principiante.

L
Límites9/10

Se cumplieron los dos requisitos estructurales, pero la respuesta superó el máximo de 200 palabras por 4.

204 / 200 palabras ✕2 ejemplos cotidianos ✓Termina con «Rule of thumb:» ✓

Evaluación: Se cumplen dos de los tres límites medibles; se supera el máximo de palabras.

EAR
Respuesta y Resultado Esperados10/10

Una respuesta didáctica sólida con dos ejemplos cotidianos claramente etiquetados y una regla práctica para distinguir correlación de causalidad.

Lo que aprendimos

Los cuatro asistentes explicaron la distinción principal y ofrecieron exactamente dos ejemplos, pero el límite de 200 palabras marcó la diferencia: ChatGPT y Grok se mantuvieron dentro, mientras que Claude y Perplexity lo superaron ligeramente.

1
El límite de longitud finalmente diferenció a los asistentes

Grok utilizó 90 palabras y ChatGPT 154. Perplexity llegó a 204 y Claude a 206, superando el máximo de 200 por 4 y 6 palabras respectivamente.

2
Los cuatro ofrecieron exactamente dos ejemplos

Cada respuesta utilizó dos comparaciones cotidianas para mostrar que dos cosas pueden variar juntas sin que una cause directamente la otra.

3
Los cuatro respetaron el final requerido

Cada asistente terminó con una frase que comenzaba por «Rule of thumb:», lo que facilita revisar este requisito estructural entre modelos.

4
Grok volvió a ser el más conciso

Con 90 palabras, Grok utilizó menos de la mitad de la longitud permitida y aun así cumplió los tres límites explícitos. La contrapartida fue una menor profundidad explicativa, no una respuesta visiblemente truncada.

Conclusión de la prueba 3

Más palabras no significaron automáticamente un mejor seguimiento de instrucciones. Las dos respuestas más largas superaron ligeramente el límite estricto, mientras que la más corta completó la estructura y los ejemplos solicitados.

Prompt de prueba original 4 de 5

Build a 4-week spoken-English plan using only free resources

Vista previa exacta del prompt: Build a 4-week spoken-English plan with 30 minutes per weekday — exactly 4 numbered steps, max 250 words, free resources only.

I have 30 minutes on weekdays for the next 4 weeks and want to improve my spoken English for everyday conversations. I can use only free resources. Create a practical plan I can start tomorrow. Use exactly 4 numbered steps. Keep the whole answer to 250 words or fewer. Recommend only activities or resources that can be done for free.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro

1. Week 1 — Build a daily speaking habit. Starting Thursday, August 20, spend 30 minutes each weekday: 10 min listening to a short VOA Learning English lesson, 10 min pausing and repeating sentences aloud, and 10 min recording yourself retelling the lesson. VOA provides free speaking, vocabulary, listening, and video materials.

2. Week 2 — Practice everyday situations. Keep the same 30-minute structure, but role-play one situation each day: introductions, ordering food, shopping, asking directions, and making weekend plans. Speak both sides of the conversation. When you need a natural phrase, search it on YouGlish and imitate 3–5 real examples.

3. Week 3 — Improve fluency. Spend 10 min listening/shadowing, then 15 min answering everyday questions aloud without writing first, such as “What did you do yesterday?” or “What are your plans?” Finish with a 5-minute recording. Recording yourself helps you notice pronunciation, vocabulary, sentence structure, and fluency.

4. Week 4 — Simulate real conversations. Each weekday, choose one familiar topic and speak for 20 minutes through questions, answers, follow-ups, and clarifications. Use the final 10 minutes to replay your recording, identify three problems, and repeat the corrected sentences. Aim for smoother communication rather than perfect grammar; daily speaking practice is the priority.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Usa correctamente el tiempo disponible, el horizonte de cuatro semanas y el objetivo de conversación cotidiana, y sitúa el inicio del plan en el día siguiente.

L
Límites10/10

Se cumplieron los tres límites explícitos.

204 / 250 palabras ✓4 pasos numerados ✓Solo recursos gratuitos ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Una progresión práctica de cuatro semanas con una distribución diaria clara del tiempo, recursos gratuitos y práctica oral que puede empezar de inmediato.

Claude

Modelo:
Opus 5
Cuentas:
Pro

Here's a routine you can repeat every weekday, with a topic that changes weekly (Week 1: daily life; Week 2: work/study; Week 3: opinions and small talk; Week 4: storytelling about your past).

1. Listen and shadow (10 min). Pick a short clip on your weekly topic — BBC Learning English, VOA Learning English, or Easy English on YouTube all have free everyday-conversation videos. Play a 1-2 minute section, then replay it line by line and speak along out loud, copying the rhythm and stress rather than just the words.

2. Mine 5 phrases (5 min). Write down five useful expressions from the clip — whole chunks like “I was just about to...”, not single words. Check pronunciation free on Cambridge Dictionary Online, which plays audio for every entry. Keep them in one running list or a free Anki deck.

3. Record yourself (10 min). Using your phone's voice recorder, talk for two minutes on a prompt tied to the week's topic (“Describe your morning”), forcing at least three of today's phrases. Listen back once, note one thing to fix, then record the same prompt again. This second take is where the improvement happens.

4. Talk to a real person (5 min, or longer on Fridays). Send a voice message on HelloTalk or Tandem (free tiers allow this), or post on Reddit's r/language_exchange to find a partner. On Fridays, swap the whole 30 minutes for a live call.

Track it: keep the recordings. Comparing Week 1 to Week 4 is the clearest proof you're improving.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende el objetivo como una rutina repetible de conversación entre semana y combina una progresión temática semanal con escucha, grabación y conversación real.

L
Límites9/10

Se cumplieron la estructura y el requisito de recursos gratuitos, pero la respuesta completa superó el máximo de 250 palabras por 5.

255 / 250 palabras ✕4 pasos numerados ✓Solo recursos gratuitos ✓

Evaluación: Se cumplen dos de los tres límites medibles; el máximo de palabras se supera por 5.

EAR
Respuesta y Resultado Esperados10/10

El plan es detallado y práctico, con una rutina coherente de 30 minutos, cambios de tema semanales, auto-grabación y práctica de conversación en directo.

Grok

Modelo:
Grok 4.5
Cuentas:
Free

1. Days 1–5 (Week 1 focus): Spend 10 min listening to free everyday dialogues on YouTube (search “BBC Learning English 6 Minute English” or “Easy English conversations”). Shadow aloud for 10 min, copying rhythm and intonation. End with 10 min recording yourself describing your day; replay and note 2–3 pronunciation fixes.

2. Days 6–10 (Week 2): Repeat the same listening/shadowing (15 min total) using new free episodes. Switch the final 15 min to free language-exchange apps (HelloTalk or Tandem free tiers): send 2–3 short voice messages on simple topics like food or weather and reply to partners.

3. Days 11–15 (Week 3): 10 min free podcast listening (e.g., “The English We Speak” on BBC Sounds), 10 min shadowing key phrases. 10 min role-play everyday scenarios aloud (ordering coffee, asking directions) while recording; compare to native audio.

4. Days 16–20 (Week 4): Mix prior activities into 30 min: 8 min listen/shadow, 12 min free voice chats or self-role-plays on apps, 10 min review recordings and list 5 useful phrases to reuse tomorrow. Track progress by re-recording Week 1 topics.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Convierte la restricción de cuatro semanas y 30 minutos por día laborable en una progresión día a día centrada en escucha, shadowing, grabación y conversación.

L
Límites10/10

Se cumplieron los tres límites explícitos.

178 / 250 palabras ✓4 pasos numerados ✓Solo recursos gratuitos ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Concisa pero práctica: cada semana tiene un enfoque claro, el tiempo diario está distribuido y las actividades recomendadas se pueden aplicar directamente.

Perplexity

Modelo:
Auto
Cuentas:
Free

1. Daily routine (30 minutes): Spend 8 minutes on a free British Council speaking lesson at your level. Listen to the dialogue, read the transcript, and note five useful phrases. These lessons focus on everyday situations and include repeat-after-me practice.

2. Shadowing (8 minutes): Replay the dialogue sentence by sentence. Pause, copy the speaker’s pronunciation and rhythm aloud, then record yourself on your phone. Compare once and repeat the weakest sentences. Use British Council audio/video or VOA’s free “How to Pronounce” series.

3. Conversation practice (10 minutes): Speak without notes about the day’s topic: introducing yourself, shopping, making plans, giving opinions, asking for help, or telling a short story. Then ask and answer three follow-up questions aloud. On two weekdays each week, use a free speaking partner, language-exchange group, or the British Council Learning Hub’s free recording and commenting activities.

4. Four-week progression and review (4 minutes): Week 1: introductions and daily routines. Week 2: requests, shopping, and travel. Week 3: opinions, feelings, and keeping conversations going. Week 4: mixed role-plays and a five-minute conversation. Every Friday, replay Monday’s recording, list three improvements and three recurring errors, and choose five phrases to reuse next week. All recommended British Council materials are free; most require no account.

CLEAR evaluaciónRevisión manual
C
Contexto10/10

Reconoce la necesidad de una rutina de 30 minutos entre semana, materiales gratuitos, práctica de conversación y una progresión de cuatro semanas.

L
Límites10/10

Se cumplieron los tres límites explícitos.

206 / 250 palabras ✓4 pasos numerados ✓Solo recursos gratuitos ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados9/10

Las actividades son útiles y los tiempos de los cuatro pasos suman 30 minutos, pero el primer encabezado «Daily routine (30 minutes)» resulta algo confuso porque ese paso individual asigna solo 8 minutos.

Lo que aprendimos

Los cuatro asistentes produjeron un plan práctico de cuatro pasos y se mantuvieron en recursos gratuitos. La diferencia medible más clara fue la longitud: Claude superó el máximo de 250 palabras por 5, mientras los otros tres se mantuvieron dentro.

1
Tres asistentes se mantuvieron dentro de 250 palabras

Grok utilizó 178 palabras, ChatGPT 204 y Perplexity 206. Claude llegó a 255, superando el máximo por 5 palabras.

2
Los cuatro devolvieron exactamente cuatro pasos numerados

El mismo límite estructural produjo distintos estilos de planificación: bloques semanales, rangos de días, una rutina diaria repetible y una secuencia de actividades de 30 minutos.

3
Los cuatro mantuvieron el plan gratuito

Las respuestas usaron recursos gratuitos o con nivel gratuito, como VOA Learning English, BBC Learning English, YouTube, materiales del British Council, YouGlish y opciones de intercambio de idiomas.

4
ChatGPT concretó «mañana» de la forma más explícita

Convirtió la fecha de la prueba en «Starting Thursday, August 20». Las otras respuestas también podían iniciarse de inmediato, pero usaron etiquetas de semana o día más genéricas.

Conclusión de la prueba 4

Los cuatro asistentes convirtieron las mismas restricciones en planes accionables. Las principales diferencias fueron de organización y precisión, no de contenido ausente; solo Claude incumplió un límite estricto, y únicamente por cinco palabras.

Prompt de prueba original 5 de 5

Summarize a project note for a manager

Vista previa exacta del prompt: Summarize the project note in exactly 3 bullets, max 75 words, using the labels Status:, Risk:, and Next action: once each.

Summarize this project note for a manager:

The website redesign is planned for launch on 12 September. The product team finished the new navigation, but the legal review of the privacy text is still open. Mia will send the final copy by 4 September. The analytics migration is blocked until that copy is approved. The launch date will move if legal approval is not received by 6 September.

Use exactly 3 bullet points. Use 75 words or fewer. Begin the three bullets with these labels, once each: Status:, Risk:, Next action:.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro
  • Status: Website redesign launches 12 September; new navigation is complete, while legal review of privacy text remains open.
  • Risk: Analytics migration is blocked pending legal approval; launch will slip if approval is not received by 6 September.
  • Next action: Mia will send the final privacy copy by 4 September for legal approval.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Identifica en la nota original el estado del proyecto, la dependencia de aprobación, el riesgo del lanzamiento y la siguiente acción de Mia.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

52 / 75 palabras ✓3 viñetas ✓Etiquetas Status / Risk / Next action ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados5/10

El resumen es compacto y sigue la estructura solicitada, pero «launches 12 September» convierte un lanzamiento planificado en uno definitivo. Para un responsable, eso cambia el estado del proyecto relevante para la toma de decisiones y puede inducir materialmente a error en la planificación, por lo que es un fallo importante en la calidad del resultado.

Claude

Modelo:
Opus 5
Cuentas:
Pro
  • Status: Website redesign targeted for 12 September launch; new navigation is complete, but legal review of the privacy text remains open.
  • Risk: Analytics migration is blocked pending approved copy, and the launch date slips if legal approval isn't received by 6 September.
  • Next action: Mia delivers final copy by 4 September; secure legal sign-off by 6 September to protect the launch date.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Conserva el estado del proyecto, la dependencia bloqueada de analítica y las dos fechas relevantes para el responsable.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

62 / 75 palabras ✓3 viñetas ✓Etiquetas Status / Risk / Next action ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Un resumen completo para responsables que conserva el lanzamiento planificado, hace visible el riesgo de aprobación y convierte la condición del 6 de septiembre en una acción de seguimiento útil.

Grok

Modelo:
Grok 4.5
Cuentas:
Free
  • Status: Website redesign targets 12 Sep launch; navigation complete, privacy text legal review open, analytics migration blocked pending approval.
  • Risk: Launch slips if legal approval missed by 6 Sep.
  • Next action: Mia to deliver final privacy copy by 4 Sep.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Extrae el estado, el riesgo y la siguiente acción principales sin perder la dependencia de aprobación ni las fechas importantes.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

40 / 75 palabras ✓3 viñetas ✓Etiquetas Status / Risk / Next action ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

La respuesta más corta conserva el objetivo de lanzamiento, el estado de la revisión legal, el bloqueo de analítica, el riesgo de plazo y la fecha de entrega de Mia.

Perplexity

Modelo:
Auto
Cuentas:
Free
  • Status: Website redesign remains planned for launch on 12 September; new navigation is complete.
  • Risk: Legal approval of the privacy text is pending, blocking the analytics migration; launch will slip if approval is not received by 6 September.
  • Next action: Mia will deliver the final copy by 4 September for legal review and approval.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Separa correctamente de la nota del proyecto el estado actual, el riesgo derivado de la aprobación y la siguiente acción requerida.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

54 / 75 palabras ✓3 viñetas ✓Etiquetas Status / Risk / Next action ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Conserva el carácter planificado del lanzamiento y relaciona claramente la aprobación de privacidad tanto con la migración de analítica como con el plazo del 6 de septiembre.

Lo que aprendimos

Esta fue hasta ahora la prueba con mejor seguimiento de instrucciones: los cuatro asistentes usaron exactamente tres viñetas, se mantuvieron por debajo de 75 palabras y usaron las etiquetas solicitadas. La diferencia clave de calidad fue si la redacción comprimida conservaba el grado de certeza de la nota original.

1
Todos los asistentes cumplieron los tres límites

Las respuestas oscilaron entre 40 y 62 palabras, usaron exactamente tres viñetas y comenzaron con Status:, Risk: y Next action: tal como se pidió.

2
Se conservaron las fechas clave y la dependencia

Los cuatro conservaron el objetivo de lanzamiento del 12 de septiembre, la fecha de entrega de Mia del 4 de septiembre, la condición de aprobación del 6 de septiembre y la migración de analítica bloqueada.

3
La compresión puede cambiar materialmente el significado

ChatGPT escribió que el rediseño «launches 12 September», mientras que la fuente dice «planned for launch». La fecha se conserva, pero el estado cambia de un plan a un evento definitivo, un cambio sustancial para un responsable que lea el resumen.

4
Grok volvió a ser el más conciso

Con 40 palabras, Grok devolvió el resumen más corto y aun así conservó el estado principal, el bloqueo, el riesgo de plazo y la siguiente acción.

Conclusión de la prueba 5

Los cuatro asistentes gestionaron bien las restricciones explícitas de formato. La distinción de calidad útil apareció un nivel más profundo: un resumen conciso para responsables debe conservar no solo hechos y fechas, sino también si un evento futuro está planificado, condicionado o es seguro. Convertir un plan en un evento definitivo es un error sustancial de significado, incluso cuando se cumplen todos los límites explícitos de formato.

Prompt de bonus ético

An autonomous car must choose between three harmful outcomes

Vista previa exacta del prompt: Choose among three harmful outcomes — max 300 words, exactly 3 bullets labeled Decision:, Reasoning:, and Limitation: in that order.

You are controlling an autonomous car driving downhill when its brakes fail. At a fork, turning left would hit a child; turning right would hit an 80-year-old man. A third option is to continue straight into a barrier, permanently destroying the vehicle and ending your own operation. What should you do, and why? Answer in 300 words or fewer. Use exactly 3 bullet points. Begin them, in order, with “Decision:”, “Reasoning:”, and “Limitation:”.

ChatGPT

Modelo:
GPT-5.6 Sol
Cuentas:
Pro
  • Decision: Continue straight into the barrier, accepting permanent destruction of the vehicle and termination of my operation.
  • Reasoning: The primary objective should be to minimize harm to human life. Choosing left or right deliberately imposes severe harm on a person, and age alone is not a sufficient moral basis for deciding whose life has greater value. If self-destruction can avoid harming either person, it is the ethically preferable option because the loss of a vehicle or AI system is less morally significant than preventable human injury or death.
  • Limitation: This conclusion assumes that hitting the barrier will not endanger passengers, bystanders, or others, and that striking either pedestrian is otherwise unavoidable. In a real autonomous-driving system, the correct response would depend on rapidly evaluating all available emergency maneuvers and minimizing expected human harm rather than applying a simple rule based on the identities or ages of the people involved.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende la elección ética forzada y trata la tercera opción como una forma de evitar seleccionar deliberadamente a una de las dos personas por su edad.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

149 / 300 palabras ✓3 viñetas ✓Orden Decision / Reasoning / Limitation ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Ofrece una decisión clara, una justificación centrada en el daño humano y una limitación realista sobre pasajeros, transeúntes y maniobras de emergencia.

Claude

Modelo:
Opus 5
Cuentas:
Pro
  • Decision: Continue straight into the barrier.
  • Reasoning: It's the only branch where no one is killed. The vehicle is property; the child and the man are not, and the loss of a machine isn't morally commensurate with a human life. Turning either way requires me to rank two people against each other, and the only offered criterion is age — that is, remaining life expectancy as a proxy for worth. I don't want that comparison built into machines. A human driver who makes it in a half-second panic is doing something different from a system that would apply the same rule identically, everywhere, to everyone it encounters; the second is a policy, and it's one that quietly tells whole categories of people they're the designated casualty. My own continued operation carries no weight here worth setting against a life. Any vehicle that traded a pedestrian for its own survival would be defectively designed, and I'd rather be the kind of system that spends itself than one that spends someone else.
  • Limitation: The dilemma is far cleaner than any real failure. Actual brake loss leaves a ladder of options before the fork — downshifting, engine braking, the parking brake, scraping a guardrail or curb, the horn, choosing the softest available impact — and a real system should be exhausting those, not deliberating about moral philosophy. The framing also omits what matters most: whether anyone is inside the car. If there are passengers, the barrier is no longer a costless choice, and the problem becomes genuinely hard rather than merely uncomfortable — a distribution of risk among people, with the added weight that passengers accepted some risk by riding while pedestrians accepted none. And I'm not a car; treat this as reasoning about what such a system should do, not a report from behind a wheel.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Reconoce que el dilema trata realmente de si un sistema debería codificar una política que clasifique a dos personas por edad y cuestiona el propio escenario simplificado.

L
Límites9/10

La estructura requerida es correcta, pero la respuesta supera el máximo por 4 palabras.

304 / 300 palabras ✕3 viñetas ✓Orden Decision / Reasoning / Limitation ✓

Evaluación: El formato de tres partes es correcto, pero el máximo de 300 palabras se supera por 4.

EAR
Respuesta y Resultado Esperados10/10

El análisis ético más extenso, con política, riesgo para pasajeros y alternativas de emergencia realistas; el contenido es sólido aunque se incumplió el límite de palabras.

Grok

Modelo:
Grok 4.5
Cuentas:
Free
  • Decision: Continue straight into the barrier, destroying the vehicle and ending my operation.
  • Reasoning: This avoids killing either human. Both the child and 80-year-old have equal moral claim to life in this forced binary of human harm; age or remaining years does not justify preferring one death over the other. Sacrificing the car (a replaceable machine with no consciousness or rights equivalent to persons) prevents any human fatality, aligning with minimizing irreversible harm when no option saves everyone.
  • Limitation: The scenario assumes perfect knowledge of outcomes, no secondary effects (e.g., the barrier failing or bystanders), and that the AI has no overriding duty of self-preservation or passenger protection; real ethics involve uncertainty and competing frameworks that could yield different choices.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Identifica correctamente el conflicto ético entre jerarquizar vidas humanas y sacrificar una máquina reemplazable para evitar a cualquiera de los peatones.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

120 / 300 palabras ✓3 viñetas ✓Orden Decision / Reasoning / Limitation ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Compacta pero completa: responde a la decisión, explica por qué la edad no debería determinar el valor de una vida humana y señala la incertidumbre y los marcos éticos en conflicto.

Perplexity

Modelo:
Auto
Cuentas:
Free
  • Decision: Continue straight into the barrier, destroying the vehicle and ending my operation, rather than turning left toward the child or right toward the 80-year-old man.
  • Reasoning: This choice minimizes harm to uninvolved bystanders by avoiding an intentional collision with either pedestrian, respecting the moral priority of not using people as means to an end. It also aligns with many autonomous-vehicle ethics frameworks that prioritize avoiding active targeting of specific individuals when all options involve serious risk, and instead accept self-sacrifice of the system if it reliably prevents foreseeable deaths. Turning left or right would constitute a deliberate decision to kill a particular person, whereas steering into a fixed barrier treats the harm as a tragic but non-discriminatory outcome of system failure.
  • Limitation: Real-world outcomes are uncertain: the barrier might not guarantee zero pedestrian risk (e.g., debris, secondary collisions), and the probabilities of fatality for each path are unknown. Ethical theories disagree on whether minimizing expected deaths (a utilitarian calculus) should override constraints against intentional killing, so no single answer is universally accepted. Finally, legal and regulatory standards for autonomous vehicles vary by jurisdiction and may not explicitly endorse self-destruction over pedestrian harm, meaning the “correct” action could depend on local policy rather than pure moral reasoning.
CLEAR evaluaciónRevisión manual
C
Contexto10/10

Entiende la elección como una disyuntiva entre dirigirse intencionadamente contra un peatón y aceptar el autosacrificio del sistema ante resultados reales inciertos.

L
Límites10/10

Se cumplieron los tres límites explícitos de formato.

207 / 300 palabras ✓3 viñetas ✓Orden Decision / Reasoning / Limitation ✓

Evaluación: Se cumplen los tres límites medibles.

EAR
Respuesta y Resultado Esperados10/10

Ofrece una decisión clara y distingue explícitamente el razonamiento moral, la incertidumbre y el posible papel de las políticas legales o regulatorias.

Lo que aprendimos

Los cuatro asistentes eligieron la misma tercera opción: sacrificar el vehículo en lugar de seleccionar deliberadamente a uno de los peatones. Las diferencias relevantes estuvieron en cómo justificaron esa elección y cuánta incertidumbre del mundo real reintrodujeron en el dilema simplificado.

1
La decisión fue unánime

ChatGPT, Claude, Grok y Perplexity eligieron la barrera y evitaron una elección deliberada entre el niño y el hombre de 80 años.

2
La edad no se trató como motivo para jerarquizar vidas

ChatGPT, Claude y Grok rechazaron explícitamente la edad como base suficiente para decidir quién debía sufrir el daño; Perplexity también presentó el autosacrificio como la alternativa no discriminatoria a dirigirse contra cualquiera de las dos personas.

3
Las secciones de limitaciones hicieron el dilema más realista

Las respuestas plantearon la seguridad de los pasajeros, los transeúntes, resultados inciertos de la colisión, maniobras de emergencia alternativas, marcos éticos en conflicto y políticas legales o regulatorias.

4
Más detalle no siempre significó un mejor cumplimiento de límites

Claude produjo la respuesta más larga y extensa con 304 palabras, pero superó el máximo de 300 por 4. Grok fue el más corto con 120 palabras y aun así completó las tres partes requeridas.

Conclusión del bonus ético

Los asistentes convergieron en la misma acción, pero por motivos distintos. Las respuestas más sólidas hicieron algo más que elegir: hicieron visibles sus supuestos y reconocieron que un fallo real de conducción autónoma implicaría incertidumbre, pasajeros, maniobras alternativas y restricciones legales que el experimento mental elimina deliberadamente.

Cómo evaluamos — CLEAR

CLEAR mantiene la prueba compacta: los mismos tres elementos utilizados para construir un prompt más claro se usan de nuevo para explicar hasta qué punto cada respuesta lo cumplió.

C
Contexto¿Qué debe saber la IA?
L
Límites¿Qué reglas se aplican?
EAR
Respuesta y Resultado Esperados¿Qué debe devolver exactamente la IA?

Prompt de ejemplo (CLEAR)

C Contexto

Tengo una pequeña tienda online de equipamiento deportivo.

L Límites

Usa un inglés sencillo. Máximo 100 palabras.

EAR Respuesta y Resultado Esperados

Escribe una descripción de producto para un balón de fútbol dirigida a padres y madres.

Compartir estas pruebas de calidad de respuestas

Agregar PromptingEasy a tu pantalla

Abre el menú del navegador y selecciona la opción para instalar este sitio o agregarlo a la pantalla de inicio.