Cómo funcionan los LLM: tokens, contexto y respuestas

Una introducción clara y no técnica.

Descubre qué hace un modelo de lenguaje cuando lee un prompt, divide el texto en tokens, utiliza una ventana de contexto y genera una respuesta paso a paso. Empieza aquí antes de continuar con las guías sobre context engineering y arquitectura de LLM.

¿Qué es un LLM?

Un LLM, es decir, un large language model o gran modelo de lenguaje, es un software entrenado con enormes cantidades de texto para predecir lenguaje y generar contenido útil. En la práctica puedes imaginarlo así: das una tarea al modelo, este divide tu texto en tokens, calcula cuáles son los siguientes tokens más probables y produce un borrador. Puede escribir, resumir y clasificar porque sus parámetros condensan una gran cantidad de patrones lingüísticos. Un LLM no es una base de datos y no sabe automáticamente si una afirmación actual es verdadera.

Ejemplo: La persona responsable de soporte en una empresa SaaS pide: «Resume esta reclamación y redacta una respuesta serena que incluya un reembolso». El modelo no «siente» la reclamación; reconoce patrones relacionados con quejas, políticas de reembolso y tono profesional.

¿Qué es un prompt?

Un prompt es el conjunto de instrucciones que envías a un sistema de IA. Los buenos prompts suelen incluir el rol, la situación, la tarea exacta, las condiciones, ejemplos y el formato de salida deseado. Un prompt débil solo pide «ideas». Un prompt sólido explica para quién son esas ideas, qué deben conseguir y con qué criterios se evaluarán.

Ejemplo: Débil: «Escribe una descripción de producto». Mejor: «Actúa como redactor de comercio electrónico para una tienda en línea. Escribe una descripción de 90 palabras para un vaso reutilizable de café. Público: personas que se desplazan al trabajo. Tono: práctico y sin exageraciones. Incluye un título y tres viñetas».

¿Qué ocurre realmente cuando envías un prompt?

El proceso habitual no es: «La IA entiende la solicitud, escribe un programa en Python y empieza a trabajar». Un gran modelo de lenguaje normalmente recibe texto, lo convierte en tokens, procesa esos tokens a través de capas de una red neuronal y genera una y otra vez el siguiente token. Python u otras herramientas solo intervienen cuando la aplicación que rodea al modelo ofrece expresamente acceso a ellas, por ejemplo a una calculadora, un intérprete de código, un navegador, un conector de base de datos o una llamada a funciones.

Diagrama paso a paso de lo que ocurre cuando una persona envía un prompt a un LLM.
El prompt se tokeniza, el modelo lo procesa y la respuesta se decodifica paso a paso.
1. Entrada

Introduces un prompt. Antes de que el modelo vea la solicitud final, la aplicación puede agregar instrucciones internas del sistema, políticas de seguridad, el historial del chat o documentos seleccionados.

2. Tokens

El texto se divide en identificadores de tokens. El modelo no recibe palabras tal como las lee una persona, sino identificadores numéricos de tokens.

3. Inferencia

El modelo calcula, a partir de todo el contexto, las probabilidades de los posibles tokens siguientes. Aquí intervienen la atención, los embeddings y los pesos del modelo.

4. Herramienta opcional

Si la aplicación admite herramientas, el modelo puede solicitar una función como una búsqueda, una calculadora o la ejecución de código. El resultado externo se agrega después a la conversación como contexto adicional.

5. Respuesta

El texto final se decodifica a partir de los tokens generados. Los mejores prompts ayudan porque modifican el contexto que el modelo utiliza para elegir cada token siguiente.

Lección de prompting: El modelo es muy sensible a la información que recibe antes de empezar a generar. Un contexto claro, ejemplos, condiciones y material de referencia aumentan la probabilidad de que los tokens siguientes se ajusten a tu intención.
Aplica estas ideas a tus propios prompts

Haz un ejercicio sencillo de antes y después antes de continuar con los tokens, el contexto y los límites del modelo.

Mejor que una prueba rápida: crea una galería de antes y después de tus prompts

En lugar de hacer una prueba genérica, reúne cinco prompts reales de tu trabajo y guarda para cada uno la versión débil, la versión mejorada y el resultado final ya editado. Así construirás una colección de prompts reutilizable para tu equipo.

  1. Elige una tarea recurrente, como responder a soporte, escribir descripciones de productos o resumir materiales de estudio.
  2. Guarda el prompt original y su resultado.
  3. Agrega contexto, reglas de formato y un ejemplo.
  4. Compara cuánto trabajo de edición sigue necesitando el segundo resultado.
  5. Convierte la versión mejorada en una plantilla.

¿Qué son los tokens?

Los tokens son pequeñas unidades de texto que un modelo lee y escribe. Según el tokenizador y el idioma, un token puede ser una palabra completa, parte de una palabra, un signo de puntuación o un solo carácter. Los límites de tokens importan porque la entrada y la salida deben caber juntas en la ventana de contexto del modelo.

Ejemplo: «PromptingEasy ayuda a los equipos» podría dividirse en tokens parecidos a «Prompt», «ing», «Easy», «ayuda», «equipos». Por eso los documentos largos y muchos ejemplos aumentan el costo y pueden desplazar instrucciones importantes fuera del contexto disponible.
Diagrama que divide un texto en segmentos de tokens de colores y después vuelve a formar la frase original.
El texto se divide en tokens y después vuelve a componerse como texto legible.

¿Por qué la IA a veces inventa información?

Una IA puede alucinar cuando genera una continuación que parece plausible sin estar suficientemente apoyada en información fiable. El modelo está optimizado para producir texto probable, no para garantizar la verdad de forma predeterminada. Las alucinaciones son más probables cuando una pregunta exige datos poco frecuentes, información actual, datos ocultos o fuentes que no se han proporcionado.

Ejemplo: Alguien pregunta, sin acceso a un navegador ni a una fuente, por «el precio exacto de un plan poco común de una API en 2026». El modelo puede dar una cifra convincente porque ese tipo de respuesta aparece con frecuencia, aunque el número sea incorrecto.

El mismo mecanismo puede inventar no solo un dato, sino también el estado de una tarea. En uno de nuestros propios flujos de trabajo, un asistente de IA debía buscar el perfil de LinkedIn adecuado para cada fila de una tabla y escribir la URL en una columna: eran decenas de filas, no una sola búsqueda. El asistente afirmó que había terminado e incluso dio cifras —«14 perfiles, 3 direcciones de correo»—, pero la columna seguía vacía y el archivo devuelto solo era una copia con otro nombre. Un resumen dicho con seguridad no es más que una secuencia de palabras probables y, por tanto, no demuestra que el trabajo se haya ejecutado realmente.

Volver a preguntar no rompe necesariamente este patrón. Según el producto, un nuevo intento puede reenviar la conversación visible, utilizar un estado de conversación guardado en el servidor, recortar o resumir mensajes anteriores o reutilizar entradas almacenadas. Aun así, se genera una respuesta nueva y se pueden consumir tokens o cuota adicional aunque no se produzca un archivo útil.

Un asistente de IA admite que marcó como terminada una tarea con una hoja de cálculo aunque no escribió datos en el archivo.
Un caso real de nuestro propio flujo de trabajo (captura de pantalla, 2026): el asistente informó de cifras y de un archivo terminado, pero la columna de destino seguía vacía.

Motivo: ¿la IA está atrapada en un bucle?

En términos prácticos, sí, pero no de la forma en que puede parecer. El modelo no tiene una conciencia persistente de que está repitiendo un error. Solo puede utilizar el contexto y el estado que la aplicación le proporciona. Una respuesta nueva puede basarse en el historial visible completo, en un historial recortado o resumido o en un estado administrado en el servidor. Si el flujo de trabajo no exige de forma explícita que el asistente abra el archivo y verifique los valores guardados, «terminado» puede seguir siendo una respuesta plausible. El bucle no es obstinación, sino el resultado de no haber definido verificación ni controles de estado.

Por eso repetir la misma pregunta mientras se siguen consumiendo tokens rara vez ayuda. Para romper el bucle, cambia la tarea en lugar de repetirla: haz que el resultado pueda verificarse, exige que el asistente vuelva a leer el archivo guardado y muestre los valores reales de las celdas, y detén el proceso si falta esa prueba. En la guía sobre los errores de prompting más frecuentes aprenderás a definir un criterio de éxito que el modelo pueda verificar.

¿Por qué ayuda el contexto?

El contexto reduce el espacio de soluciones posibles. Cuando el modelo conoce el público, el objetivo, las condiciones, los ejemplos y las fuentes, puede producir una respuesta adaptada a tu situación en lugar de quedarse en generalidades. Sin embargo, más contexto no siempre significa mejor resultado: la información irrelevante puede distraer al modelo y aumentar el costo.

Ejemplo: Un equipo de marketing obtiene mejores anuncios si proporciona el posicionamiento del producto, el público objetivo, las afirmaciones prohibidas y dos anuncios anteriores que funcionaron bien, en vez de limitarse a decir «Escribe anuncios».

¿Buscador o LLM?

Un buscador recupera páginas web y ordena enlaces. Un LLM genera una respuesta a partir de patrones aprendidos y del contexto proporcionado. La búsqueda es más adecuada cuando necesitas fuentes actuales, páginas oficiales o varias perspectivas. Los LLM son más adecuados para sintetizar, reformular, razonar sobre información que ya has aportado o preparar borradores estructurados. Muchos productos de IA potentes combinan ambos enfoques.

Ejemplo: Para saber «la fecha límite fiscal vigente en Zúrich», conviene utilizar una búsqueda o fuentes oficiales. Para «Convierte estas notas en un correo amable para un cliente», un LLM es una interfaz más apropiada.
Diagrama comparativo de cómo un buscador y un LLM responden de forma distinta a la misma pregunta.
Los buscadores ofrecen enlaces y fuentes; los LLM generan respuestas directas en lenguaje natural.

¿Qué significa que «la IA entiende el lenguaje»?

En el lenguaje cotidiano, «entender» significa que el modelo puede responder de forma adecuada al significado, el tono y la estructura. Técnicamente, ha aprendido representaciones estadísticas que conectan patrones de texto con resultados útiles. No entiende como una persona con experiencia de vida, intenciones y sentido de la responsabilidad.

Ejemplo: Si escribes «Hazlo menos publicitario», el modelo suele poder ajustar el tono porque ha aprendido patrones de lenguaje promocional y neutral. Es una competencia lingüística útil, pero no comprensión humana.

Descubre ahora ejemplos reales de prompts

Utiliza el generador universal de prompts para convertir estos conceptos de IA en prompts prácticos para escribir, investigar, trabajar, estudiar y resolver tareas cotidianas.

Compartir esta guía

Agregar PromptingEasy a tu pantalla

Abre el menú del navegador y selecciona la opción para instalar este sitio o agregarlo a la pantalla de inicio.