Context engineering para LLM: prompting, retrieval y RAG

Controla qué información ve el modelo y cómo la utiliza el flujo de trabajo.

Aprende cómo los roles, los ejemplos, las cadenas de prompts, los documentos recuperados, RAG, los agentes, la temperatura y los ajustes de decodificación dan forma a un flujo de trabajo de LLM repetible. Esta guía se centra en el contexto y el control; el siguiente nivel explica la arquitectura subyacente.

Prompting por roles explicado

El prompting por roles pide al modelo que responda desde una perspectiva profesional concreta. El rol debe estar relacionado con la tarea y no ser solo teatral. «Actúa como responsable con experiencia en operaciones de soporte» resulta útil para flujos de trabajo de tickets; «Actúa como un genio» normalmente aporta poco.

Ejemplo: Para una plantilla de helpdesk: «Actúa como responsable de calidad de soporte. Haz esta respuesta más breve, amable y conforme con la política. Mantén sin cambios la condición del reembolso».
Comparación directa entre un prompt con y sin una instrucción de rol.
El prompting por roles da al modelo una perspectiva, un tono y un nivel de detalle antes de definir la tarea.

Few-shot prompting explicado

El few-shot prompting consiste en proporcionar algunos ejemplos de entrada y de la salida deseada. Es especialmente útil cuando el formato, el tono o los límites de una clasificación son difíciles de describir. Entre dos y cinco ejemplos precisos suelen funcionar mejor que una explicación abstracta muy larga.

Ejemplo: Un equipo de producto proporciona tres ejemplos de solicitudes de funciones desordenadas y los tickets de Jira ya depurados que corresponden a cada una. Después pide al modelo que convierta la siguiente solicitud con la misma estructura.
Diagrama de cómo varios ejemplos orientan a un LLM antes de que responda a la tarea principal.
El few-shot prompting muestra primero varios ejemplos al modelo para transmitir el patrón esperado.

Cadenas de prompts explicadas

Una cadena de prompts divide una tarea compleja en pasos más pequeños. En vez de pedir investigación, esquema, borrador, crítica y versión final al mismo tiempo, utilizas una secuencia: extraer hechos, crear una estructura, redactar, evaluar y revisar. Esto mejora el control y facilita detectar errores.

Ejemplo: Para una página de destino: paso 1, resumir los problemas de los clientes. Paso 2, crear la estructura de la página. Paso 3, redactar las secciones. Paso 4, comprobarlas con criterios de conversión. Paso 5, preparar el texto final.
Diagrama paso a paso de una cadena de prompts con investigación, estructura, borrador y revisión.
Una cadena de prompts divide una tarea compleja en pasos pequeños y cada resultado alimenta el siguiente prompt.
Construye un flujo de trabajo repetible

Combina técnicas de prompting en sistemas que puedas probar, mejorar, alimentar con retrieval y reutilizar.

Una idea más potente: diseña un sistema operativo de prompts

Para trabajos recurrentes, el mejor prompt rara vez es solo una frase ingeniosa. Trátalo como un pequeño sistema operativo: rol, entradas, reglas sobre fuentes, criterio de calidad, formato de salida y paso de verificación. Así el flujo de trabajo se puede enseñar y depurar con más facilidad.

Prompt de una sola vez

«Escribe nuestro correo de onboarding». El modelo tiene que adivinar el público, el tono, los detalles del producto y los criterios de éxito.

Sistema operativo de prompts

«Utiliza el segmento de clientes, la propuesta de valor del producto, la guía de tono, las afirmaciones prohibidas, los correos de ejemplo y la siguiente lista de control. Crea un borrador, revísalo y después entrega el correo final».

Ejemplo práctico: Un equipo de soporte de SaaS puede usar esta cadena: clasificar el ticket → recuperar la política → redactar una respuesta → comprobar afirmaciones sin respaldo → crear la respuesta final. Cada paso tiene una tarea más limitada, por lo que los errores son más fáciles de localizar.

Context engineering explicado

El context engineering es la disciplina de decidir qué información llega al modelo y en qué momento. Incluye la selección de fuentes, la jerarquía de instrucciones, la memoria, el retrieval, los ejemplos, las herramientas y los esquemas de salida. El objetivo no es «el máximo contexto», sino el contexto fiable más pequeño posible.

Ejemplo: Un asistente jurídico debería recibir la cláusula pertinente, la jurisdicción, la pregunta del usuario y las reglas de salida, no el contrato completo de 80 páginas para cada consulta pequeña.

Cómo probar prompts

Probar un prompt significa ejecutar la misma tarea con ejemplos representativos y evaluar los resultados. Utiliza una rúbrica con criterios como exactitud, integridad, cumplimiento del formato, tono, seguridad y tiempo de edición. Mantén un pequeño conjunto de regresión para detectar cuándo un cambio mejora un caso, pero empeora otro.

Ejemplo: Prueba 20 tickets de soporte con tres variantes de prompt. Puntúa cada respuesta del 1 al 5 según la corrección respecto a la política y el tiempo ahorrado. El mejor prompt no siempre es el más largo.

Cómo obtener mejores respuestas de IA

Las mejores respuestas suelen surgir de objetivos más claros, mejor contexto, condiciones explícitas, ejemplos y un paso de comprobación. Pide al modelo que indique sus supuestos, utilice un formato definido y señale la incertidumbre. Para hechos importantes, proporciona fuentes o exige citas del material recuperado.

Ejemplo: En lugar de «Analiza esto», pregunta: «Identifica los tres supuestos más arriesgados de este plan de lanzamiento, explica por qué importa cada uno y propone una prueba que podamos realizar esta semana».

RAG explicado de forma sencilla

RAG significa retrieval-augmented generation. El sistema primero busca en una base de conocimiento, entrega al modelo los fragmentos relevantes y después genera una respuesta basada en esos pasajes. RAG es útil cuando las respuestas dependen de documentos privados, cambiantes o muy extensos. No es necesario para tareas sencillas de redacción.

Ejemplo: Antes de redactar una respuesta, un bot de soporte de SaaS recupera el apartado vigente de la política de reembolsos para no depender del conocimiento del modelo ni de ejemplos desactualizados.
Flujo sencillo de RAG desde la pregunta del usuario hasta el contexto recuperado y la respuesta generada.
RAG recupera primero información útil; después el modelo responde con ese contexto.

¿Qué son los agentes de IA?

Hasta ahora has escrito prompts que producen una sola respuesta. Un agente de IA va un paso más allá: puede planificar varias etapas, usar herramientas como una búsqueda o una calculadora, observar el resultado y decidir qué hacer después. Este ciclo se repite hasta completar la tarea. La diferencia se parece a dar indicaciones para llegar a un lugar frente a entregar las llaves para que alguien realice el encargo.

Los agentes son adecuados para tareas de varios pasos que, de otro modo, requerirían muchos prompts individuales: investigar varias páginas y resumirlas o consultar información y redactar una respuesta basada en ella. A cambio, tienes menos control directo. Como un agente actúa de forma autónoma, necesita límites más claros y, con frecuencia, una revisión antes de que ocurra algo importante. La guía avanzada explica los detalles técnicos de los agentes, las herramientas y los large action models.

Ejemplo: «Busca tres artículos recientes sobre este tema y después escribe un resumen breve con enlaces» es una buena primera tarea para un agente: limitada, verificable y de bajo riesgo.

Temperatura explicada de forma sencilla

La temperatura controla cuánta aleatoriedad utiliza el modelo al seleccionar tokens. Una temperatura más baja tiende a producir resultados más previsibles y consistentes. Una temperatura más alta puede generar más variedad y creatividad, pero también aumentar la desviación respecto a las instrucciones. No es un control de calidad, sino un control de variación.

Ejemplo: Utiliza una temperatura baja para extraer datos de facturas. Para crear diez ideas de nombres de marca puedes usar una temperatura más alta y filtrar después los resultados.

Cómo elige el modelo cada palabra: greedy, top-k y top-p

La temperatura es solo un control dentro de un paso más amplio llamado decodificación o sampling. En cada posición, el modelo asigna una probabilidad a cada posible token siguiente. El método de decodificación decide qué candidato se selecciona realmente. Estos ajustes explican por qué el mismo prompt puede producir respuestas rígidas, algo repetitivas o muy creativas según la configuración de la API.

Los métodos más habituales, de más estricto a más flexible:

Greedy

Selecciona en cada paso el token con la probabilidad más alta. Así elimina la aleatoriedad de sampling de este decodificador. Aun así, no se garantizan resultados idénticos entre versiones del modelo, implementaciones numéricas, cambios del backend o infraestructura no determinista.

Top-k

Conserva solo los k tokens más probables, por ejemplo 40, y después selecciona dentro de ese conjunto. La lista de candidatos tiene un tamaño fijo, independientemente de la seguridad del modelo.

Top-p (nucleus)

Conserva el conjunto mínimo de tokens cuyas probabilidades suman el valor p, por ejemplo 0,9. La lista se reduce cuando el modelo tiene más seguridad y aumenta cuando tiene menos.

Min-p

Una opción más reciente: conserva los tokens que alcanzan al menos una proporción determinada de la probabilidad del token más probable. Con temperaturas altas suele mantenerse más estable que top-p.

Estos ajustes se influyen entre sí, aunque el orden exacto y los controles disponibles dependen de la implementación. En un pipeline habitual, la temperatura escala los logits antes de un filtro top-k o top-p; otros entornos combinan u ordenan los procesadores de otra manera. Algunos proveedores recomiendan modificar la temperatura o top-p, no ambos a la vez. Sigue la documentación del modelo y de la API que utilices.

Ejemplo: Para extraer JSON o generar argumentos de herramientas, prefiere salidas estructuradas con un esquema o function/tool calling cuando el proveedor lo admita. Una temperatura baja puede aportar estabilidad adicional, pero no sustituye la validación. Para brainstorming, un ajuste de sampling admitido por el proveedor puede aumentar la variedad. Temperatura 0 significa «tan determinista como permita la implementación», no una garantía absoluta.
Comparación de la decodificación greedy, top-k y top-p al seleccionar el siguiente token.
Greedy, top-k y top-p conservan distintos candidatos antes de seleccionar el siguiente token.

Descubre ahora ejemplos reales de prompts

Utiliza el generador universal de prompts para convertir estos conceptos de IA en prompts prácticos para escribir, investigar, trabajar, estudiar y resolver tareas cotidianas.

Compartir esta guía

Añadir PromptingEasy a tu pantalla

Abre el menú del navegador y selecciona la opción para instalar este sitio o añadirlo a la pantalla de inicio.