Prompting por roles explicado
El prompting por roles pide al modelo que responda desde una perspectiva profesional concreta. El rol debe estar relacionado con la tarea y no ser solo teatral. «Actúa como responsable con experiencia en operaciones de soporte» resulta útil para flujos de trabajo de tickets; «Actúa como un genio» normalmente aporta poco.

Few-shot prompting explicado
El few-shot prompting consiste en proporcionar algunos ejemplos de entrada y de la salida deseada. Es especialmente útil cuando el formato, el tono o los límites de una clasificación son difíciles de describir. Entre dos y cinco ejemplos precisos suelen funcionar mejor que una explicación abstracta muy larga.

Cadenas de prompts explicadas
Una cadena de prompts divide una tarea compleja en pasos más pequeños. En vez de pedir investigación, esquema, borrador, crítica y versión final al mismo tiempo, utilizas una secuencia: extraer hechos, crear una estructura, redactar, evaluar y revisar. Esto mejora el control y facilita detectar errores.

Combina técnicas de prompting en sistemas que puedas probar, mejorar, alimentar con retrieval y reutilizar.
Una idea más potente: diseña un sistema operativo de prompts
Para trabajos recurrentes, el mejor prompt rara vez es solo una frase ingeniosa. Trátalo como un pequeño sistema operativo: rol, entradas, reglas sobre fuentes, criterio de calidad, formato de salida y paso de verificación. Así el flujo de trabajo se puede enseñar y depurar con más facilidad.
«Escribe nuestro correo de onboarding». El modelo tiene que adivinar el público, el tono, los detalles del producto y los criterios de éxito.
«Utiliza el segmento de clientes, la propuesta de valor del producto, la guía de tono, las afirmaciones prohibidas, los correos de ejemplo y la siguiente lista de control. Crea un borrador, revísalo y después entrega el correo final».
Context engineering explicado
El context engineering es la disciplina de decidir qué información llega al modelo y en qué momento. Incluye la selección de fuentes, la jerarquía de instrucciones, la memoria, el retrieval, los ejemplos, las herramientas y los esquemas de salida. El objetivo no es «el máximo contexto», sino el contexto fiable más pequeño posible.
Cómo probar prompts
Probar un prompt significa ejecutar la misma tarea con ejemplos representativos y evaluar los resultados. Utiliza una rúbrica con criterios como exactitud, integridad, cumplimiento del formato, tono, seguridad y tiempo de edición. Mantén un pequeño conjunto de regresión para detectar cuándo un cambio mejora un caso, pero empeora otro.
Cómo obtener mejores respuestas de IA
Las mejores respuestas suelen surgir de objetivos más claros, mejor contexto, condiciones explícitas, ejemplos y un paso de verificación. Pide al modelo que indique sus supuestos, utilice un formato definido y señale la incertidumbre. Para hechos importantes, proporciona fuentes o exige citas del material recuperado.
RAG explicado de forma sencilla
RAG significa retrieval-augmented generation. El sistema primero busca en una base de conocimiento, entrega al modelo los fragmentos relevantes y después genera una respuesta basada en esos pasajes. RAG es útil cuando las respuestas dependen de documentos privados, cambiantes o muy extensos. No es necesario para tareas sencillas de redacción.

¿Qué son los agentes de IA?
Hasta ahora has escrito prompts que producen una sola respuesta. Un agente de IA va un paso más allá: puede planificar varias etapas, usar herramientas como una búsqueda o una calculadora, observar el resultado y decidir qué hacer después. Este ciclo se repite hasta completar la tarea. La diferencia se parece a dar indicaciones para llegar a un lugar frente a entregar las llaves para que alguien realice el encargo.
Los agentes son adecuados para tareas de varios pasos que, de otro modo, requerirían muchos prompts individuales: investigar varias páginas y resumirlas o consultar información y redactar una respuesta basada en ella. A cambio, tienes menos control directo. Como un agente actúa de forma autónoma, necesita límites más claros y, con frecuencia, una revisión antes de que ocurra algo importante. La guía avanzada explica los detalles técnicos de los agentes, las herramientas y los large action models.
Temperatura explicada de forma sencilla
La temperatura controla cuánta aleatoriedad utiliza el modelo al seleccionar tokens. Una temperatura más baja tiende a producir resultados más previsibles y consistentes. Una temperatura más alta puede generar más variedad y creatividad, pero también aumentar la desviación respecto a las instrucciones. No es un control de calidad, sino un control de variación.
Cómo elige el modelo cada palabra: greedy, top-k y top-p
La temperatura es solo un control dentro de un paso más amplio llamado decodificación o sampling. En cada posición, el modelo asigna una probabilidad a cada posible token siguiente. El método de decodificación decide qué candidato se selecciona realmente. Estos ajustes explican por qué el mismo prompt puede producir respuestas rígidas, algo repetitivas o muy creativas según la configuración de la API.
Los métodos más habituales, de más estricto a más flexible:
Selecciona en cada paso el token con la probabilidad más alta. Así elimina la aleatoriedad de sampling de este decodificador. Aun así, no se garantizan resultados idénticos entre versiones del modelo, implementaciones numéricas, cambios del backend o infraestructura no determinista.
Conserva solo los k tokens más probables, por ejemplo 40, y después selecciona dentro de ese conjunto. La lista de candidatos tiene un tamaño fijo, independientemente de la seguridad del modelo.
Conserva el conjunto mínimo de tokens cuyas probabilidades suman el valor p, por ejemplo 0,9. La lista se reduce cuando el modelo tiene más seguridad y aumenta cuando tiene menos.
Una opción más reciente: conserva los tokens que alcanzan al menos una proporción determinada de la probabilidad del token más probable. Con temperaturas altas suele mantenerse más estable que top-p.
Estos ajustes se influyen entre sí, aunque el orden exacto y los controles disponibles dependen de la implementación. En un pipeline habitual, la temperatura escala los logits antes de un filtro top-k o top-p; otros entornos combinan u ordenan los procesadores de otra manera. Algunos proveedores recomiendan modificar la temperatura o top-p, no ambos a la vez. Sigue la documentación del modelo y de la API que utilices.
