Key-value cache (KV cache)
Durante la generación autorregresiva, la KV cache conserva tensores key-value de tokens anteriores. En vez de recalcular todo el prefijo para cada token nuevo, el modelo reutiliza representaciones almacenadas. Esto reduce la latencia de salidas largas, pero aumenta la memoria necesaria por solicitud activa.

El plano de control de producción para aplicaciones LLM
Los sistemas expertos dependen menos de un único modelo perfecto que de routing, caché, evaluación, controles de seguridad y ciclos de feedback. Una plataforma fiable decide qué modelo llamar, qué contexto recuperar, cuándo basta un modelo económico, cuándo escalar y cómo detectar regresiones.
Normaliza solicitudes, aplica rate limits, añade metadatos del cliente y selecciona modelos posibles.
Elige un modelo pequeño, grande o especializado según la dificultad, el presupuesto de latencia y el riesgo.
Mide calidad de retrieval y respuesta, fidelidad a evidencias, seguridad y cumplimiento del esquema.
Registra prompts, fragmentos recuperados, versiones de modelo, tokens, percentiles de latencia y patrones de error.
Mixture of Experts
Mixture of Experts dirige tokens o ejemplos a una parte de varias redes expertas especializadas. Así aumenta el número total de parámetros sin activar todos para cada token. A cambio, complica el routing, el balanceo de carga, la comunicación y la depuración.
Speculative decoding
El speculative decoding utiliza un modelo o método de borrador para proponer tokens que después verifica el modelo objetivo. Los algoritmos exactos pueden conservar la distribución del modelo principal; las variantes heurísticas pueden intercambiar precisión por velocidad. La mejora depende de la tasa de aceptación, el costo del modelo de borrador, la forma de las secuencias y batches, el runtime y el hardware.

Cuantización
La cuantización reduce la precisión de pesos, activaciones o cachés, por ejemplo de 16 a 8 o 4 bits. Puede disminuir la memoria y aumentar el throughput si el hardware, los kernels, el runtime y la carga admiten el formato. También puede afectar la calidad, la calibración o la fiabilidad de llamadas a herramientas.

LoRA y fine-tuning
LoRA normalmente congela el modelo base y entrena adaptadores de bajo rango. Reduce el número de parámetros entrenables y, a menudo, la memoria frente a un fine-tuning completo. Sirve para adaptar comportamiento, estilo, formato o tareas, pero no sustituye de forma fiable al retrieval cuando los hechos cambian con frecuencia.
Pasa de optimizar el modelo a preference tuning, observabilidad, evaluación, seguridad, routing y control de costos.
Direct Preference Optimization (DPO) y RLHF
RLHF y DPO optimizan el comportamiento del modelo a partir de preferencias humanas o recogidas por otros medios. RLHF suele incluir un modelo de recompensa y optimización de la política; DPO optimiza las preferencias con un objetivo más directo. Ambos dependen de la calidad de los datos y pueden sobreajustarse a lo que prefieren quienes evalúan.
Observabilidad de LLM
La observabilidad registra prompts, resultados de retrieval, llamadas a herramientas, latencia, costos, feedback, incidentes de seguridad y métricas de evaluación. Los registros deben respetar la privacidad: contener lo necesario para depurar sin almacenar datos sensibles innecesarios.

Evaluación de retrieval-augmented generation
La evaluación de RAG separa la calidad del retrieval de la calidad de la respuesta. Mide si se encontraron los documentos correctos, si la respuesta los utilizó, si las citas respaldan las afirmaciones y si la salida final cumple la tarea.
Model routing
El model routing envía cada tarea al modelo o flujo de trabajo más económico que resulte suficiente. Una clasificación sencilla puede usar un modelo pequeño; un razonamiento complejo puede necesitar uno más potente; una respuesta de riesgo puede exigir RAG y revisión humana. El routing solo ahorra si los controles detectan asignaciones equivocadas.
Red teaming para seguridad de IA
El red teaming estudia cómo falla un sistema ante entradas adversarias o poco habituales. Prueba prompt injection, fugas de datos, uso inseguro de herramientas, evasión de políticas, instrucciones ocultas y social engineering. El objetivo es mejorar controles, no demostrar perfección.
Optimización de costos para aplicaciones LLM
La optimización combina compresión de prompts, caché, routing, batching, limpieza de contexto, calidad de retrieval, cuantización y evaluación. Optimiza el costo por tarea correcta, no solo el costo por token. Un modelo barato que necesita tres intentos puede salir más caro que uno mejor en un solo intento.