Glosario
Inference (inferencia)
La inferencia es ejecutar un modelo para producir una salida ante una petición. Para operadores, es el coste y la latencia recurrentes de la automatización — no el build puntual. Elecciones de diseño (tamaño, batch, caché, región) dominan la factura más que la astucia del prompt sola.
Por qué importa en tu operación
Si no mides la inferencia, no puedes gobernar el gasto de IA.
