Glossaire
Inference (inférence)
L'inférence, c'est exécuter un modèle pour produire une sortie à une requête. Pour les opérateurs, c'est le coût et la latence récurrents de l'automatisation — pas le build ponctuel. Les choix de conception (taille, batch, cache, région) dominent la facture plus que l'astuce du prompt seule.
Pourquoi c'est important pour votre opération
Sans mesurer l'inférence, vous ne gouvernez pas la dépense IA.
