Glossaire
Glossaire
Définitions en langage clair pour opérateurs qui construisent des systèmes IA pratiques. Sans hype — les termes que vous croisez en Découverte et en production.
Agent observability (observabilité des agents)
L'observabilité des agents, c'est voir les traces de ce qu'un agent a fait : prompts ou appels d'outils, périmètres de données, latence, coût et résultats. Sans elle, les incidents deviennent des jeux de blâme.
Agentic AI (IA agentique)
L'IA agentique désigne des systèmes qui poursuivent des objectifs avec outils et plans multi-étapes — pas des réponses en un coup. Elle ne paie que si périmètre, validations et évaluation sont conçus dès le départ.
AI agent (agent IA)
Un agent IA est un logiciel avec un objectif, des outils et des limites — pas un chatbot qui ne fait que discuter. Il peut trier, rédiger ou mettre à jour des systèmes sous vos règles, avec validation humaine sur les actions sensibles.
AI Operating Layer (Couche Opérationnelle d'IA)
Une Couche Opérationnelle d'IA est la pile de production qui fait tourner des agents pratiques sur vos données — modèles open par défaut, frontier quand c'est justifié, outils MCP et validation humaine sur le sensible — comme un système gouverné.
Article 50 transparency (transparence de l'article 50)
L'article 50 du règlement IA couvre des obligations de transparence pour certains usages — comme informer les personnes qu'elles interagissent avec une IA quand cela compte. Pour beaucoup d'usages d'agents face client, elles s'appliquent dès le 2 août 2026.
Audit trail (piste d'audit)
Une piste d'audit est un enregistrement durable de qui ou quoi a accédé à quelle ressource, dans quel but, quand et avec quelle approbation. Pour les agents IA, elle doit inclure outils et routes de modèles, pas seulement les connexions humaines.
Context window (fenêtre de contexte)
La fenêtre de contexte est la quantité de texte qu'un modèle peut prendre en compte à la fois (prompt plus historique). Plus grand n'est pas toujours mieux : du contexte inutile augmente le coût et peut nuire à la précision.
Data lakehouse (lakehouse de données)
Un data lakehouse combine gouvernance type warehouse et stockage flexible type lake — souvent avec couches bronze/argent/or, catalogue et accès fin. Pour l'IA, c'est là que vivent tables et documents de confiance pour que les agents ne ratissent pas des partages non gérés.
Data residency (résidence des données)
La résidence des données exige que certaines données restent dans une région ou un environnement que vous contrôlez. Pour l'IA, elle façonne les routes autorisées : open dans votre région contre clouds éditeurs.
Embedding (plongement)
Un embedding (plongement) est une représentation numérique du contenu qui place les sens proches dans l'espace vectoriel. Il alimente recherche sémantique et RAG.
EU AI Act (règlement IA de l'UE)
Le règlement IA de l'UE est la loi européenne fondée sur le risque pour les systèmes d'IA. Les obligations varient selon l'usage et la classe de risque.
Evaluation (evals)
Les evals sont des tests structurés du comportement d'agents ou de modèles face à des exemples et critères — précision, ton, coût, refus, usage d'outils. Sans evals, « ça marchait en démo » est la seule preuve.
FinOps (FinOps)
Le FinOps est la pratique de rendre la dépense cloud et IA visible, attribuable et décidée — pas seulement payée. Pour l'IA, cela signifie connaître le coût par flux, par route de modèle et par environnement, puis changer routage ou périmètre quand les chiffres ne matchent pas la valeur.
Frontier model (modèle frontier)
Un modèle frontier est un modèle fermé ou très capable, souvent en API éditeur. Il coûte souvent plus par appel que des routes open capables.
Guardrails (garde-fous)
Les garde-fous sont des limites techniques et de processus qui gardent les agents dans le comportement autorisé : listes d'outils, périmètres de données, filtres de sortie, limites de débit et chemins d'escalade. Ils complètent la validation humaine — ils ne remplacent pas la propriété claire de qui peut changer les règles.
Hallucination (hallucination)
Une hallucination est une sortie fluide du modèle fausse ou non étayée. En opérations, le risque n'est pas la poésie — c'est inventer une réservation, une politique ou un fait client.
Human-in-the-loop (humain dans la boucle)
Humain dans la boucle signifie qu'une personne doit approuver ou corriger certaines étapes avant effet — surtout messages sortants, paiements, suppressions ou exceptions de politique. Ce n'est pas un échec de l'automatisation ; c'est comment garder les agents sûrs là où l'erreur coûte cher.
Inference (inférence)
L'inférence, c'est exécuter un modèle pour produire une sortie à une requête. Pour les opérateurs, c'est le coût et la latence récurrents de l'automatisation — pas le build ponctuel.
LLM (grand modèle de langage)
Un grand modèle de langage (LLM) prédit des jetons de texte selon le contexte. Les opérateurs l'utilisent dans des flux — tri, brouillons, extraction — pas comme produit entier.
MCP (Model Context Protocol)
MCP (Model Context Protocol) est une façon standard pour les agents de parler aux outils et sources de données via des interfaces cohérentes. Pour les opérateurs, cela réduit le colle ad hoc et facilite l'accès au moindre privilège — quand les serveurs sont cadrés et journalisés comme toute intégration.
Model routing (routage de modèles)
Le routage de modèles envoie chaque flux ou étape vers le modèle qui convient — open pour le volume, frontier si justifié, routes régionales si les données l'exigent. Une passerelle sépare agents et fournisseurs pour changer de modèle, suivre les coûts et garder la politique en un seul endroit.
Open-weights model (modèle à poids ouverts)
Un modèle à poids ouverts publie ses paramètres pour tourner chez vous ou chez un hôte choisi. Pour les opérateurs, l'enjeu est le contrôle : région, coût et changer d'hôte sans réécrire les flux.
PBAC (contrôle d'accès par finalité)
Le PBAC (contrôle d'accès par finalité) accorde l'accès pour un but et une durée déclarés, pas des privilèges permanents. Pour les agents, un bot de tri peut lire des champs boîte mail pour classer mais pas exporter tout le CRM.
Prompt caching (cache de prompts)
Le cache de prompts réutilise des préfixes stables (politiques, schémas, longues instructions) pour que les appels répétés coûtent moins et aillent plus vite. En volume avec des requêtes similaires, le taux de hit déplace souvent la facture plus qu'un changement de modèle.
RAG (génération augmentée par récupération)
Le RAG (génération augmentée par récupération) va chercher documents ou enregistrements pertinents avant la réponse du modèle, pour ancrer la réponse dans votre contenu plutôt que dans la seule mémoire. Il faut une récupération propre, des droits et de l'évaluation — pas seulement une base vectorielle.
Token (jeton)
Un jeton (token) est un morceau de texte que le modèle lit ou écrit — à peu près un fragment de mot. Prix et limites de contexte s'expriment souvent en jetons.
Vector database (base de données vectorielle)
Une base de données vectorielle stocke des embeddings pour trouver texte, images ou enregistrements similaires par sens. C'est de l'infra pour la recherche et le RAG, pas un substitut au contrôle d'accès ou à la rétention.
Yerbabuena Digital
Prêts à planter quelque chose de bon ensemble ?
Dites-nous où en est votre saison. Nous parcourrons le champ avec vous — honnêtement — et suggérerons la plus petite prochaine étape qui peut prendre racine.
