Le 8 juillet 2026, SpaceXAI — la division IA renommée issue de xAI — et Cursor ont lancé Grok 4.5 : le premier modèle que les deux entreprises ont entraîné ensemble, construit en partie à partir des données d’usage propres à Cursor, et optimisé pour le code, les agents, le droit et la finance. Il est sorti à un prix compétitif. Il est aussi sorti indisponible dans l’UE, dès le premier jour, sans date annoncée pour un changement. Trois semaines plus tôt, à l’autre extrémité du spectre, Zhipu publiait les poids de GLM-5.2 sous licence MIT sans restriction — un modèle que les classements indépendants placent quatrième au monde, premier parmi les modèles à poids ouverts, pour environ un sixième du coût des modèles fermés comparables. Deux lancements, à trois semaines d’écart, qui ont discrètement fait sortir « quel modèle utilise-t-on » de la colonne des préférences techniques pour le faire entrer dans la même colonne que toute autre décision fournisseur engageant coût, résidence des données et risque de continuité.
Ce que la plupart des équipes ratent encore
La plupart des organisations d’ingénierie choisissent un modèle de référence comme elles choisissaient autrefois un fournisseur cloud : par défaut, appliqué partout, reconsidéré seulement à la réception de la facture. Cela fonctionnait quand l’écart de prix entre « suffisamment bon » et « le meilleur disponible » était faible. Ce n’est plus le cas. Un modèle de raisonnement phare coûte aujourd’hui environ le double de sa propre génération précédente, et environ dix fois le coût d’une alternative à poids ouverts réellement performante pour le même type de tâche. Payer le prix d’un modèle phare pour du travail routinier — mise en forme, code répétitif, refactorisations simples — n’est pas un choix de qualité. C’est un choix par défaut jamais examiné, et examiner les choix par défaut est précisément la raison d’être d’une revue de gouvernance.
Où en est le paysage aujourd’hui
| Modèle | Positionnement | Prix (entrée/sortie par million de tokens) | À retenir |
|---|---|---|---|
| Claude Fable 5 | Raisonnement et orchestration de référence | 10 $ / 50 $ | En tête des classements d’intelligence indépendants ; coûte environ le double de son propre prédécesseur phare — à réserver aux rares tâches où le jugement expert est réellement rare |
| Claude Opus (haut de gamme) | Modèle phare généraliste solide | 5 $ / 25 $ | Le point médian entre capacité de pointe et prix de pointe |
| GLM-5.2 (Zhipu) | Poids ouverts, licence MIT | 1,40 $ / 4,40 $ en tarif officiel ; jusqu’à 0,56 $ / 1,76 $ via des hébergeurs tiers | Premier des modèles à poids ouverts et quatrième au général sur les classements indépendants ; les poids sont téléchargeables — vous pouvez l’exécuter dans votre propre environnement ou en local |
| Grok 4.5 (SpaceXAI + Cursor) | Code, agents, tâches juridiques et financières | 2 $ / 6 $ en palier standard ; 4 $ / 18 $ en palier rapide | Entraîné en partie sur les données d’usage propres à Cursor ; indisponible dans l’UE au lancement |
Chiffres au 9 juillet 2026, issus des pages tarifaires des fournisseurs et de classements indépendants — à vérifier avant de s’y fier ; ce tableau sera dépassé en quelques semaines.
Cinq choses à faire concrètement
Choisissez le modèle selon la tâche, pas par fidélité de marque. Réservez le modèle le plus onéreux à l’étape où le jugement expert est réellement rare — décisions d’architecture, débogage ambigu, tout ce que vous confieriez à votre ingénieur le plus senior — et orientez délibérément le travail mécanique vers un niveau moins coûteux, pas par accident. Nous appliquons ce même principe à nos propres agents internes : un modèle économique par défaut, un modèle premium réservé aux rares tâches orientées client ou exigeant un jugement expert, et le coût de chaque exécution enregistré avant que quiconque n’ait à demander combien cela a coûté.
Demandez où vivent les poids avant de demander à quel point le modèle est intelligent. Un modèle à poids ouverts que vous pouvez auto-héberger change complètement la conversation sur les données — rien ne quitte votre infrastructure — mais faire fonctionner un modèle ouvert à l’échelle de pointe en pleine précision est une véritable décision d’investissement, pas un projet de garage : un modèle de la classe de poids de GLM-5.2 nécessite de l’ordre d’un serveur à huit GPU et forte mémoire pour fonctionner intégralement. Cela fait de l’auto-hébergement une option réelle pour un acheteur mid-market ou entreprise ayant une vraie décision d’infrastructure à prendre, pas un raccourci.
Vérifiez la disponibilité avant d’engager une feuille de route avec un fournisseur. Un modèle peut être bien tarifé et bien noté tout en restant inutilisable pour vous. Le lancement de Grok 4.5 sans disponibilité dans l’UE est l’exemple du mois ; ce ne sera pas le dernier. Si vous opérez dans un secteur régulé de l’UE, « quand cela arrive-t-il dans notre région » est désormais une question d’achat, pas une note de bas de page vérifiée après coup.
Demandez ce qui a entraîné le modèle avant de lui confier votre code. Un modèle de code entraîné en partie sur les données d’usage agrégées d’un éditeur de code est un avantage de capacité réel — et une véritable question de provenance. Demandez à tout fournisseur, ouvert ou fermé, ce qui est entré dans l’entraînement de son modèle et ce que deviendra votre propre usage ensuite. C’est une question légitime et à laquelle on peut répondre ; les fournisseurs qui ne peuvent ou ne veulent pas y répondre vous disent quelque chose.
Traitez les paliers « illimités » comme une décision tarifaire, pas comme une fonctionnalité. Les modes de repli ou « automatiques » qui semblaient autrefois gratuits sont facturés au forfait à mesure que l’usage grandit, partout dans le secteur. Budgétez explicitement le palier de repli — ne découvrez pas son coût sur la facture.
La limite honnête
Tout ce qui figure dans le tableau ci-dessus sera partiellement dépassé au moment où suffisamment de personnes l’auront lu — c’est la nature d’un marché qui évolue aussi vite. Nous ne plaidons pour aucun modèle en particulier. Nous plaidons pour traiter le choix du modèle avec la même rigueur que toute décision fournisseur engageant coût, localisation des données et continuité d’activité : consignée par écrit, revue, et reconsidérée selon un calendrier — pas choisie une fois par défaut puis oubliée.
Cette rigueur — orienter, journaliser et revoir quel modèle touche quoi, et pourquoi — ressemble beaucoup à ce que nous aidons nos clients à construire pour leurs propres déploiements d’IA et d’agents, simplement appliquée un niveau au-dessus des flux de conformité dont parlent habituellement nos articles. Si votre organisation choisit ses fournisseurs de modèles comme elle choisissait ses fournisseurs cloud il y a dix ans, cet écart mérite d’être examiné avant de s’aggravier.
Nous aidons les organisations régulées et mid-market à concevoir des déploiements d’agents gouvernés et les pratiques de gouvernance de l’IA qui les entourent — y compris les aspects les moins visibles, comme savoir quel modèle peut toucher quelles données, et pourquoi. Si cette question n’a pas encore de réponse assurée dans votre organisation, un Discovery Workshop permet d’en obtenir une en deux semaines.
Combien de modèles votre organisation d’ingénierie utilise-t-elle réellement aujourd’hui — et qui en a décidé ?
