47 milliards de dollars. C'est ce que les entreprises dépenseront en agents IA d'ici fin 2026, selon les projections IDC. Un chiffre vertigineux, mais qui masque une question que beaucoup de DSI préfèrent encore repousser : combien coûte réellement un agent IA en production ? Anthropic vient de forcer la réponse. Le 14 mai, l'éditeur de Claude a annoncé la séparation de la facturation des agents IA de celle du chat conversationnel. Fini le forfait unique où tout passait dans le même tuyau. À compter du 15 juin, chaque usage programmatique sera comptabilisé à part, facturé aux tarifs API.

Ce n'est pas un ajustement technique. C'est le signal que l'ère du "tout compris" pour l'IA agentique touche à sa fin. Et votre budget 2026 devrait en tenir compte.

Ce qui change concrètement le 15 juin chez Anthropic

Jusqu'à présent, un abonné Claude Pro, Max ou Enterprise disposait d'un pool de consommation unique. Que vous discutiez avec Claude dans le chat, que vous lanciez un workflow automatisé via l'Agent SDK, ou qu'un outil tiers comme OpenClaw exploite votre abonnement pour faire tourner des agents autonomes, tout se mélangeait dans le même compteur. L'abonnement couvrait l'ensemble, à un tarif forfaitaire très avantageux comparé aux prix API bruts.

Anthropic coupe ce lien. À partir du 15 juin 2026, deux pools distincts coexistent. Le premier, inchangé, couvre l'usage interactif : Claude Cowork, le chat, les sessions manuelles. Le second, entièrement nouveau, isole tout ce qui est programmatique : l'Agent SDK, la commande claude -p, les GitHub Actions, et l'ensemble des applications tierces construites sur le SDK.

Chaque abonné reçoit un crédit mensuel dédié à ce second pool. Les montants suivent les paliers d'abonnement : 20 $ pour les abonnés Pro, 100 $ pour Max 5x, 200 $ pour Max 20x. Pour les abonnements Team, c'est 20 $ par siège en Standard et 100 $ en Premium. Les clients Enterprise reçoivent des montants variables selon leur contrat. Ce crédit ne se cumule pas d'un mois à l'autre : ce qui n'est pas consommé au cycle suivant disparaît.

Attention au piège apparent. Sur le papier, ces crédits ressemblent à un bonus. En réalité, l'usage programmatique est désormais facturé aux tarifs API complets, alors qu'il bénéficiait auparavant d'une subvention implicite via l'abonnement. Pour un utilisateur intensif d'agents, la facture réelle peut augmenter sensiblement.

Une fois le crédit épuisé, deux options. Soit vous activez les "Usage Credits", facturés aux prix API standard, et la consommation continue sans interruption. Soit vous les laissez désactivés, et vos agents s'arrêtent jusqu'au prochain cycle de facturation. Pour une entreprise qui fait tourner des agents en production 24h/24 sur des tâches critiques, la seconde option n'en est pas vraiment une.

Pourquoi tous les éditeurs basculent vers la consommation

Anthropic n'est pas seul à opérer ce virage. L'annonce du 14 mai s'inscrit dans un mouvement de fond qui touche l'ensemble de l'industrie, et les chiffres Forrester le confirment : la part des abonnements SaaS reposant sur un modèle par siège est passée de 21 % à 15 % en un an, pendant que les modèles hybrides et à la consommation bondissaient à 41 % du marché.

Pourquoi ce basculement ? Parce que les agents IA consomment des ressources d'une manière radicalement différente du logiciel classique. Un collaborateur qui utilise un chatbot envoie quelques dizaines de messages par jour. Un agent autonome qui tourne en arrière-plan sur un pipeline CI/CD ou qui traite automatiquement les e-mails d'un cabinet de courtage peut générer des milliers de requêtes. L'inférence représente 80 à 90 % de la dépense totale des systèmes agentiques, selon les analyses de Gartner 2026 sur le coût des agents IA. Aucun modèle forfaitaire ne peut absorber cette disproportion indéfiniment.

Anthropic l'a appris à ses dépens. Quand l'outil open source OpenClaw a permis aux abonnés de faire tourner des flottes entières d'agents via leur simple abonnement Max, la charge serveur a explosé. L'entreprise a d'abord restreint l'accès à OpenClaw en avril 2026, avant de généraliser la séparation à tous les usages programmatiques un mois plus tard.

C'est un peu comme si votre opérateur mobile proposait un forfait data illimité, et qu'une application se mettait à télécharger des films 4K en boucle sans que vous le sachiez. Le réseau sature, et tout le monde en pâtit. La réponse logique, c'est de séparer les compteurs.

OpenAI, Microsoft, Google : même trajectoire

Regardez autour d'Anthropic. Le même mouvement se dessine partout. OpenAI a toujours facturé son API à la consommation, en gardant l'abonnement ChatGPT Plus cantonné à l'usage interactif. En mai 2026, l'entreprise a modifié la tarification de Codex pour passer à une facturation au token, abandonnant le modèle forfaitaire pour les workflows automatisés.

GitHub suit la même logique. Copilot migre progressivement vers un système de crédits et de tokens, une mécanique quasi identique à celle qu'Anthropic vient d'annoncer. Microsoft, de son côté, facture déjà les agents Copilot sur une base de consommation dans les offres Microsoft 365 Copilot.

Sanchit Vir Gogia, analyste chez Greyhound Research, résume la tendance dans InfoWorld : dans les 12 à 24 prochains mois, les entreprises doivent s'attendre à voir apparaître des pools de consommation distincts chez tous les éditeurs, que ce soit pour les agents, les modèles premium, l'utilisation d'outils, ou les intégrations tierces. Les noms varieront (crédits, requêtes, messages, unités de calcul), mais la direction est la même.

Gartner anticipe que 40 % des applications d'entreprise embarqueront des agents IA spécialisés d'ici fin 2026, contre moins de 5 % en 2025. Quand chacune de ces applications facture à la consommation, les lignes budgétaires se multiplient vite.

Même Intercom, qui n'a rien d'un éditeur d'IA, a pivoté d'un abonnement à 39 $ par agent humain vers un modèle à 0,99 $ par ticket résolu par l'IA. Résultat selon Forrester : 40 % d'adoption en plus et des marges maintenues en six mois. Le message est clair. La tarification à la consommation n'est pas une punition, c'est un modèle qui s'impose parce qu'il fonctionne mieux pour tout le monde, à condition de savoir le piloter.

L'impact concret sur votre budget IA

Combien coûte un agent en production ? C'est la question que chaque direction financière devrait poser à sa DSI. Et la réponse varie énormément selon les cas d'usage.

Prenons un exemple concret. Un cabinet de conseil qui utilise Claude pour automatiser la veille réglementaire avec trois agents tournant en parallèle consommait auparavant cette capacité dans son abonnement Max 20x à 200 $/mois. Avec le nouveau modèle, ces mêmes agents piochent dans un crédit séparé de 200 $ facturé aux tarifs API. Claude Sonnet 4.6 coûte 3 $ par million de tokens en entrée et 15 $ en sortie. Trois agents qui traitent chacun 500 000 tokens d'entrée et 100 000 tokens de sortie par jour épuisent le crédit en une dizaine de jours.

Les coûts d'intégration s'ajoutent à la note. Selon les données compilées par Sustainability Atlas sur les déploiements d'agents en 2026, les coûts d'intégration dépassent régulièrement les estimations initiales de 30 à 50 %, et l'intégration combinée au change management représente 35 à 45 % du coût total de possession la première année.

Pour les entreprises qui avaient bâti des workflows automatisés en comptant sur le modèle forfaitaire, le réveil peut être brutal. Comme le souligne Advait Patel, ingénieur senior chez Broadcom, dans InfoWorld : les crédits sont individuels et ne se mutualisent pas. Impossible de partager un budget entre les membres d'une équipe. Les automations partagées deviennent compliquées à gérer, et un agent mal calibré peut consumer l'intégralité d'un crédit en quelques heures.

Comment piloter vos coûts d'agents IA

La bonne nouvelle, c'est que ce nouveau modèle force une hygiène budgétaire qui manquait cruellement. Quand tout est forfaitaire, personne ne mesure rien. Quand le compteur tourne, chaque token compte.

Paul Chada, cofondateur de la startup Doozer AI, conseille dans InfoWorld de cesser d'optimiser pour la subvention et de commencer à optimiser pour le token. Le prompt caching, la discipline de contexte et le choix du modèle deviennent des compétences d'ingénierie de premier plan. Les développeurs qui prospéreront dans l'ère du compteur sont ceux qui auraient construit des agents efficaces de toute façon. La subvention ne faisait que masquer qui savait et qui ne savait pas.

Plusieurs leviers existent pour maîtriser la facture. Le prompt caching, par exemple, permet d'économiser jusqu'à 90 % sur les tokens d'entrée récurrents, comme l'a récemment détaillé le Journal du Geek. C'est considérable quand vos agents traitent des documents similaires en boucle, ce qui est précisément le cas dans les directions juridiques qui analysent des contrats ou les sociétés de gestion qui parcourent des rapports financiers.

Le choix du modèle pèse aussi lourd. Tous les agents n'ont pas besoin d'Opus 4.6. Pour le tri d'e-mails, la classification documentaire ou l'extraction de données structurées, Haiku 4.5 coûte une fraction du prix avec des résultats souvent suffisants. La règle est simple : le modèle le plus petit capable de faire le travail est toujours le bon choix. Un agent de routage d'e-mails qui tourne sur Haiku à 0,25 $ le million de tokens en entrée plutôt que sur Opus à 15 $ le million, c'est un facteur 60 sur la ligne de coût. Sur un an, ça se chiffre en dizaines de milliers d'euros pour un résultat souvent équivalent.

Autre levier sous-estimé : la fenêtre de contexte. Plus vous envoyez de tokens dans chaque requête, plus vous payez. Les agents qui embarquent systématiquement l'intégralité d'un document de 200 pages alors que seuls trois paragraphes sont pertinents gaspillent du budget. Le découpage intelligent des documents, la recherche vectorielle préalable, et les stratégies de résumé progressif deviennent des compétences à forte valeur ajoutée dans l'équipe technique.

L'approche la plus mature consiste à traiter le budget IA comme un budget cloud. Pas un logiciel qu'on achète une fois, mais une infrastructure qu'on pilote en continu. Alertes de consommation, plafonds par workflow, revue mensuelle des agents actifs. Les entreprises qui gèrent déjà leur facture AWS ou GCP de cette manière ont une longueur d'avance.

Ce que ça signifie pour le marché de l'IA en entreprise

Au-delà de la mécanique tarifaire, cette évolution redessine la relation entre éditeurs et clients. Les dépenses mondiales en agents IA devraient atteindre 1 400 milliards de dollars en 2027 selon les projections IDC. À cette échelle, la question n'est plus de savoir si l'IA vaut le coup, mais comment la rendre économiquement prévisible.

Le modèle par consommation a un avantage que les forfaits n'ont pas : il aligne les intérêts. Quand un agent ne produit pas de valeur, vous ne payez plus pour le faire tourner dans le vide. Quand il en produit, le coût est proportionnel au travail accompli. C'est la même logique qui a fait le succès du cloud computing il y a quinze ans.

Mais il a aussi un défaut que les DAF connaissent bien : l'imprévisibilité. Un agent qui tourne en boucle sur un cas limite, un prompt mal conçu qui génère des retries en cascade, un pic d'activité inattendu. Autant de scénarios où la facture dérape. Les équipes de formation Claude Cowork que nous animons chez ClaudIn insistent particulièrement sur cette discipline de conception, parce que c'est là que se joue la différence entre un déploiement rentable et un gouffre financier.

La maturité IA d'une organisation se mesure désormais aussi à sa capacité à piloter ses coûts agentiques. Les 20 % d'entreprises qui captent réellement la valeur de l'IA, selon l'étude McKinsey 2025 sur l'adoption, sont aussi celles qui ont mis en place un suivi granulaire de leur consommation. Ce n'est pas une coïncidence.

Que vous soyez un cabinet d'assurance qui automatise le traitement des sinistres, une organisation de santé qui structure des dossiers patients, ou un cabinet de recrutement qui pré-qualifie des candidatures, la question est la même : combien de valeur chaque euro d'agent IA vous rapporte-t-il ? Si vous ne pouvez pas répondre aujourd'hui, le passage à la facturation à la consommation va rendre cette lacune très visible, très vite.

Se préparer maintenant plutôt que subir en juin

Le changement entre en vigueur dans moins d'un mois. Anthropic enverra un e-mail le 8 juin pour permettre aux abonnés d'activer leurs crédits. Mais attendre cette date pour réagir, c'est déjà trop tard si vos agents consomment massivement. L'audit de vos workflows automatisés, l'optimisation de vos prompts, et le choix des bons modèles par cas d'usage sont des chantiers à lancer maintenant. Nos équipes accompagnent les entreprises dans cette transition, de l'audit de consommation à la reconfiguration des agents pour maximiser le ratio valeur/coût.