Anthropic a lancé Claude Opus 5 le 24 juillet 2026. Le modèle approche la puissance de Fable 5, le plus avancé du catalogue, pour la moitié du prix. Et sur ARC-AGI 3, un test conçu pour résister au bachotage, il multiplie par vingt le score de son prédécesseur. Pour une entreprise qui surveille sa facture d'IA, ce n'est pas la performance brute qui change la donne. C'est ce qu'elle coûte.
Opus 5 n'arrive pas seul. C'est le quatrième modèle qu'Anthropic sort en moins de deux mois, après Mythos 5, Fable 5 et Sonnet 5. Sauf que celui-ci ne vise pas le sommet des classements. Il vise le travail de tous les jours, celui que vos équipes délèguent à l'IA du matin au soir, et il le vise avec une obsession assumée pour le rapport entre ce que ça produit et ce que ça coûte.
Quatre modèles en deux mois, un seul message : le prix
Commençons par le chiffre qui structure tout le reste. Opus 5 est facturé 5 dollars par million de tokens en entrée et 25 dollars en sortie. C'est exactement le tarif d'Opus 4.8, et la moitié du prix de Fable 5, dont la grille affiche 10 et 50 dollars aux mêmes conditions. Anthropic résume son modèle en une phrase : une intelligence proche de celle de Fable 5, pour deux fois moins cher.
Pourquoi tant insister sur le tarif ? Parce que la facture d'IA est passée du service informatique au comité de direction. Une enquête relayée par la presse spécialisée en juillet 2026 évoque 78 % d'organisations confrontées à des dépassements de budget IA imprévus. Fable 5, justement, s'était attiré les foudres des équipes techniques pour sa tendance à consommer beaucoup de tokens sur une même tâche, au point de vider les enveloppes plus vite que prévu. Le reproche était simple : un modèle brillant, mais dont personne ne savait combien il allait coûter à la fin du mois.
La concurrence pousse dans la même direction. OpenAI a sorti GPT-5.6 le 9 juillet en mettant elle aussi l'économie de tokens au cœur de son argumentaire. Anthropic, de son côté, avait déjà ajouté début juillet des outils de pilotage de la dépense à Claude Enterprise : nous avons détaillé ces contrôles de coûts côté administrateur dans un article dédié. Opus 5 attaque le problème par l'autre bout, celui du modèle lui-même. Un rappel utile au passage : la gamme Claude s'organise en trois tailles, Haiku pour le plus léger, Sonnet pour l'intermédiaire, Opus pour le plus capable. Opus 5 rend ce dernier étage abordable au quotidien, ce qui n'allait pas de soi jusqu'ici.
Le curseur d'effort : vous arbitrez entre coût et capacité
La vraie nouveauté que retiendront les directions, c'est le curseur d'effort. Opus 5 propose quatre niveaux, de « low » à « max ». Vous décidez, requête par requête, combien le modèle réfléchit avant de répondre. Effort faible : moins de tokens, réponse rapide, coût contenu. Effort maximal : plus de raisonnement, résultat plus soigné, dépense supérieure.
Pensez à une voiture hybride qui bascule seule entre le moteur électrique et le thermique selon la route. Trier trois cents emails ne réclame pas la même énergie qu'éplucher un pacte d'actionnaires de 80 pages. Jusqu'ici, arbitrer voulait dire changer de modèle à la main. Le curseur déplace cet arbitrage à l'intérieur d'un seul modèle, en temps réel, sans que vos équipes aient à se demander lequel choisir.
Les chiffres avancés par Anthropic frappent fort. Sur un test interne de trading, Opus 5 atteint son meilleur score en utilisant environ un septième des tokens de raisonnement d'Opus 4.8, pour moins de la moitié de la latence. Sur Zapier AutomationBench, qui mesure la capacité à boucler une tâche métier du début à la fin, Opus 5 réglé au minimum passe déjà plus de tâches que n'importe quel autre modèle poussé au maximum, d'après l'analyse de Vellum. Wade Foster, patron de Zapier, décrit une séquence complète de prévention du churn, du repérage des comptes à risque jusqu'au résumé destiné à l'équipe rétention, bouclée à 100 %.
Qu'est-ce que ça change pour une direction financière qui pilote un budget IA ? La dépense cesse d'être une boîte noire. Une équipe route les tâches répétitives en effort faible, réserve le mode maximal aux analyses lourdes, et voit le coût suivre l'usage réel plutôt que l'inverse. Anthropic affirme d'ailleurs qu'à budget égal, Opus 5 délivre plus de performance que tout autre modèle sur les réglages élevés. C'est ce détail, plus que n'importe quel record, qui décide vers quel modèle une entreprise oriente son trafic.
Des benchmarks qui recadrent le positionnement
« Proche de Fable 5 », disait l'annonce. Les chiffres racontent autre chose. Sur Frontier-Bench v0.1, un test de codage agentique en conditions réelles, Opus 5 marque 43,3 %, contre 33,7 % pour Fable 5 et 18,7 % pour Opus 4.8, selon les scores publiés par Anthropic et repris par Vellum et VentureBeat. Le modèle censé « s'approcher » de Fable 5 le dépasse de près de dix points, à moitié prix. La veille du lancement, le consensus tablait sur un Opus 5 comparable à Fable 5 sans le surpasser. C'était sous-estimer la marche.
Le résultat le plus commenté vient d'ailleurs. ARC-AGI 3, le test bâti par François Chollet, plonge l'IA dans des environnements interactifs sans consigne, sans règle et sans but affiché : elle doit tout deviner par essais-erreurs. À sa sortie en mars 2026, le meilleur modèle plafonnait à 0,37 %. Opus 5 obtient 30,2 %, soit environ quatre fois le score de GPT-5.6 Sol (7,8 %) et vingt fois celui d'Opus 4.8 (1,5 %), d'après la Fondation ARC Prize. Résoudre des règles inédites par l'interaction, ce n'est pas la même chose que d'aller plus vite sur des tâches déjà vues. C'est une propriété bien plus difficile à truquer.
Le reste suit la même logique de rapport qualité-prix. Sur CursorBench 3.2, Opus 5 arrive à 0,5 % du meilleur score de Fable 5, pour deux fois moins cher par tâche. Sur OSWorld 2.0, un test d'usage d'ordinateur, il dépasse Fable 5 à un tiers du coût. Sur SWE-bench Multilingual, il grimpe à 89,5 %, contre 84,4 % pour Opus 4.8. Côté science, Anthropic revendique son modèle le plus capable pour la recherche, avec des gains de 10,2 points en chimie organique et 7,7 points sur les tâches liées aux protéines par rapport à Opus 4.8.
Une réserve, tout de même. Ces résultats sont autopubliés par Anthropic, souvent sous forme de courbes coût-performance en images plutôt que de tableaux vérifiables ligne à ligne. Les évaluateurs tiers indépendants n'ont pas encore tranché. Prenez-les comme une direction crédible, confirmée par plusieurs partenaires, mais pas comme une preuve gravée dans le marbre. Le seul verdict qui compte pour vous reste celui de vos propres dossiers.
L'IA qui relit son propre travail
Au-delà des scores, c'est un changement de comportement qui ressort des retours clients. Opus 5 vérifie ce qu'il produit, repère ses propres erreurs et recommence jusqu'à réussir, sans qu'on ait à le reprendre, souligne Fortune. Pour les métiers où une erreur non détectée coûte plus cher qu'un retard, ce trait vaut davantage qu'un point de benchmark.
Un exemple parle de lui-même. Sur une tâche de Frontier-Bench, le modèle reçoit le dessin d'une pièce mécanique et doit la reconstruire en 3D, sans aucun moyen de « voir » l'image directement. Opus 5 a écrit son propre programme de vision par ordinateur pour extraire la géométrie des pixels bruts, puis a reconstitué la pièce. Aucun modèle concurrent placé dans les mêmes conditions n'y est parvenu après cinq tentatives, rapporte Vellum. Ce réflexe de contrôle se lit aussi dans les chiffres : sur SWE-bench Multimodal, qui mêle code et images, Opus 5 atteint 59,4 %, contre 38,4 % pour Opus 4.8.
Combien de dossiers repartent chez vous avec une coquille que personne n'a vue à temps ? AJ Orbach, de la société Tako, décrit un Opus 5 qui ouvre les pages qu'il code à la largeur d'un écran de bureau puis d'un mobile, repère un produit caché sous la ligne de flottaison et un bouton de paiement hors champ, et corrige les deux avant de rendre son travail. Un ingénieur d'une salle de marché raconte de son côté un modèle qui, faute de flux de données à disposition, a construit son propre banc de test pour valider son code.
Pour une direction juridique ou une société de gestion, cette capacité à s'autocontrôler pèse lourd. Un modèle qui signale son propre doute vaut mieux qu'un modèle brillant qui se trompe en silence. C'est la différence entre un stagiaire qui vous prévient d'une incohérence dans une annexe et un stagiaire qui rend un document impeccable sur la forme, mais faux sur le fond.
Du POC à la production : pourquoi le prix débloque l'adoption
Un modèle moins cher ne sert à rien s'il reste prisonnier d'un pilote qui ne voit jamais la production. C'est pourtant là que la majorité des projets d'IA s'enlisent, entre le prototype qui séduit et le déploiement qui traîne. Gartner prévoit que plus de 40 % des projets d'IA agentique seront abandonnés d'ici 2027, faute de retour sur investissement clair et de maîtrise des risques. McKinsey enfonce le clou : près de deux tiers des entreprises ont testé des agents, mais moins de 10 % les ont déployés à une échelle qui crée de la valeur mesurable.
Qu'est-ce qui coince, au juste ? Deux choses, toujours les mêmes. D'abord la visibilité sur le coût : un dirigeant valide difficilement un passage en production quand la facture peut varier du simple au décuple selon les usages. Ensuite la confiance dans le résultat : personne ne laisse un agent travailler seul sur un dossier client sans la garantie qu'il signalera ses propres erreurs.
Le nouveau modèle s'attaque aux deux blocages d'un coup. Le curseur d'effort transforme une dépense floue en budget pilotable, et l'autovérification réduit le risque d'une erreur qui file sous les radars. L'enjeu est loin d'être théorique : McKinsey chiffre entre 2 600 et 4 400 milliards de dollars par an la valeur que l'IA générative pourrait ajouter à l'économie mondiale. Encore faut-il franchir la marche de la production. Pour une équipe qui déploie Claude Cowork sur des tâches réelles, un modèle à coût prévisible et au comportement plus fiable, c'est ce qui fait passer un projet du tableur de démonstration à l'outil que l'on ouvre chaque matin.
Sécurité, repli automatique et disponibilité en entreprise
Opus 5 est aussi, selon Anthropic, le modèle Opus le plus aligné à ce jour, avec un score de 2,30 sur son audit comportemental interne, le plus bas des modèles Claude récents. Surtout, ses classificateurs de sécurité se déclenchent environ 85 % moins souvent que ceux de Fable 5. La leçon a été retenue : Fable 5 avait été critiqué pour des garde-fous si stricts qu'ils bloquaient du travail légitime, en cybersécurité défensive comme en recherche. Trop de refus tuent l'adoption aussi sûrement que trop peu de sécurité.
Deux nouveautés techniques accompagnent le modèle. Le repli automatique d'abord : quand une requête est signalée par les filtres de sécurité, l'API la redirige vers un autre modèle, en l'occurrence Opus 4.8, au lieu de renvoyer une erreur. Vos utilisateurs obtiennent une réponse, pas un mur. Le changement d'outils en cours de conversation ensuite, qui permet aux développeurs de modifier les outils accessibles à Claude sans casser le cache de prompts. Sur des boucles agentiques longues, ce genre de détail se traduit directement en coût et en fluidité.
Côté déploiement, Opus 5 arrive immédiatement là où vos équipes travaillent déjà : claude.ai en formules Team et Enterprise, l'API sous l'identifiant claude-opus-5, Claude Code, Claude Cowork, ainsi qu'Amazon Bedrock, Google Vertex AI et Microsoft Foundry. La fenêtre de contexte atteint un million de tokens, avec jusqu'à 128 000 tokens en sortie. Le modèle devient le choix par défaut sur Claude Max et le plus puissant proposé sur Claude Pro. Pour une DSI, l'intérêt est double : pas de plateforme tierce à ouvrir, et un modèle qui tourne dans une infrastructure déjà auditée.
Opus 5 ne prétend pas être le modèle le plus puissant du marché. Fable 5 garde l'avantage sur les projets les plus lourds et les tâches autonomes qui s'étalent sur plusieurs jours, et Anthropic le recommande d'ailleurs pour ces cas-là. Le pari d'Opus 5 est ailleurs : rapprocher la performance de pointe du prix d'un modèle courant, et rendre l'arbitrage coût-capacité aussi simple qu'un curseur. Pour une organisation qui déploie l'IA dans des métiers réglementés, du conseil à la finance, c'est une raison de rouvrir le dossier avant la rentrée. Mise à jour de septembre 2026 : Anthropic a depuis sorti Claude Opus 5.5, encore 20 % moins cher au token et deux fois plus économe en tokens consommés. Le meilleur test reste le vôtre : réservez une démo pour mesurer Opus 5 sur vos propres cas d'usage, avec vos documents et vos contraintes.