Anthropic a lancé Claude Fable 5 le 9 juin 2026. C'est le premier modèle de sa classe Mythos rendu accessible au grand public, et il signe 29,3 % sur FrontierCode Diamond, soit plus du double de Claude Opus 4.8. Derrière ce chiffre, une question concrète pour les entreprises : qu'est-ce qui change vraiment dans vos workflows, et à quel coût ?
Stripe a confié à Anthropic qu'une migration de code estimée à deux mois pour une équipe complète avait été bouclée en une journée. Le genre d'annonce qui mérite qu'on regarde les chiffres avant de s'emballer. Voici ce que Fable 5 apporte, ce qu'il coûte, et pourquoi ses garde-fous comptent si vous travaillez dans un secteur réglementé.
Un modèle qui change de catégorie, pas de version
Fable 5 n'est pas Opus 4.9. Anthropic l'a placé dans une nouvelle classe baptisée Mythos, un cran au-dessus de la gamme Opus. Les deux modèles de cette classe partagent la même base : Fable 5 embarque des garde-fous conservateurs pour un usage général, tandis que Claude Mythos 5, réservé à quelques partenaires triés sur le volet, lève ces restrictions sur des domaines sensibles comme la cybersécurité.
Sur SWE-Bench Pro, un test qui mesure la résolution de vraies tâches d'ingénierie logicielle issues de dépôts GitHub publics, Fable 5 atteint 80,3 %. Opus 4.8 plafonne à 69,2 %, GPT-5.5 à 58,6 % et Gemini 3.1 Pro à 54,2 %. Sur FrontierCode, le benchmark de Cognition conçu avec plus de vingt mainteneurs open source pour juger la qualité d'un patch en conditions de production, Fable 5 décroche 29,3 % contre 13,4 % pour Opus 4.8 et 5,7 % pour GPT-5.5.
Le même classement se retrouve sur Humanity's Last Exam, l'examen de référence le plus exigeant du moment, soit 2 158 questions d'experts en sciences, mathématiques et sciences humaines. Mesuré en indépendant par Artificial Analysis, Fable 5 le place en tête avec 53,3 %, devant Opus 4.8 (45,7 %) et Gemini 3.1 Pro Preview (44,7 %). Une nuance honnête : sur 9 % des questions, les garde-fous renvoient la réponse vers Opus 4.8, ce qui gonfle un peu le résultat. Et la performance a un prix, au sens littéral : faire passer l'examen à Fable 5 a coûté 2 174 dollars, contre 1 759 pour Opus 4.8.
Onze points d'écart sur SWE-Bench Pro, c'est beaucoup. Pour situer : entre deux modèles de pointe, l'écart habituel se compte en un ou deux points. C'est la différence entre un développeur junior qui débugge en tâtonnant et un senior qui voit la racine du problème au premier coup d'œil. Stripe en a fait l'expérience sur une base de code Ruby de 50 millions de lignes : la migration qui aurait pris plus de deux mois à une équipe entière a été terminée en une journée.
Faut-il pour autant remplacer vos développeurs ? Non. Mais l'arbitrage entre temps humain et temps machine sur les tâches répétitives vient de bouger d'un cran. Détail de timing qui n'a échappé à personne : Anthropic a ouvert ce modèle quelques jours seulement après avoir averti que l'IA devenait trop dangereuse. La société assume cette tension entre puissance et prudence, et elle se lit dans chaque décision de design du produit.
Coder, analyser, voir : trois terrains où Fable 5 prend l'avantage
Le code n'est qu'une partie de l'histoire. Sur SWE-bench Verified, Fable 5 monte à 95 %, devant Opus 4.8 (88,6 %) et GPT-5.5 (82,6 %). À effort medium, Anthropic affirme que le modèle reste le meilleur de sa catégorie sur FrontierCode tout en consommant moins de tokens que les versions précédentes de Claude. Pour des boucles agentiques longues, cette efficacité pèse autant que le score brut, parce qu'elle se traduit directement en facture.
Sur le Hebbia Finance Benchmark, qui évalue le raisonnement d'un modèle au niveau d'un analyste financier chevronné, Fable 5 obtient le meilleur score jamais enregistré, avec des progrès nets sur le raisonnement documentaire et la lecture de graphiques et de tableaux. Le groupe de trading IMC indique que le modèle a passé la quasi-totalité de ses évaluations d'analyse de marché. Pour les directions financières et les sociétés de gestion, ce sont précisément les tâches qui dévorent des journées entières : retraiter un reporting, extraire des chiffres d'un PDF de 200 pages, croiser des tableaux qui ne se parlent pas.
Côté vision, Anthropic place Fable 5 en tête de l'état de l'art. Le modèle extrait des valeurs précises d'illustrations scientifiques détaillées et reconstruit le code source d'une application web à partir de simples captures d'écran. En démonstration, il a terminé Pokémon FireRed en s'appuyant uniquement sur les images du jeu, là où les modèles précédents avaient besoin d'outils annexes et de données de carte. Anecdotique ? Peut-être. Mais la capacité à lire un écran comme le ferait un humain ouvre des usages très concrets, de la relecture de contrats scannés à l'audit de documents mal numérisés.
Anthropic insiste aussi sur un point moins spectaculaire mais décisif : Fable 5 garde le fil sur des millions de tokens et améliore ses propres résultats en prenant des notes au fil de la tâche. La société n'a pas publié de benchmark précis sur ce volet, donc prudence. Si la promesse tient, c'est exactement ce qui sépare un assistant qui se perd à la dixième étape d'un agent capable de mener un dossier de bout en bout.
Le prix double : ce que ça change pour vos budgets
Combien ça coûte ? Fable 5 est facturé 10 dollars par million de tokens en entrée et 50 dollars en sortie. C'est presque le double d'Opus 4.8, qui reste à 5 et 25 dollars. Sur les forfaits Claude.ai, le modèle compte pour 2x dans l'usage, même si Anthropic précise que ce ratio ne reflète pas directement la consommation réelle de tokens.
Le calendrier mérite qu'on le note dans l'agenda. Depuis le 9 juin et jusqu'au 22 juin 2026, Fable 5 est inclus sans surcoût sur les forfaits Pro, Max, Team et Enterprise par siège. À partir du 23 juin, son usage exigera des crédits. Anthropic prévoit de le réintégrer aux forfaits classiques une fois sa capacité de calcul suffisante. Traduction concrète : vous disposez d'une fenêtre courte pour le tester à grande échelle sans toucher au budget.
Avec une fenêtre de contexte d'un million de tokens et jusqu'à 128 000 tokens en sortie, Fable 5 avale des dossiers entiers sans broncher. Reste la vraie question, celle du coût par tâche et non par token. Un modèle deux fois plus cher au token mais qui résout un problème en deux fois moins d'allers-retours peut revenir moins cher au bout du compte. C'est l'arbitrage que chaque équipe devra faire sur ses propres cas. Pour les usages quotidiens à fort volume, Opus 4.8 garde tout son sens. Pour les tâches lourdes où la qualité du résultat prime, Fable 5 se défend largement.
Des garde-fous qui redirigent vers Opus 4.8
Pourquoi Anthropic a-t-il tant attendu avant d'ouvrir un modèle Mythos au public ? Parce qu'il le juge assez puissant pour présenter des risques réels, en cybersécurité ou en recherche sur les armes biologiques notamment. La parade tient en une mécanique simple : des classifieurs détectent les requêtes sensibles et les redirigent automatiquement vers le modèle plus restreint Opus 4.8. Plus de 95 % des sessions ne sont pas concernées.
Ces filtres couvrent trois domaines : la cybersécurité, la biologie et la chimie, et la distillation, c'est-à-dire les tentatives d'un tiers pour extraire les capacités du modèle. En tests offensifs de cybersécurité, Fable 5 a affiché un taux de réussite de 0 %, et les testeurs externes n'ont pas trouvé de contournement universel en plus de 1 000 heures d'essais. Anthropic reconnaît malgré tout que ces filtres sont trop agressifs pour l'instant et peuvent bloquer des demandes parfaitement inoffensives.
Le pendant non bridé, Claude Mythos 5, reste réservé aux défenseurs en cybersécurité via le projet Glasswing, en partenariat avec le gouvernement américain. Anthropic le décrit comme le modèle de cybersécurité le plus puissant au monde, avec un score de 78 % sur le benchmark ExploitBench, contre 40 % pour Opus 4.8. Une enveloppe d'accès dédiée à la biologie, le Trusted Access Program, est aussi prévue pour des chercheurs sélectionnés.
Pour une entreprise réglementée, deux points appellent l'attention. D'abord, une période de rétention des données de 30 jours s'applique à tous les modèles Mythos, le temps de détecter d'éventuelles attaques. Ensuite, le routage silencieux vers Opus 4.8 peut faire varier les réponses sans prévenir l'utilisateur. Si vous déployez Claude dans une direction juridique ou un laboratoire pharmaceutique, ces deux paramètres doivent entrer dans votre analyse de conformité avant tout passage en production.
Ce que ça veut dire secteur par secteur
Un benchmark ne dit rien d'utile tant qu'on ne le traduit pas en cas d'usage. Pour un cabinet de conseil, les gains de Fable 5 sur le raisonnement documentaire et la lecture de tableaux raccourcissent la production d'analyses chiffrées et la synthèse de sources éparses. Pour une direction financière, l'écart sur le Hebbia Finance Benchmark se mesure en heures gagnées sur le retraitement de reportings trimestriels.
Pour les métiers du droit, le bond en vision a un intérêt direct : combien de contrats arrivent encore sous forme de scans illisibles, signés à la main, annotés en marge ? Un modèle capable de lire ces documents avec fiabilité change la donne pour la revue de masse. Reste que le routage automatique vers Opus 4.8 sur les sujets sensibles impose de tester chaque workflow critique plutôt que de présumer un comportement stable.
Côté santé et pharma, c'est surtout Mythos 5 qui retient l'attention : les experts d'Anthropic affirment qu'il a accéléré certaines étapes de conception de médicaments d'un facteur 10, et qu'il a produit des candidats sérieux sur neuf cibles protéiques sur quatorze, sans aide humaine. Ces capacités restent verrouillées pour le grand public, et c'est tant mieux. Mais elles dessinent ce que les classes de modèles suivantes mettront, un jour, entre les mains des laboratoires.
Le cas génomique va plus loin encore. Anthropic rapporte que Mythos 5 a travaillé en quasi-autonomie pendant plus d'une semaine : le modèle a compilé des données monocellulaires pour des millions de cellules issues de 138 espèces animales, puis a conçu et entraîné son propre modèle d'apprentissage pour identifier des cellules de fonction comparable entre organismes éloignés. Le résultat aurait dépassé un modèle récemment publié dans la revue Science, tout en étant cent fois plus petit. Une annonce à prendre avec la prudence d'usage tant qu'elle n'est pas publiée, mais qui montre la trajectoire.
Pour l'assurance et le courtage, l'angle est moins spectaculaire mais tout aussi tangible. La lecture fiable de documents hétérogènes, des conditions générales aux constats manuscrits, et le raisonnement sur des tableaux de sinistralité sont exactement les goulots d'étranglement du quotidien. Un modèle qui tient le fil sur des dossiers volumineux sans se perdre change le rapport entre le temps passé à instruire un dossier et le temps passé à décider.
Faut-il basculer maintenant ?
La réponse honnête : ça dépend de vos cas d'usage. Fable 5 brille sur les tâches longues et complexes, là où l'écart avec Opus 4.8 se creuse vraiment. Sur les tâches courantes, le surcoût ne se justifie pas toujours. Comme pour chaque nouvelle version, nous recommandons à nos clients de tester sur un workflow représentatif avant de basculer quoi que ce soit en production.
La fenêtre gratuite jusqu'au 22 juin est l'occasion de mesurer le gain sur vos propres dossiers plutôt que sur des benchmarks publics. Si vous utilisez déjà Claude Cowork pour automatiser des tâches de bureau, comparez la qualité et le nombre d'allers-retours entre Opus 4.8 et Fable 5 sur trois ou quatre cas réels. Le marché ne ralentit pas : le secteur de l'IA générative est estimé à 161 milliards de dollars en 2026 selon le Boston Institute of Analytics, et les modèles se succèdent désormais tous les deux à trois mois.
Si la fiabilité vous importe plus que la puissance brute, notre analyse de Claude Opus 4.8 reste d'actualité : pour beaucoup d'usages métier, un modèle stable et prévisible vaut mieux qu'un modèle plus puissant mais plus cher et plus difficile à cadrer.
Claude Fable 5 fait passer Claude dans une nouvelle catégorie de capacités, au prix d'un coût doublé et de garde-fous qui méritent un examen sérieux en contexte réglementé. Pour les équipes qui ont déjà intégré Claude dans leurs workflows, c'est un outil à tester sans attendre, surtout pendant la fenêtre gratuite. Pour les autres, c'est un signal de plus que l'écart se creuse entre les entreprises qui déploient et celles qui regardent. Vous voulez savoir ce que Fable 5 change sur vos propres cas d'usage ? Réservez une démo et on le teste ensemble. Le meilleur benchmark, c'est le vôtre.