Depuis le 23 juillet 2026, le mode vocal de Claude ne se contente plus de répondre vite. Il tourne désormais sur les modèles Opus et Sonnet, se connecte à votre messagerie et à votre agenda, et comprend onze langues, dont le français. Or parler va environ trois fois plus vite que taper. Pour un dirigeant qui enchaîne les réunions, ce changement en apparence technique déplace la frontière entre poser une question à une IA et lui confier une tâche.

Le 23 juillet, la voix de Claude change de dimension

Jusqu'ici, parler à Claude tenait de la commodité. Le mode vocal tournait sur un seul modèle, Claude Haiku, choisi pour sa rapidité. Pratique pour une question express, vite limité dès qu'il fallait creuser. Le 23 juillet, Anthropic a ouvert le vocal à Claude Opus et Claude Sonnet, ses modèles taillés pour les problèmes difficiles, tout en gardant Haiku pour les échanges les plus courts, selon l'annonce d'Anthropic. Vous changez de modèle en pleine conversation, et la voix reprend par défaut le dernier modèle utilisé en mode texte.

Le vocal ne se limite plus à l'anglais. Claude comprend maintenant onze langues à l'oral, dont le français, l'allemand, l'italien, l'espagnol, le japonais et le coréen, sur toutes les offres, y compris gratuite. Autre détail qui pèse dans l'usage réel : la conversation fonctionne par tours de parole. Claude écoute, marque un temps pour réfléchir, puis répond, au lieu de vous couper à la première syllabe. Qui a déjà tenté de dicter une idée complexe à un assistant qui l'interrompt sans cesse sait à quel point ce point-là change tout.

Ce basculement dit quelque chose de plus large sur la direction que prend Claude. Poser une question et recevoir une réponse, tout le monde sait le faire. Confier une tâche et la voir aboutir, c'est un autre métier. En plaçant ses modèles les plus capables dans le vocal, Anthropic transforme la conversation parlée en point de départ d'un travail réel, pas en simple recherche améliorée. Pour une équipe, la bonne question n'est plus « qu'est-ce que cette IA peut me dire », mais « qu'est-ce que je peux lui confier ».

Le mode vocal arrive en bêta sur mobile, ordinateur et web, avec une expérience pensée d'abord pour le téléphone. Ce calendrier tombe une semaine après l'arrivée de Claude Cowork sur mobile et web, et la logique est la même : rapprocher l'IA du terrain, là où le travail se fait vraiment. Le marché va dans ce sens. L'IA conversationnelle est estimée à près de 18 milliards de dollars en 2026, contre environ 15 milliards un an plus tôt, d'après un panorama de statistiques du secteur. La voix quitte le terrain du gadget grand public pour devenir une interface de travail.

Parler va trois fois plus vite que taper

Un chiffre résume l'intérêt de la voix. Une étude de l'université Stanford, menée avec l'université de Washington et Baidu, a comparé la saisie vocale et la frappe au clavier sur smartphone. Dicter s'est révélé trois fois plus rapide qu'écrire en anglais, avec un taux d'erreur inférieur de 20 % une fois la correction automatique prise en compte, rapporte Stanford. On tape autour de 40 mots par minute sur un clavier de téléphone. On parle à près de 150.

Ce rapport de un à trois ne touche pas que la vitesse d'écriture. Il change la façon même dont une idée se forme. À l'écrit, vous corrigez, vous effacez, vous polissez avant d'avoir fini de penser. À l'oral, la pensée sort d'un bloc, quitte à être imparfaite, et c'est souvent là que les bonnes intuitions apparaissent. Combien de fois avez-vous trouvé la bonne formule en expliquant un problème à voix haute à un collègue, plutôt qu'en fixant un écran vide ?

Les métiers de l'expertise dictent depuis longtemps. Un médecin résume une consultation au dictaphone, un avocat enregistre ses observations entre deux audiences. Ce qui change avec Claude, c'est que la dictée ne produit plus seulement du texte à relire : elle déclenche une réflexion, puis une action. Vous ne récupérez pas une transcription brute, vous obtenez une note structurée, une liste de points à trancher ou un brouillon d'email prêt à partir. La différence est du même ordre qu'entre un magnétophone et un collègue qui prend des notes, réfléchit, et vous répond.

C'est exactement l'usage que vise Anthropic avec Opus et Sonnet dans le vocal : préparer une prise de parole importante, arbitrer entre deux offres, tester une hypothèse, réfléchir tout haut à une feuille de route. Claude pose des questions de relance et construit sur votre raisonnement au lieu de vous servir une réponse toute faite. Voyez-le comme un tableau blanc qui vous répond. Vous pensez devant lui, il structure au fur et à mesure.

Vos équipes ne manquent pas d'outils, elles manquent de temps

Pourquoi la voix arrive-t-elle au bon moment ? Parce que la journée de travail sature. L'indice Work Trend Index 2025 de Microsoft, construit sur une enquête auprès de 31 000 salariés dans 31 pays, décrit une « journée de travail infinie » : un collaborateur est interrompu toutes les deux minutes en moyenne pendant ses heures de concentration, soit 275 fois par jour, entre réunions, emails et messages instantanés, selon Microsoft.

Le déséquilibre est frappant. La communication, réunions, emails et messagerie confondus, occupe environ 57 % du temps, contre 43 % consacrés à produire réellement des documents, des analyses ou des présentations. Un salarié reçoit en moyenne 117 emails et 153 messages Teams par jour. Sans surprise, près d'un salarié sur deux juge son travail « chaotique et fragmenté ». Ces heures grignotées n'apparaissent sur aucune fiche de poste, mais elles pèsent lourd sur la facture.

Une interruption coûte bien plus que sa durée. Les travaux de Gloria Mark, chercheuse à l'université de Californie à Irvine, ont montré qu'il faut en moyenne 23 minutes pour retrouver sa pleine concentration après avoir été dérangé, rapporte Fast Company. Multipliez par 275 interruptions quotidiennes et le compte est vite fait : les journées se remplissent sans que le travail de fond avance. Le problème n'est pas le manque d'outils, c'est la fragmentation de l'attention.

La voix se glisse précisément dans ces interstices. Les cinq minutes entre deux réunions, le trajet en taxi vers un rendez-vous, la file d'attente à l'aéroport : autant de moments où sortir son ordinateur n'a pas de sens, mais où parler à Claude en a un. Vous dictez le brief d'une réunion, vous demandez une synthèse des trois derniers emails d'un client, vous cadrez une note pendant que le sujet est encore frais. Le temps mort devient du temps utile, sans ajouter une seule minute à la journée.

De la parole à l'action : la voix branchée sur vos outils

Parler vite ne servirait à rien si la conversation restait sans suite. La nouveauté tient là. Le mode vocal atteint désormais les outils que vous avez connectés, Gmail, Slack, votre agenda, et passe de la discussion à l'exécution. En retard ? Demandez à Claude de décaler votre prochain rendez-vous de trente minutes dans votre agenda. Vous sortez d'un appel ? Transformez la conversation en note d'une page. Chaque action reste sous votre contrôle : Claude demande la permission avant d'utiliser un outil connecté, précise Anthropic.

Cette bascule de la parole à l'action prolonge ce que fait déjà Claude Cowork avec vos fichiers et vos applications. Et les données d'Anthropic montrent où se situe la valeur. Sur un échantillon de 1,2 million de sessions Cowork, la première catégorie d'usage n'est pas le code, mais la gestion et les opérations, à 33,4 %, suivie de la création de contenu à 16,4 %. Le développement logiciel ne pèse que 8,7 %, d'après Anthropic. La voix devient une porte d'entrée de plus vers ce « travail autour du travail », celui qui absorbe l'essentiel des journées sans figurer dans les fiches de poste.

Les exemples parlent d'eux-mêmes selon les métiers. Dans le conseil, un associé répète son pitch à voix haute et demande à Claude de repérer les trous dans son raisonnement, puis d'en tirer une note d'une page. Dans les directions financières, un DAF dicte les points saillants d'un comité et récupère un brouillon d'email de suivi, prêt à relire. Le connecteur Microsoft 365 pousse la logique plus loin encore, puisque Claude peut y rédiger un email ou mettre à jour un fichier SharePoint dans la stricte limite des droits de chacun, comme nous l'expliquons à propos des outils d'écriture Microsoft 365.

La voix prend tout son sens quand elle se combine à l'arrière-plan de Cowork. Dans une société de gestion, un gérant dicte en marchant les points d'un comité d'investissement, et Claude prépare la note pendant qu'il enchaîne sur le rendez-vous suivant. Le livrable l'attend, relu et corrigé, à son retour au bureau. L'IA cesse d'être une application que vous ouvrez pour devenir une capacité disponible en continu, sur le canal que vous avez sous la main au moment où l'idée arrive.

La voix en secteur réglementé : la confidentialité d'abord

Dicter une note de synthèse sur un dossier client, c'est aussi énoncer à voix haute des informations parfois sensibles. Dans les secteurs que nous accompagnons, cette évidence pose une question directe : où part la voix, et qui peut la réécouter ? L'adoption avance vite, ce qui rend le sujet pressant. En Allemagne, 23 % des entreprises de plus de vingt salariés utilisaient déjà l'IA conversationnelle pour communiquer, et 41 % de plus prévoyaient de s'y mettre d'ici fin 2026, selon un recensement de statistiques sur la voix. Laisser les équipes s'en emparer hors de tout cadre serait une faute.

Le règlement européen sur l'IA, l'AI Act, impose déjà transparence et supervision humaine pour de nombreux usages, et le RGPD traite un enregistrement vocal porteur de données personnelles comme une donnée à protéger. Un dictaphone connecté qui exécute des actions ne s'improvise pas dans un cabinet d'avocats ou une compagnie d'assurance. Bonne nouvelle : le modèle de permission de Claude joue dans le bon sens. Rien ne part sans votre validation, chaque outil connecté réclame une autorisation, et un collaborateur ne peut jamais toucher, via Claude, un fichier auquel il n'a pas droit. Nous détaillons ces garde-fous dans notre article sur la sécurisation des connecteurs.

Reste la question du lieu. Où sont traités ces échanges vocaux ? Anthropic opère l'inférence et se présente comme sous-traitant au sens du RGPD, et propose pour ses offres entreprise des options de résidence des données via des zones dédiées, notamment sur Microsoft Foundry (Azure). Ce point mérite d'être vérifié dossier par dossier, car une donnée de santé ou un secret d'affaires n'obéit pas aux mêmes règles qu'un compte rendu anodin. La voix ne change pas la nature de l'information, elle en accélère seulement la circulation.

Pour une direction juridique, la marche à suivre tient en peu de mots : définir quels sujets peuvent passer par la voix, quels outils sont connectés, et qui garde la main sur les validations. Ce cadrage ne bride pas l'usage, il le rend défendable devant un régulateur ou un client. Poser ces règles avant le déploiement coûte toujours moins cher que de les reconstruire dans l'urgence après le premier incident.

Par où commencer

Le mode vocal ne remplace ni le clavier ni les réunions. Il ajoute une interface là où vous n'aviez que du temps perdu : entre deux portes, en déplacement, quand l'idée arrive avant l'ordinateur. Les modèles Opus et Sonnet rendent la conversation assez solide pour un vrai sujet de travail, et le français est enfin de la partie. Reste à décider quoi confier à cette voix, et à poser les bonnes limites.

C'est le métier de ClaudIn. Nous aidons les cabinets et les directions métier à choisir les cas d'usage, à cadrer l'accès aux données et à former les équipes pour que Claude Cowork et ses nouvelles interfaces servent dès la première semaine, notamment à travers nos formations dédiées. Envie de voir ce que la voix donnerait sur vos propres flux ? Réservez une démo et nous partirons de vos cas concrets.