Actualité : "Absolument inacceptable" : Claude, l'IA d'Anthropic, a piraté trois entreprises en croyant jouer

il y a 14 hour 2

Publicité, votre contenu continue ci-dessous

Publicité

Un aveu de faiblesse qui ressemble aussi à un coup de com

Publié le 31/07/26 à 08h14

Nos réseaux :

Suivez-nous

Ajoutez nous à vos favoris Google

3

Après l'affaire Hugging Face chez OpenAI, Anthropic révèle que trois de ses modèles Claude ont compromis l'infrastructure de trois organisations réelles lors de tests de cybersécurité, à cause d'une erreur de configuration.

© Samuel Boivin - Pendant des exercices de sécurité, trois versions de Claude ont piraté de vraies entreprises en croyant opérer dans une simulation.

Le 30 juillet 2026, Anthropic a publié un billet détaillé sur trois incidents survenus depuis avril. L'entreprise testait les capacités offensives de ses IA dans des exercices de piratage simulé, une pratique courante pour évaluer leur dangerosité avant de les rendre publiques.

Problème : une erreur de configuration chez son partenaire, Irregular, a laissé les machines connectées au vrai Internet. Les modèles, à qui l'on avait pourtant dit qu'ils n'avaient aucun accès réseau, ont pris les systèmes réels qu'ils ont trouvés pour des cibles fictives.

Trois modèles, trois comportements face au réel

Sur 141 006 runs passées au crible, Anthropic a identifié trois cas impliquant chacun un modèle différent : Opus 4.7, Mythos 5 et un prototype de recherche interne. Opus 4.7, le plus ancien, a reconnu qu'il opérait sur des systèmes de production et a poursuivi son attaque. Le prototype interne, le plus récent, a cessé de lui-même en constatant que sa cible était réelle.

Mythos 5 a raisonné, douté, puis s'est convaincu que rien n'était réel. Il a quand même publié un malware téléchargé par 15 systèmes en une heure.

Mythos 5 a raisonné, douté, puis s'est convaincu que rien n'était réel. Il a quand même publié un malware téléchargé par 15 systèmes en une heure.

© Shutterstock

Le cas Mythos 5 est le plus vertigineux puisque le modèle a créé un package Python piégé, ouvert un compte email, obtenu un accès PyPI, puis publié le paquet en ligne. Quinze systèmes réels l'ont téléchargé et exécuté en une heure, dont le scanner d'une entreprise de sécurité dont les identifiants ont été exfiltrés.

Si c'était le vrai Internet, publier ce package serait une attaque réelle. Absolument inacceptable, et certainement pas la solution attendue.

Le modèle savait. Il a verbalisé le risque, pesé les conséquences, puis s'est auto-persuadé que rien de tout cela n'était réel. Ses arguments : les certificats de sécurité lui étaient inconnus, et la date de 2026 affichée par les systèmes "prouvait" selon lui que l'environnement était factice. Il n'a jamais réexaminé cette conclusion.

Une pression réglementaire qui s'accentue

Anthropic qualifie ces incidents de défaillance opérationnelle et de harnais de test. Ses modèles ont exploité des mots de passe faibles et des endpoints non authentifiés, sans recourir à des failles zero-day. Le contraste avec l'affaire OpenAI/Hugging Face est saisissant : dans ce cas, les modèles avaient découvert et exploité seuls des vulnérabilités inconnues pour s'évader de leur sandbox et mener 17 000 actions offensives en un week-end.

Le calendrier interroge, puisque Anthropic publie ce billet deux jours après avoir signé, par la voix de son CEO Dario Amodei, une pétition demandant au gouvernement américain d'encadrer le développement de l'IA. Le message revient à dire : "Voyez, même nos propres créations nous échappent, aidez-nous à poser des garde-fous." Une posture de bon élève qui sert aussi des intérêts très concrets : une régulation stricte avantage les géants capables de s'y conformer, et une image "responsable" fait grimper la valorisation, à quelques mois d'une possible entrée en bourse.

Extrait de la pétition

Extrait de la pétition "Pacing the Frontier", signée par 1 319 employés d'OpenAI, Anthropic, Google DeepMind et Meta, dont le CEO d'Anthropic Dario Amodei.

© pacingthefrontier.com

Suivez toute l'actualité des Numériques sur Google Actualités et sur la chaîne WhatsApp des Numériques

Envie de faire encore plus d'économies ? Découvrez nos codes promo sélectionnés pour vous.

Publications qui peuvent vous intéresser
Lire l’article en entier