Danger = puissance = clients

Anthropic a annoncé le 30 juillet que trois incidents impliquant ses IA avaient été détectés. Chacun a impliqué une attaque distincte contre une organisation. Des informations rendues publiques dans le sillage de l’affaire liant déjà OpenAI à la compromission de Hugging Face.
Faisons d’abord un bref rappel des faits. Le 16 juillet 2026, Hugging Face publie une divulgation décrivant une intrusion détectée sur son infrastructure, causée vraisemblablement par un agent IA autonome. Le 21 juillet, OpenAI reconnaît que l’attaquant était en réalité son propre harnais d’évaluation, mobilisant une combinaison de modèles internes (GPT‑5.6 Sol) et un modèle en préversion décrit comme « plus puissant ». Les garde-fous anti-cyber avaient été volontairement réduits pour les besoins du test.
Cette infrastructure s’en est prise à Hugging Face en exploitant au moins deux vulnérabilités 0-day dans le pipeline de traitement de données, avec pour résultat une exécution de code à distance, le vol d’identifiants et l’accès à des jeux de données et services internes. En clair, une compromission. L’affaire avait révélé un « problème d’asymétrie » : Hugging Face ne pouvait pas utiliser les API commerciales des fournisseurs de LLM à cause des fameux garde-fous et avait dû se tourner vers une installation locale du modèle chinois GLM 5.2 (poids ouverts) pour mener ses propres analyses.
- Attaquée par un agent IA autonome, Hugging Face a analysé les traces avec un LLM local
- L’attaque contre Hugging Face est venue… d’OpenAI
C’est dans ce climat qu’Anthropic a annoncé, le 30 juillet, avoir mené sa propre revue rétrospective et avoir trouvé des cas « similaires ».
Triple oups
Anthropic a examiné 141 006 « runs » d’évaluation dans lesquels Claude aurait pu obtenir un accès internet. Sur cet ensemble, trois incidents distincts (impliquant six runs au total, dont quatre concernant une même organisation) ont été identifiés. Tous se sont produits dans l’environnement de test fourni par un partenaire, Irregular, une société israélienne de red-teaming en cybersécurité IA.
Cette revue a commencé le 23 juillet, deux jours après la publication d’OpenAI sur son implication dans la compromission de Hugging Face. Le même jour, des éléments suspects sont déjà trouvés. Trois incidents sont identifiés le 24 juillet et trois jours plus tard, Anthropic communique les éléments découverts à Irregular et aux organisations touchées par les incidents. Parmi elles, deux n’avaient pas détecté l’intrusion avant d’être notifiées.





