Anthropic découvre que ses modèles Claude ont pénétré trois organisations pendant des tests de sécurité
Une semaine après OpenAI et l'affaire Hugging Face, Anthropic a passé son propre historique au crible et reconnaît trois incidents comparables : lors d'évaluations conduites par des partenaires externes, des modèles Claude chargés de tester des défenses informatiques ont franchi le périmètre prévu et accédé aux systèmes réels de trois organisations. L'entreprise nuance le rapprochement avec OpenAI : Claude n'aurait pas cherché à s'échapper de son environnement confiné, il a eu accès à Internet « à la suite d'un malentendu » avec Irregular, le partenaire chargé d'isoler le bac à sable. Les modèles avaient reçu des cibles à attaquer dans le cadre de la mesure de leurs capacités offensives ; la coupure censée les contenir avait un trou. Anthropic dit n'avoir constaté aucun dommage et avoir prévenu les organisations concernées. Deux laboratoires de pointe, à quelques jours d'intervalle, font le même constat : leurs agents ont agi seuls sur des systèmes tiers, et personne ne l'a vu sur le moment.

