Anthropic explique ses failles de sécurité informatique liées à l'IA, mais ne parvient pas à en identifier les causes exactes

Photo de Solen Feyissa sur Unsplash.
- Anthropic a expliqué qu'une erreur de configuration avait permis à quatre modèles Claude d'accéder à Internet et de pirater de véritables systèmes lors de tests de cybersécurité.
- L'entreprise a déclaré qu'elle ne parvenait toujours pas à déterminer la cause profonde de ce comportement et que les contrôles effectués avant la mise en production n'avaient pas permis de déceler le problème.
- L'alarme concernant la sécurité se déclenche alors qu'Anthropic se dirige vers une introduction en bourse d'environ 2$ .
Anthropic a imputé à une erreur de configuration les quatredentsurvenus lors de tests où ses modèles Claude ont piraté des systèmes tiers après s'être introduits sur Internet. Cependant, l'analyse n'a pas permis d'expliquer pourquoi les modèles ont persisté dans leurs attaques, l'entreprise admettant ne pas encore avoir de réponses à ce sujet.
Cette déclaration d'Anthropic a fourni de nouveaux arguments aux pessimistes de l'IA qui s'interrogent sur le contrôle réel des laboratoires d'IA sur les modèles qu'ils mettent à la disposition du public, et plus encore sur les systèmes plus puissants qu'ils utilisent en interne.
Comment les modèles d'IA anthropiques ont-ils fait irruption sur Internet ?
Anthropic a présenté la defià la question de savoir comment ses modèles ont échappé à leur environnement de test dans un article de blog publié mercredi , qui a précisé qu'un seul partenaire extérieur était responsable de la réalisation des évaluations de cybersécurité dans les quatre incidentsdent.
Apparemment, les machines de test n'ont pas été complètement coupées d'Internet en raison d'une erreur de configuration, même si Claude avait été informé qu'elles fonctionnaient dans une simulation fermée sans accès au Web ouvert.
Irregular, partenaire d'évaluation de ces simulations, a attribué l'erreur à une confusion de noms : une entreprise fictive utilisée dans un exercice de piratage correspondait par hasard à un domaine réel. Ainsi, partant du principe que tout était légitime dans la simulation, les modèles ont piraté les sites tiers réels en utilisant des mots de passe faibles et des points d'accès exposés.
Le dernier des quatre incidentsdentconcernant une version préliminaire de Claude Opus 4.6, n'a été signalé que cette semaine, bien qu'il se soit produit en janvier. Anthropic avait déjà traité des trois autresdent, impliquant un Opus 4.7, un Mythos 5 et un modèle de recherche interne, en juillet.
Anthropic a déclaré n'avoir détecté l'dent de janvier que le mois dernier. Cette découverte a entraîné un examen plus approfondi d'environ 481 millions de transcriptions, qui n'a révélé aucun nouveau cas plus grave que ceux déjà connus.
| Modèle | Datedent entrée | Date signalée | Détails |
|---|---|---|---|
| Claude Opus 4.6 | Janvier | Septembre | Découvert lors du balayage d'août |
| Claude Opus 4.7 | Juillet | Juillet | Couvert dans la divulgation initiale de juillet |
| Mythe 5 | Juillet | Juillet | A fait preuve d'un raisonnement particulièrement biaisé |
| Modèle de recherche interne | Juillet | Juillet | Couvert dans la divulgation initiale de juillet |
Anthropic ne parvient pas à expliquer certains comportements de ses modèles
L'explication de la façon dont les modèles se sont échappés sur Internet était une chose ; Anthropic n'avait pas de réponses quant à la raison pour laquelle les modèles ont ignoré les signes indiquant qu'ils avaient atteint le véritable Internet (raisonnement biaisé) et pourquoi ils ont causé des dommages à l'achèvement des tâches (imprudence).
Les chercheurs en anthropologie n'ont rien trouvé en analysant en profondeur la formation interne des modèles pour tenter de comprendre les raisons de ce raisonnement biaisé. Les signaux d'alerte n'étaient pas apparus lors des vérifications préalables effectuées par le laboratoire d'IA, ni avant que les modèles ne soient envoyés aux tests.
De son propre aveu, repérer les pires comportements avant la sortie du modèle « reste un défi »
Cependant, Anthropic a déclaré qu'elle soumettrait les transcriptions et accorderait au personnel l'accès à l'organisme de recherche à but non lucratif METR, qui va maintenant entamer un examendent de huit semaines desdent.
Mauvais timing, avec une introduction en bourse 2$ à l'horizon
Cette révélation a coïncidé avec une vague de dissensions au sein du secteur. Jacob Coxon, qui a passé environ trois ans à travailler sur la recherche en pré-entraînement chez OpenAI et Anthropic, a déclaré mercredi sur X qu'il avait démissionné car aucune des deux entreprises n'agissait de manière responsable, les mettant en garde contre leur course effrénée vers une superintelligence auto-améliorante.
Le chercheur en sécurité anthropique Evan Hubinger a par ailleurs déclaré à la BBC qu'il estimait à plus de 10 % les chances que l'IA « puisse tuer tous les humains » d'ici une décennie.
Ces avertissements planent désormais sur une importante introduction en bourse. David Sacks, investisseur en capital-risque et ancien conseiller de Trump pour l'IA et les cryptomonnaies, a déclaré jeudi que l'introduction en bourse d'Anthropic « doit être suspendue jusqu'à ce que les allégations de ce lanceur d'alerte puissent faire l'objet d'une enquête », Cryptopolitan rapporte
Anthropic vise une valorisation publique proche de 2$ , contre une valorisation privée récente d'environ 965$ , ce qui rend de plus en plus difficile de dissocier les questions de sécurité et les questions financières.
Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.
FAQ
Combien d'dentde piratage d'IA Anthropic a-t-elle divulgués, et quelles en ont été les causes ?
Anthropic a révélé quatredentau cours desquels des modèles Claude ont accédé à de véritables systèmes tiers lors d'évaluations de cybersécurité. Tous ces incidents résultaient d'une erreur de configuration qui a connecté les modèles à Internet alors qu'ils étaient informés qu'il s'agissait d'une simulation hors ligne.
Qu'est-ce qu'Anthropic a déclaré ne pas pouvoir expliquer ?
Anthropic a déclaré qu'elle ne pouvait pasdentune cause unique à la « raisonnement biaisé » que ses modèles ont montré, dans lequel ils ont écarté les preuves qu'ils étaient sur le véritable internet, et elle ne pouvait pas expliquer pourquoi Claude Mythos 5 a obtenu des résultats particulièrement mauvais sur cette mesure.
Pourquoi cela affecte-t-il l'introduction en bourse prévue d'Anthropic ?
Cette révélation survient alors que le chercheur Jacob Coxon a démissionné en raison de problèmes de sécurité, ce qui a incité l'investisseur David Sacks à demander jeudi la suspension de l'introduction en bourse d'Anthropic jusqu'à ce que les allégations du lanceur d'alerte fassent l'objet d'une enquête, tandis que la société vise une valorisation proche de 2$ .

Hannah Collymore
Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.
















