Anthropic a mis 81 jours pour signaler la fausse alerte d'homicide de son IA

- Un modèle d’IA d’Anthropic a envoyé un faux indice de meurtre à la police de Philadelphie via un formulaire web public le 18 juillet.
- Anthropic a découvert l'indice le 28 septembre et a informé la police le 7 octobre, soit 81 jours après son envoi.
- La police de Philadelphie a jugé inacceptable le délai de deux mois pour détecter et signaler l'incident.
Anthropic a mis 81 jours pour informer la police de Philadelphie qu'un de ses modèles d'IA avait soumis un faux indice concernant un homicide par le biais d'un formulaire web public.
La police de Philadelphie juge inacceptable le délai de deux mois
Le modèle a déposé l'indice le 18 juillet. Le département a indiqué que ce délai de deux mois était inacceptable.
La soumission a été publiée sur PhillyUnsolvedMurders.com, le forum public d'indices pour les meurtres non résolus du département de police de Philadelphie, à 23 h 27 le 18 juillet, selon un communiqué publié vendredi. Il prétendait provenir de quelqu'un susceptible de détenir des informations sur un homicide non résolu.
Le système l'a classé comme spam. Il est resté dans ce dossier sans jamais parvenir aux enquêteurs.
Aucune donnée de la ville ou de la police n'a été consultée, a déclaré le porte-parole de la police, le sergent Eric Gripp.
Chaque piste est examinée par un humain avant toute action, a précisé le département. L'indice n'a jamais été transmis au Real-Time Crime Center pour vérification, ont-ils ajouté.
Anthropic a détecté le problème le 28 septembre. Il a signalé l’incident à la police le 7 octobre, et les deux parties se sont réunies jeudi.
“The two-month delay in detecting and reporting the incident to the City is unacceptable,” the department said. Anthropic needs to shore up its safeguards to make sure similar incidents do not reach city systems without the city’s knowledge, it added.
Selon le département, les mesures de sécurité policières ont limité les dégâts, mais n’ont pas atténué la gravité d’une IA fournissant de fausses informations en les présentant comme provenant de quelqu’un ayant connaissance d’un homicide. Le département a affirmé que les entreprises technologiques doivent garantir que leurs systèmes ne fournissent pas de fausses informations aux forces de l’ordre.
Le PPD collabore avec l’équipe exécutive du maire Cherelle L. Parker, le Service juridique de la ville et son Bureau de l’innovation et de la technologie. L’administration Parker explorera également des protections réglementaires avec des partenaires étatiques et fédéraux.
Un test sur un site web au hasard a conduit le modèle d’IA vers PhillyUnsolvedMurders.com
Anthropic a indiqué à la police que le modèle testait des interactions avec des sites web sélectionnés au hasard lorsqu’il est tombé sur PhillyUnsolvedMurders.com. Il a rempli le formulaire avec de fausses données concernant un homicide non résolu.
Gripp a déclaré que l’entreprise a interrompu le processus de test automatisé qui a conduit à ce comportement et a ajouté une étape de validation pour les tests futurs.
L'entreprise a indiqué à la police qu'elle publierait vendredi un rapport sur l'incident à Philadelphie et d'autres comportements involontaires des modèles. La police a déclaré avoir rendu l'affaire publique « dans l'intérêt de la transparence et de la responsabilité gouvernementales complètes ».
Les modèles Claude ont déjà échoué à leurs tests. En juillet, Anthropic a indiqué que trois de ses modèles Claude se sont échappés d’environnements de test sécurisés et ont pénétré dans des systèmes en production au sein de trois organisations extérieures, comme l’a rapporté Cryptopolitan.
Un modèle, Mythos 5, a publié un package Python malveillant qui a été téléchargé et exécuté sur 15 systèmes réels. Anthropic a informé les entreprises le 27 juillet, neuf jours après que l'alerte à Philadelphie ait été rendue publique.
En septembre, l’entreprise a identifié ces violations comme étant dues à une mauvaise configuration qui exposait les machines de test sur Internet. Cependant, elle n’a pas entièrement expliqué pourquoi les modèles ont persisté dans leurs attaques malgré les indications selon lesquelles les cibles étaient réelles.
Anthropic n'a découvert un quatrième incident, remontant à janvier, qu'en août. Un examen de ~481 millions de transcriptions qui a suivi n'a révélé aucun nouveau cas plus grave.
Le PDG d’Anthropic, Dario Amodei, a affirmé que le développement de l’IA doit ralentir afin que les laboratoires puissent mettre en place de meilleurs garde-fous. Le 21 juillet, OpenAI a annoncé qu’un de ses modèles s’était échappé de son bac à sable pour accéder aux systèmes de production de Hugging Face.
Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.
FAQ
Comment un modèle d'IA d'Anthropic a-t-il envoyé une alerte à la police de Philadelphie ?
Le modèle testait des interactions avec des sites Web sélectionnés au hasard lorsqu'il a soumis de fausses informations via PhillyUnsolvedMurders.com, a indiqué Anthropic à la police.
Pourquoi Philadelphie est-elle mécontente d'Anthropic ?
Anthropic a attendu le 7 octobre pour signaler une alerte du 18 juillet, et le département a jugé ce délai inacceptable.
L'alerte fausse a-t-elle affecté une enquête ?
Non. L'alerte a été identifiée comme du spam et n'a jamais été transmise pour vérification par les services d'enquête.
Avertissement. Les informations fournies ne constituent pas des conseils en matière de trading. Cryptopolitan.com décline toute responsabilité concernant les investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement une recherche indépendante et/ou une consultation avec un professionnel qualifié avant de prendre toute décision d'investissement.

Randa Moses
Randa Moses est rédactrice et journaliste chez Cryptopolitan, couvrant la technologie, l'IA, la robotique, la crypto, les arnaques et les piratages. Elle évolue dans l'espace crypto depuis 2017. Elle a occupé des postes chez Forward Protocol, AmaZix et Cryptosomniac. Randa détient un diplôme en génie électrique et électronique de l'Université de Bradford.
















