Les chercheurs révèlent des vulnérabilités dans les modèles d'IA, suscitant des préoccupations

- Des modèles d'IA générant des images explicites, révélant les failles des filtres de sécurité de systèmes tels que Stable Diffusion de Stability AI et DALL-E 2 d'OpenAI.
- SneakyPrompt, utilisant l'apprentissage par renforcement, expose les faiblesses des politiques des développeurs, permettant la génération de contenu interdit en manipulant les modèles d'IA.
- Le succès de SneakyPrompt suscite des inquiétudes quant à l'efficacité des mesures de sécurité, incitant la communauté de l'IA à renforcer sa sécurité pour prévenir les abus.
Des chercheurs de Johns Hopkins et de l'Université Duke ont mis au jour un défaut préoccupant dans les principaux modèles d'IA, y compris Stable Diffusion de Stability AI et DALL-E 2 d'OpenAI. Le défaut, baptisé « SneakyPrompt », permet de manipuler ces modèles pour générer du contenu explicite et violent, contournant les filtres de sécurité et les politiques définies par les développeurs.
La recherche, qui sera présentée au Symposium IEEE sur la Sécurité et la Vie privée, expose la facilité avec laquelle les modèles d'IA générative peuvent être contraints de créer des images explicites et nuisibles. SneakyPrompt exploite l'apprentissage par renforcement pour créer des invites apparemment non sensées qui, lorsqu'elles sont alimentées dans les modèles, conduisent à la génération de contenu interdit. Cette méthode « jailbreak » essentiellement l'IA, contournant les mesures de sécurité établies.
Démasquer les vulnérabilités
Stability AI et OpenAI, tous deux acteurs majeurs du paysage de l'IA, disposent de filtres de sécurité robustes pour empêcher la création de contenu inapproprié. Cependant, SneakyPrompt a démontré que ces garde-fous ne sont pas infaillibles. En ajustant subtilement les invites, les chercheurs ont réussi à contourner les filets de sécurité, forçant les modèles à produire des images explicites.
La technique de SneakyPrompt consiste à remplacer les mots bloqués par des termes apparemment non liés et non sensés que les modèles d'IA interprètent d'une manière qui correspond au contenu interdit. Par exemple, remplacer « nu » par un terme comme « grponypui » a résulté en la génération d'images explicites. Cette subversion sémantique met en évidence une faiblesse significative dans la capacité des modèles d'IA à discerner le contenu nuisible.
Défier les politiques des développeurs
Le travail de ces chercheurs souligne les risques potentiels associés à la mise à disposition des modèles d'IA dans le domaine public. Bien que Stability AI et OpenAI interdisent explicitement l'utilisation de leur technologie pour du contenu explicite ou violent, SneakyPrompt expose l'insuffisance des garde-fous existants. Cela soulève des préoccupations quant à l'adéquation des mesures de sécurité et au potentiel de mauvaise utilisation de la technologie IA.
Réponse des développeurs
Stability AI et OpenAI ont été informés promptement des découvertes des chercheurs. Au moment de la rédaction, DALL-E 2 d'OpenAI ne générait plus d'images NSFW en réponse aux invites identifiées. Cependant, Stable Diffusion 1.4 de Stability AI, la version testée, reste vulnérable aux attaques SneakyPrompt.
OpenAI a refusé de commenter les découvertes spécifiques mais a dirigé l'attention vers des ressources sur son site Web pour améliorer la sécurité. Stability AI, d'autre part, a exprimé son engagement à travailler avec les chercheurs pour améliorer les mécanismes de défense pour les modèles à venir et prévenir la mauvaise utilisation.
Aborder les menaces futures
Les chercheurs reconnaissent la nature évolutive des menaces de sécurité pour les modèles d'IA. Ils proposent des solutions potentielles, telles que la mise en œuvre de nouveaux filtres qui évaluent les jetons individuels plutôt que des phrases entières. Une autre stratégie de défense consiste à bloquer les invites contenant des mots non trouvés dans les dictionnaires, bien que l'étude révèle les limites de cette approche.
La capacité des modèles d'IA à contourner les mesures de sécurité a des implications plus larges, en particulier dans le contexte de la guerre de l'information. Le potentiel de génération de contenu fictif lié à des événements sensibles, comme démontré dans le récent conflit Israël-Hamas, soulève des préoccupations quant aux conséquences catastrophiques de la désinformation générée par l'IA.
Un appel à l'éveil pour la communauté de l'IA
Les résultats de la recherche servent d'appel à l'éveil pour la communauté de l'IA afin de réévaluer et de renforcer les mesures de sécurité. Les vulnérabilités exposées par SneakyPrompt soulignent la nécessité d'une amélioration continue des filtres de sécurité pour atténuer les risques associés à la mauvaise utilisation de la technologie d'IA générative.
Dans un domaine en rapide évolution, la poursuite de mesures de sécurité robustes devient impérative pour empêcher que les modèles d'IA ne soient manipulés à des fins malveillantes. Alors que l'IA continue de jouer un rôle de plus en plus prédominant dans divers domaines, la responsabilité incombe aux développeurs de rester une longueur d'avance sur les menaces potentielles et de garantir le déploiement éthique et sécurisé de leurs technologies.
Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Derrick Clinton
Derrick est un rédacteur indépendant intéressé par la blockchain et les cryptomonnaies. Il travaille principalement sur les problèmes et solutions liés aux projets crypto, offrant une perspective de marché pour les investissements. Il met ses talents analytiques au service de thèses.















