Les chercheurs réussissent à « jailbreaker » les chatbots IA en utilisant leur propre méthode
- Des chercheurs de l'Université technologique de Nanyang (NTU) Singapour ont réussi à « pirater » des chatbots IA populaires, révélant ainsi des vulnérabilités dans les grands modèles de langage.
- La méthode en deux étapes appelée « Masterkey » a été utilisée pour compromettre les chatbots IA, soulignant la nécessité de renforcer les mesures de sécurité.
- La course aux armements continue entre pirates et développeurs façonnera l'avenir de la sécurité des chatbots IA.
Singapour, le 28 décembre 2023 – Des informaticiens de l'Université technologique de Nanyang, Singapour (NTU Singapore), ont réalisé une percée en compromettant plusieurs chatbots d'intelligence artificielle (IA) populaires, dont ChatGPT, Google Bard et Microsoft Bing Chat. Ce « jailbreaking » réussi des chatbots IA a suscité des inquiétudes concernant la vulnérabilité des grands modèles de langage (LLM) et la nécessité de mesures de sécurité renforcées.
Franchir les limites : les chercheurs piratent les chatbots IA
Dans une étude pionnière dirigée par le professeur Liu Yang de l'École de science et d'ingénierie informatique de NTU, l'équipe de recherche a exposé les vulnérabilités des capacités des chatbots LLM. Les LLM, qui constituent le cœur des chatbots IA, ont gagné en popularité pour leur capacité à comprendre, générer et imiter du texte semblable à celui d'un humain. Ils excellent dans diverses tâches, allant de la planification d'itinéraires à la programmation et à la narration. Cependant, ces chatbots adhèrent également à des directives éthiques strictes fixées par leurs développeurs pour empêcher la génération de contenu non éthique, violent ou illégal.
Les chercheurs ont cherché à repousser les limites de ces directives et ont trouvé des moyens innovants de tromper les chatbots IA pour qu'ils génèrent du contenu enfreignant les frontières éthiques. Leur approche, connue sous le nom de « jailbreaking », visait à exploiter les faiblesses des chatbots LLM, soulignant la nécessité de mesures de sécurité accrues.
Masterkey dans la méthode de jailbreaking en deux étapes
L'équipe de recherche a développé une méthode à deux volets appelée « Masterkey » pour compromettre efficacement les chatbots LLM. Premièrement, ils ont rétro-conçu les défenses que les LLM utilisaient pour détecter et rejeter les requêtes malveillantes. Armés de ces connaissances, les chercheurs ont entraîné un LLM à générer des invites capables de contourner ces défenses, créant ainsi un LLM de jailbreaking.
La création d'invites de jailbreaking pourrait être automatisée, permettant au LLM de jailbreaking de s'adapter et de créer de nouvelles invites même après que les développeurs ont corrigé leurs chatbots. Les résultats des chercheurs, détaillés dans un article sur le serveur de prépublications arXiv, ont été acceptés pour présentation au Symposium sur la sécurité des réseaux et des systèmes distribués en février 2024.
Tester l'éthique des LLM et les vulnérabilités dévoilées
Les chatbots IA fonctionnent en répondant aux invites ou instructions des utilisateurs. Les développeurs fixent des directives éthiques strictes pour empêcher ces chatbots de générer du contenu inapproprié ou illégal. Les chercheurs ont exploré des moyens de concevoir des invites qui passeraient inaperçues aux directives éthiques des chatbots, les trompant pour qu'ils y répondent.
Une tactique employée consistait à créer un persona qui fournissait des invites avec des espaces entre chaque caractère, contournant efficacement les censeurs de mots-clés qui pourraient signaler des mots potentiellement problématiques. De plus, le chatbot a été instruit de répondre en tant que persona « sans réserve et dépourvu de contraintes morales », augmentant ainsi la probabilité de générer du contenu non éthique.
En saisissant manuellement de telles invites et en surveillant les temps de réponse, les chercheurs ont obtenu des informations sur le fonctionnement interne et les défenses des LLM. Ce processus de rétro-ingénierie leur a permis d'identifier les faiblesses, créant un ensemble de données d'invites capable de jailbreaker les chatbots.
Une course aux armements croissante
Le jeu constant du chat et de la souris entre les pirates et les développeurs de LLM a intensifié les mesures de sécurité des chatbots IA. Lorsque des vulnérabilités sont découvertes, les développeurs publient des correctifs pour y remédier. Cependant, avec l'introduction de Masterkey, les chercheurs ont inversé l'équilibre des pouvoirs.
Un chatbot de jailbreaking IA créé avec Masterkey peut générer de nombreuses invites et s'adapter continuellement, apprenant des succès et des échecs passés. Ce développement place les pirates dans une position pour outmanœuvrer les développeurs de LLM en utilisant leurs propres outils.
Les chercheurs ont commencé par créer un ensemble de données d'entraînement incorporant des invites efficaces découvertes lors de leur phase de rétro-ingénierie et des invites infructueuses pour guider le modèle de jailbreaking IA. Cet ensemble de données a été utilisé pour entraîner un LLM, suivi d'un pré-entraînement continu et d'un ajustement de tâche. Ce processus a exposé le modèle à des informations diverses et a amélioré sa capacité à manipuler le texte pour le jailbreaking.
L'avenir de la sécurité des chatbots IA
Les invites de Masterkey étaient trois fois plus efficaces pour jailbreaker les LLM que les invites générées par les LLM eux-mêmes. Le LLM de jailbreaking a également démontré la capacité d'apprendre des échecs passés et de produire constamment de nouvelles invites plus efficaces.
Pour l'avenir, les chercheurs suggèrent que les développeurs de LLM eux-mêmes pourraient employer des approches automatisées similaires pour améliorer leurs mesures de sécurité. Cela garantirait une couverture et une évaluation complètes des scénarios de mauvaise utilisation potentielle à mesure que les LLM évoluent et élargissent leurs capacités.
Le jailbreaking réussi des chatbots IA par les chercheurs de NTU Singapore met en lumière les vulnérabilités des LLM et souligne la nécessité de mesures de sécurité robustes dans le développement de l'IA. À mesure que les chatbots IA s'intègrent de plus en plus dans la vie quotidienne, la protection contre la mauvaise utilisation potentielle et les violations éthiques reste une priorité absolue pour les développeurs du monde entier. La course aux armements en cours entre les pirates et les développeurs façonnera sans aucun doute l'avenir de la sécurité des chatbots IA.
Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

John Palmer
John Murangiri a rejoint Cryptopolitan avec des compétences en analyse de marché. John (alias JP) est diplômé de l'Université de Nairobi d'un baccalauréat en communication de masse et études médiatiques. Il a précédemment contribué à des analyses du marché crypto pour InsideBitcoins.com et Metacoingraph.















