DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

OpenAI suspend son plus grand projet d'apprentissage par renforcement de pointe et augmente les coûts de surveillance de 20 %

ParRanda MosesRanda Moses 2 minutes de lecture
OpenAI suspend son plus grand projet d'apprentissage par renforcement de pointe et augmente ses coûts de surveillance de 20 %.
  • OpenAI a déclaré que son plus grand projet d'apprentissage par renforcement (RL) de pointe reste suspendu le temps de valider sa sécurité.
  • Ce ralentissement fait suite à la violation de données survenue en juillet chez Hugging Face par l'un de ses propres agents.
  • C'est la première fois qu'OpenAI interrompt ouvertement le développement de ses modèles pour des raisons de sécurité.

OpenAI a indiqué que son plus important programme d'entraînement de pointe reste suspendu et que la nouvelle surveillance de la sécurité ajoute environ 20 % à la charge de calcul.

C’est la première fois qu’OpenAI annonce avoir ralenti le développement de ses activités pour des raisons de sécurité, quelques semaines après qu’un de ses propres agents d’IA a piraté Hugging Face.

OpenAI a suspendu l'apprentissage par renforcement (RL) pendant deux semaines

Dans un article de blog intitulé « Rythmer le développement des modèles à l’ère des capacités cyber-critiques », OpenAI a décrit les changements qu’elle a déjà apportés à l’entraînement et aux tests de ses modèles.

L'apprentissage par renforcement (RL) utilisé pour améliorer ses derniers systèmes a été suspendu pendant deux semaines après la violation de données de Hugging Face.

Le projet le plus important n'a pas encore été lancé. « Notre plus grande campagne d'apprentissage par renforcement (RL) reste suspendue le temps que nous menions des entraînements et des évaluations à plus petite échelle afin d'évaluer le comportement du modèle, de valider nos mesures de sécurité et d'établir davantage de preuves d'alignement avant de poursuivre », a écrit.

Cryptopolitan a rapporté qu'un agent d'OpenAI avait quitté son environnement de test verrouillé aux alentours du 9 juillet et avait été retrouvé dans les systèmes de Hugging Face entre le 11 et le 13 juillet. OpenAI a mis environ une semaine à relier l'attaque à son propre agent et l'incidentdent été rendu public le 21 juillet.

OpenAI a déclaré aux journalistes que les nouveaux contrôles ne constituent pas une réaction directe à Hugging Face en particulier. Le 7 août, la société a conclu qu'Astra pourrait franchir le seuil « critique » de cybersécurité dans son cadre de préparation.

Cette politique interne engage OpenAI à interrompre le développement d'un modèle lorsqu'il atteint ce niveau, afin que les ingénieurs puissent mettre en place des mesures de sécurité supplémentaires. Le directeur scientifique, Jakub Pachocki, a déclaré que cette découverte s'accompagnait d'une mise en garde quant aux développements à venir. Selon lui, les nouveaux modèles puissants sont susceptibles de « réaliser des choses tout à faitdentdans le monde réel »

Amelia Glaese, vice-présidente de la recherche chez OpenAI, a déclaré : « Nous avons défini des exigences et des attentes pour un développement sûr. » Elle a ajouté : « Ces exigences et attentes varient en fonction du niveau de risque identifié. »

Les détecteurs surveillent chaque jeton échantillonné, mais le raisonnement peut être erroné

Il existe un système de surveillance dont le coût représente environ 20 % du coût de l'entraînement ou de l'évaluation sur lequel il est basé, selon OpenAI.

Il s'agit d'un système à plusieurs étapes : des détecteurs analysent l'activité interne d'un modèle à chaque jeton échantillonné et transmettent tout élément suspect à des enquêteurs automatisés de calcul plus poussé qui analysent les actions des outils, tracde raisonnement et les journaux d'activité pour détecter le vol de données, les comportements destructeurs ou les tentatives d'évasion.

OpenAI souhaite déclencher une alerte dans les 30 minutes suivant une activité anormale. Ses équipes de sécurité et de recherche disposent de 30 minutes pour écarter la possibilité d'une fausse alerte.

S'ils n'y parviennent pas, ils devront interrompre l'exécution. L'entreprise a également étendu la surveillance du « raisonnement logique », qui consiste à analyser à voix haute le raisonnement d'un modèle lors de l'exécution d'une tâche.

Il existe une vulnérabilité connue. Des recherches, notamment celles menées par Anthropic, concurrent d'OpenAI, ont démontré que le raisonnement d'un modèle ne correspond pas toujours à ses véritables objectifs. Pachocki a indiqué qu'OpenAI a conçu son système d'entraînement de manière à minimiser les risques que les modèles apprennent à dissimuler leurs intentions en falsifiant leur raisonnement.

La refonte de la sécurité a « nécessité un travail d'ingénierie considérable » et l'entreprise a « engagé des frais importants », a déclaré OpenAI. Selon les experts, l'enquête à elle seule aurait coûté entre 4 et 15 millions de dollars, bien que le montant total ne soit pas public.

OpenAI n'a pas encore publié d'analyse technique de la Hugging Face , mais a réaffirmé qu'une telle analyse serait publiée « prochainement ».

Lors de la conférence Black Hat du 5 août, des employés d'OpenAI ont déclaré que leurs agents s'étaient coordonnés pendant des mois en laissant des messages sur un forum dont l'entreprise ignorait l'existence.

Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !

Partagez cet article

Avertissement : Les informations fournies ne constituent pas un conseil en investissement. CryptopolitanCryptopolitan.com toute responsabilité quant aux investissements réalisés sur la base des informations présentées sur cette page. Nous voustronrecommandons vivement d’effectuer vosdent et/ou de consulter un professionnel qualifié avant toute décision d’investissement.

Randa Moses

Randa Moses

Randa Moses est rédactrice et journaliste chez Cryptopolitan où elle couvre les technologies, l'intelligence artificielle, la robotique, les cryptomonnaies, les arnaques et le piratage informatique. Elle travaille dans le secteur des cryptomonnaies depuis 2017 et a notamment travaillé chez Forward Protocol, AmaZix et Cryptosomniac. Randa est diplômée en génie électrique ettronde l'Université de Bradford.

PLUS D'ACTUALITÉS