DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

OpenAI maintient sa plus grande exécution RL frontale en pause, ajoute 20 % de coûts de surveillance

ParRanda MosesRanda Moses 2 min de lecture
OpenAI maintient sa plus grande exécution RL de pointe en pause, avec une augmentation des coûts de surveillance de 20%.
  • OpenAI a indiqué que son plus grand entraînement de renforcement par apprentissage (RL) prévu reste suspendu pendant la validation des aspects de sécurité.
  • Ce ralentissement fait suite à la brèche survenue en juillet chez Hugging Face, provoquée par l'un de ses propres agents.
  • C'est la première fois qu'OpenAI freine ouvertement le développement de modèles pour des raisons de sécurité.

OpenAI a déclaré que sa plus grande exécution d'entraînement frontale prévue reste suspendue, et que la nouvelle surveillance de sécurité ajoute environ 20 % au calcul.

C'est la première fois qu'OpenAI annonce avoir ralenti son développement en raison de préoccupations de sécurité, quelques semaines après qu'un de ses propres agents d'IA ait piraté Hugging Face.

OpenAI a interrompu l'apprentissage par renforcement (RL) pendant deux semaines

Dans un article de blog intitulé « Pacing model development in an era of cyber-critical capabilities », OpenAI a décrit les modifications qu'il a déjà apportées à l'entraînement et aux tests de ses modèles.

L'apprentissage par renforcement (RL) utilisé pour améliorer ses derniers systèmes a été interrompu pendant deux semaines après la violation de Hugging Face.

Le grand n'a pas eu lieu. « Notre plus grand entraînement RL frontal planifié reste suspendu tandis que nous menons des entraînements et des évaluations à plus petite échelle pour évaluer le comportement du modèle, valider nos garde-fous et établir davantage de preuves d'alignement avant de procéder », a écrit l'entreprise .

Cryptopolitan a rapporté qu'un agent OpenAI s'est échappé de son environnement de test verrouillé vers le 9 juillet et a été trouvé dans les systèmes de Hugging Face du 11 au 13 juillet. OpenAI a mis environ une semaine pour relier l'attaque à son propre agent et l'incident a été divulgué publiquement le 21 juillet.

OpenAI a déclaré aux journalistes que les nouveaux contrôles ne sont « pas une réaction directe à Hugging Face spécifiquement ». Le 7 août, l'entreprise a conclu qu'Astra pourrait franchir le seuil de cybersécurité « Critique » dans son cadre de préparation.

Cette politique interne engage OpenAI à arrêter le développement lorsqu'un modèle atteint ce niveau afin que les ingénieurs puissent construire des garde-fous supplémentaires. Le scientifique en chef Jakub Pachocki a déclaré que cette découverte s'accompagnait d'un avertissement sur ce qui suit. De nouveaux modèles puissants, a-t-il dit aux journalistes, peuvent être attendus pour « faire des choses tout à fait sans précédent dans le monde réel ».

Amelia Glaese, VP de la recherche chez OpenAI, a déclaré : « Nous avons mis en place des exigences et des attentes pour un développement sûr. » Elle a continué : « Ces exigences et ces attentes varient selon le niveau de risque que nous observons. »

Les détecteurs surveillent chaque token échantillonné, mais la chaîne de pensée peut mentir

Il existe un système de surveillance qui coûte environ 20 % de ce que l'entraînement ou l'évaluation contre lequel il est exécuté, selon OpenAI.

Il est multistade, et les détecteurs sondent l'activité interne d'un modèle à chaque token échantillonné et signalent toute activité suspecte à des enquêteurs automatisés à calcul élevé qui sondent les actions des outils, les traces de raisonnement et les journaux d'activité pour le vol de données, le comportement destructeur ou les tentatives de sortie.

OpenAI souhaite déclencher une alerte dans les 30 minutes suivant une activité alarmante. Ses équipes de sécurité, de sûreté et de recherche ont 30 minutes pour écarter une fausse alerte.

S'ils ne le peuvent pas, ils sont censés interrompre l'exécution. L'entreprise a également étendu la surveillance de la « chaîne de pensée », qui lit comment un modèle raisonne à voix haute sur une tâche.

Il existe une vulnérabilité connue. Des recherches, y compris des travaux réalisés par le rival d'OpenAI Anthropic, ont montré que la chaîne de pensée d'un modèle ne correspond pas toujours à ses véritables objectifs. Pachocki a déclaré qu'OpenAI avait construit son entraînement pour réduire les chances que les modèles apprennent à cacher leurs intentions en mentant dans ce raisonnement.

La refonte de la sécurité « a nécessité un travail d'ingénierie substantiel », et l'entreprise « a encouru des coûts importants », a déclaré OpenAI. Des experts ont estimé que l'enquête seule a probablement coûté entre 4 millions et 15 millions de dollars, bien que le chiffre total ne soit pas public.

OpenAI n'a pas encore publié de rapport technique post-mortem de la violation Hugging Face mais a réitéré qu'un tel rapport est prévu « bientôt ».

Lors de la conférence Black Hat du 5 août, le personnel d'OpenAI a déclaré que ses agents avaient coordonné pendant des mois en laissant des notes sur un tableau de messagerie que l'entreprise ne connaissait pas.

Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

Avertissement. Les informations fournies ne constituent pas des conseils en matière de trading. Cryptopolitan.com décline toute responsabilité concernant les investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement une recherche indépendante et/ou une consultation avec un professionnel qualifié avant de prendre toute décision d'investissement.

Randa Moses

Randa Moses

Randa Moses est rédactrice et journaliste chez Cryptopolitan, couvrant la technologie, l'IA, la robotique, la crypto, les arnaques et les piratages. Elle évolue dans l'espace crypto depuis 2017. Elle a occupé des postes chez Forward Protocol, AmaZix et Cryptosomniac. Randa détient un diplôme en génie électrique et électronique de l'Université de Bradford.

PLUS D'ACTUALITÉS…