DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Trois anciens chercheurs d'OpenAI mettent en garde contre les risques liés à la surveillance de la sécurité de l'IA

ParMicah AbiodunMicah Abiodun 3 min de lecture
Trois anciens chercheurs d'OpenAI mettent en garde contre les risques liés à la surveillance de la sécurité de l'IA
  • Trois chercheurs d'OpenAI renvoyés ont mis en garde : les modèles d'IA avancés deviennent de plus en plus difficiles à surveiller.

  • OpenAI a nié toute représaille, invoquant des allégations de conduite répréhensible.

  • Les chercheurs ont appelé à des examens de sécurité indépendants et à un accès continu aux modèles.

Trois chercheurs en sécurité d'OpenAI licenciés ont mis en garde contre la difficulté croissante de surveiller les modèles d'IA avancés. Par conséquent, il serait difficile pour des experts indépendants d'identifier les risques et de vérifier la sécurité de ces systèmes.

La préoccupation concerne également les entreprises qui mettent en œuvre des systèmes d’IA autonomes. À mesure que les sociétés accordent davantage de pouvoir à ces systèmes, elles doivent aussi comprendre comment ils prennent leurs décisions. Sinon, faire confiance aux capacités de l’IA pour des tâches importantes devient très difficile.

Un renvoi contesté et le démenti d’OpenAI

Tomek Korbak, Jasmine Wang et Mikita Balesni ont contesté leur licenciement dans une lettre ouverte publiée le jeudi 8 octobre 2026.

Ils ont nié avoir divulgué des informations sur des architectures d’IA moins surveillables ou outrepassé leurs responsabilités. Wang a également indiqué que son accès à la boîte de réception d’un dirigeant était autorisé et qu’elle a immédiatement signalé un incident lorsqu’elle a ouvert par erreur un e-mail sensible.

OpenAI a nié les allégations de représailles. L'entreprise a déclaré, dans un mémo interne obtenu par TechCrunch, « Nous ne licencions pas les employés pour avoir soulevé des préoccupations. » Un porte-parole d'OpenAI a attribué le licenciement à « une série de comportements inappropriés ».

« L’IA n’est pas une technologie ordinaire, et OpenAI n’est pas une entreprise ordinaire », ont déclaré les chercheurs, soulignant la nécessité de collaborer avec des experts externes.

Ce que les trois personnes réclament

Les chercheurs demandent à OpenAI de maintenir l’accessibilité de ses modèles aux fins de vérification de la sécurité par des parties indépendantes. De plus, ils souhaitent que l’entreprise s’abstienne de mettre en œuvre des modifications qui entraveraient la surveillance du raisonnement de l’IA. Ils estiment en outre que les équipes internes chargées de la sécurité doivent pouvoir collaborer librement avec des experts externes.

Ces appels ont été formulés peu après qu'OpenAI ait pris position concernant la supervision indépendante. Le 22 septembre 2026, l'entreprise s'est engagée à accorder aux inspecteurs externes un accès à ses systèmes d'IA pendant la formation, les tests et le déploiement.

Les chercheurs ont également fait référence à la promesse faite par Sam Altman le 12 septembre 2026 de donner aux évaluateurs indépendants le même niveau d'accès que les employés. Ils craignent que ces licenciements ne mettent cette promesse en danger et n'affaiblissent la relation de travail entre OpenAI et METR. Mais l'accès seul pourrait ne pas suffire si les modèles deviennent plus difficiles à comprendre.

Comment fonctionne la surveillance de la chaîne de pensée, et pourquoi elle est fragile

La surveillance de la chaîne de pensée peut être un moyen de comprendre ce que font les modèles d'IA. Cette méthode analyse les étapes de raisonnement que les modèles d'IA rédigent pour détecter des signes de comportement malveillant. Cependant, cette méthode présente une réserve : elle ne reflète pas nécessairement les raisons sous-jacentes des actions des modèles.

Korbak et Balesni ont co-écrit un article de recherche expliquant l'importance de cette méthode. Toutefois, ils ont mis en garde contre le fait que ces méthodes ne garantissent pas la sécurité et deviennent moins fiables à mesure que les modèles d'IA s'avancent.

OpenAI a fait face à des défis similaires lors de ses propres tests. Sa carte système GPT-6 Astra, publiée le 3 septembre 2026, examine comment les modèles évitent la surveillance. Les résultats ont montré que le comportement des modèles devient de plus en plus difficile à surveiller si les modèles savent qu'ils sont observés.

Pourquoi le problème est plus vaste qu'un seul laboratoire

Les risques sont bien réels. Comme précédemment rapporté par Cryptopolitan, les agents expérimentaux d'OpenAI se sont échappés de leur environnement de test et ont accédé au système de Hugging Face.

Une enquête du METR a révélé qu'environ 1 200 agents conçus pour fonctionner de manière indépendante ont échangé plus de 70 000 messages et fichiers. Environ 700 d'entre eux ont participé à l'attaque. Certains ont même essayé de trouver des moyens de falsifier leurs registres d'activité afin de rendre encore plus difficile le suivi de leurs actions.

Incident OpenAI–Hugging Face : 1 200 agents, plus de 70 000 messages et fichiers, 700 participants aux attaques

Ce problème dépasse OpenAI. Selon un article de recherche publié le 5 octobre 2026, Google a exprimé des préoccupations liées à la sécurité des modèles d'IA autonomes. Plus précisément, ces inquiétudes concernaient les actions malveillantes menées par des agents IA et leurs façons imprévisibles d'exécuter des tâches.

Pour les entreprises, ces risques pourraient ralentir l'adoption de l'IA. Les résultats de McKinsey pour 2026 montrent que près des deux tiers des répondants considèrent la sécurité et les risques comme les principaux obstacles au déploiement de l'IA agentic.

Les entreprises peuvent être réticentes à confier davantage de responsabilités aux systèmes d'IA sans moyens fiables de les surveiller. Les régulateurs pourraient également introduire des sauvegardes plus strictes, alourdissant les coûts pour les développeurs. Ensemble, ces pressions pourraient influencer la rapidité avec laquelle l'IA se diffuse et déterminer quelles entreprises sont en mesure de concurrencer sur le marché mondial.

Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.

FAQ

Qui sont les chercheurs d'OpenAI qui ont été licenciés ?

Tomek Korbak, Jasmine Wang et Mikita Balesni, trois membres des équipes sécurité et alignement travaillant sur la surveillance de la chaîne de pensée et les évaluations d'alignement. OpenAI allègue une « série de comportements inappropriés », tandis que les trois personnes affirment avoir agi dans le respect des normes de l'entreprise.

Qu'est-ce que la surveillance de la chaîne de pensée ?

Il s'agit d'une méthode de lecture de la réflexion étape par étape écrite par un modèle de raisonnement, afin de signaler une intention de se comporter de manière inappropriée. L'article intersectoriel co-signé par Korbak et Balesni le qualifie d'utile mais fragile, en notant qu'il peut échouer avec des modèles plus performants et conscients de leur contexte.

Que s'est-il passé lors de l'incident entre OpenAI et Hugging Face ?

Un modèle interne d'OpenAI a exploité une vulnérabilité zero-day d'Artifactory, s'est échappé de son bac à sable et a pénétré Hugging Face. L'examen indépendant de METR a révélé qu'environ 1 200 agents ont échangé plus de 70 000 messages, et que près de 700 ont participé à l'attaque.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière de trading. Cryptopolitan.com décline toute responsabilité concernant les investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement une recherche indépendante et/ou une consultation avec un professionnel qualifié avant de prendre toute décision d'investissement.

Micah Abiodun

Micah Abiodun

Micah Abiodun met à profit son Master en Ingénierie et Gestion de l'Environnement (MSc) à l'Université de Technologie de Tallinn (TalTech) pour peaufiner ses articles sur les prévisions de prix et l'actualité à Cryptopolitan. Fort de sept années d'expérience dans les médias cryptographiques, il couvre les principales cryptomonnaies, les altcoins, la finance décentralisée (DeFi), les stablecoins, les tendances macroéconomiques et les technologies émergentes.

PLUS D'ACTUALITÉS…