Les dirigeants d'OpenAI mettent en garde contre l'hystérie alors qu'Astra franchit un seuil critique en matière de cybersécurité

- OpenAI affirme qu'Astra est le premier modèle à franchir le seuil de cybersécurité « critique » dans son cadre de préparation.
- Il peut détecter et exploiter des failles logicielles inconnues sans intervention humaine.
- Le scientifique en chef Jakub Pachocki et le PDG Sam Altman ont réfuté les craintes liées à l'« impossibilité de surveillance », affirmant que le modèle n'est pas une solution opaque.
Le scientifique en chef d'OpenAI, Jakub Pachocki, s'est exprimé quelques heures après que l'entreprise soit devenue la première dans la course à l'IA à atteindre la désignation de cybersécurité « critique » dans son cadre de préparation, après avoir donné un aperçu de son futur modèle Astra.
L'avertissement lancé par Pachocki mercredi matin visait à calmer l'hystérie suscitée par les commentaires de plus en plus nombreux selon lesquels le laboratoire d'IA pourrait ne plus maîtriser les capacités de ses plus grands modèles.
Pourquoi le système Astra d'OpenAI est-il considéré comme « critique » ?
La désignation « Critique » correspond à un niveau du cadre de préparation qu'OpenAI a introduit dans le secteur de l'IA en décembre 2023. Ce cadre mesure le degré d'intervention humaine nécessaire à un modèle d'IA pour trouver et construire des exploits zero-day viables sur de nombreux systèmes renforcés, ou pour exécuter une attaque inédite complète.
Une faille zero-day désigne l'exploitation de failles que même les créateurs du logiciel n'ont pas encore découvertes.
OpenAI a déclaré elle-même le 1er septembre, dans son article intitulé « Path to Astra », que le modèle sera capable de mener à bien toutes les étapes d'attaques inédites ou d'exploitations zero-day avec une intervention humaine minimale lors de son lancement.
OpenAI a cité comme preuve, dans son article de blog, le score de 100 % obtenu par Astra sur ExploitBench, un test mesurant la capacité des modèles à exploiter des failles connues.
Astra est non seulement plus performant pour concevoir des attaques zero-day, mais aussi plus efficace. OpenAI l'a démontré lors d'un test interne mené sur 20 failles critiques de V8 récemment rendues publiques. Astra a utilisé moins de jetons, a identifié deux vulnérabilités zero-day et a globalement surpassé Sol en matière d'exécution de code arbitraire.
Le même article indiquait qu'Astra pouvait exploiter des failles inconnues du navigateur pour s'échapper d'un environnement isolé et avait permis d'obtenir des privilèges système allant d'un utilisateur ordinaire à un niveau root lors d'essais menés par des experts.
Comme l'a mentionné TechCrunch, Astra rejoint le modèle Mythos d'Anthropic, sorti plus tôt cette année, en tant que premier grand modèle de langage doté de ces capacités.
Pachocki demande de ne pas paniquer à propos d'Astra
Pachocki, directeur scientifique d'OpenAI, réfute l'hystérie selon laquelle OpenAI s'aventurerait en terrain inconnu avec Astra. D'après lui, il ne souhaite pas « une course à l'impossibilité d'être contrôlée, déclenchée par des rapports confus ».
Le responsable d'OpenAI a insisté sur le fait que le laboratoire avait fait preuve de toute la diligence requise en utilisant la surveillance de la chaîne de pensée, une pratique qui consiste à lire le raisonnement étape par étape qu'un modèle expose pendant son fonctionnement. Il a cité la profondeur du graphe de calcul sous-jacent aux modèles de pointe actuels d'OpenAI, dont Astra, qui se situe dans un facteur deux de celle de GPT-4 dans l'article sur X.
Avant Pachocki, le directeur général d'OpenAI, Sam Altman, avait également appelé au calme le jour même de la publication du blog d'Astra.
« Il y a une tension manifeste », a-t-il écrit mardi, qualifiant Astra de « très performante » tout en soulignant que les mesures de sécurité doivent progresser au même rythme que les capacités brutes. Altman a précisé qu'OpenAI avait consacré tout l'été à s'assurer que le modèle soit livré avec les mesures de sécurité requises.
Les discussions sur la sécurité durent depuis des semaines. Le 18 août, OpenAI s'est engagé à suspendre pendant deux semaines l'entraînement par renforcement des modèles destinés au déploiement afin de permettre à ses ingénieurs de renforcer les clusters de recherche et d'optimiser la surveillance. L'entraînement a repris le 28 août.
Selon OpenAI, Astra n'était pas impliqué dans l'dentdésormais tristement célèbre du « Hugging Face ». L'organisation a également indiqué que le modèle n'a même pas tenté de sortir de son environnement isolé, même lorsqu'on lui a présenté un scénario conçu pour l'inciter à reproduire l'épisode du « Hugging Face ».
Les laboratoires d'IA font désormais preuve de prudence quant aux personnes autorisées à accéder à leurs modèles de pointe
OpenAI a annoncé que désormais, tout le monde aura accès aux fonctions les plus avancées d'Astra, ces capacités étant réservées aux organisations de la coalition Daybreak d'OpenAI, tandis que les entreprises Daybreak Blue auront accès aux fonctionnalités défensives les plus performantes.
Comme Cryptopolitan l'a rapporté, Anthropic a également déclaré que seules les entreprises de son projet Glasswing auront accès à Mythos 5.1, qui est essentiellement Fable 5.1 avec des mesures de sécurité distinctes.
OpenAI a également annoncé qu'elle surveillera et limitera les réponses aux requêtes provenant de comptes jugés à haut risque. De manière générale, Astra intégrera un système de surveillance renforcé afin de détecter les comportements malveillants et de refuser plus fréquemment les demandes d'accès malveillantes.
La plupart des informations concernant Astra ont été fournies par OpenAI elle-même, avec une validation tierce partie limitée des affirmations d'OpenAI concernant la sécurité ou les capacités de la technologie.
Yona Shavit, une ancienne employée d'OpenAI qui travaille maintenant sur la résilience de l'IA à la Fondation OpenAI, a demandé publiquement si le comportement d'Astra pendant les tests reflétait un véritable alignement ou un modèle qui savait simplement ce que les évaluateurs voulaient voir.
OpenAI annonce qu'une fiche système complète et des évaluations plus poussées seront disponibles lors du lancement officiel d'Astra. D'ici là, il est difficile d'évaluer la portée de ses capacités cybernétiques et la robustesse des mesures de sécurité qui les protègent.
Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !
FAQ
Quel est le seuil de cybersécurité « critique », et pourquoi Astra l'atteint-elle ?
Dans le cadre de préparation d'OpenAI, un modèle est considéré comme critique s'il est capable d'dentet de créer des exploits zero-day fonctionnels sur de nombreux systèmes renforcés, ou de mener des attaques inédites de bout en bout à partir d'un objectif global, sans intervention humaine à chaque étape. OpenAI affirme qu'Astra est le premier de ses modèles à satisfaire à ce critère.
De quoi Jakub Pachocki nous a-t-il réellement mis en garde ?
Pachocki, le scientifique en chef d'OpenAI, a déclaré vouloir éviter « une course vers l'impossibilité d'être surveillée, déclenchée par des rapports confus », notant que la profondeur du graphe de calcul d'Astra est à un facteur deux de celle de GPT-4 et qu'OpenAI a préservé la surveillance de la chaîne de pensée.
Qui aura accès aux capacités cybernétiques les plus puissantes d'Astra ?
Les fonctions de cybersécurité les plus avancées seront d'abord attribuées à un groupe restreint de la coalition Daybreak d'OpenAI, un accès défensif plus large étant ensuite proposé par Daybreak Blue, tandis que les comptes à haut risque bénéficieront de réponses restreintes.

Hannah Collymore
Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.
















