ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Ejecutivos de OpenAI advierten contra la histeria mientras Astra supera un umbral cibernético crítico

PorHannah CollymoreHannah Collymore 3 minutos de lectura
Ejecutivos de OpenAI advierten contra la histeria mientras Astra supera un umbral cibernético crítico
  • OpenAI afirma que Astra es el primer modelo que supera el umbral de ciberseguridad "Crítico" en su Marco de Preparación.
  • Puede encontrar y explotar fallos de software desconocidos sin intervención humana.
  • El científico jefe Jakub Pachocki y el director ejecutivo Sam Altman rechazaron los temores sobre la "falta de monitorización", argumentando que el modelo no es un salto a una caja negra.

El científico jefe de OpenAI, Jakub Pachocki, se pronunció pocas horas después de que la empresa se convirtiera en la primera en la carrera de la IA en alcanzar la designación de ciberseguridad "Crítica" en su Marco de Preparación, tras presentar un adelanto de su próximo modelo Astra.

La advertencia de Pachocki a primera hora del miércoles tenía como objetivo calmar la histeria en torno a los crecientes comentarios de que el laboratorio de IA podría haber perdido el control sobre las capacidades de sus modelos más avanzados.

¿Por qué Astra de OpenAI es "crítica"?

La designación Crítica es un nivel del Marco de Preparación que OpenAI introdujo en el sector de la IA en diciembre de 2023. El Marco de Preparación mide cuánta intervención y estímulo humano necesita un modelo de IA para encontrar y crear exploits de día cero viables en muchos sistemas reforzados, o para ejecutar un ataque novedoso completo.

Una vulnerabilidad de día cero se refiere a la explotación de fallos que ni siquiera los creadores del software han descubierto todavía.

OpenAI declaró el 1 de septiembre en su publicación "Camino a Astra" que, cuando se lance, el modelo podrá completar todos los pasos para realizar ataques novedosos completos o explotar vulnerabilidades de día cero con una mínima intervención humana.

En su publicación de blog, OpenAI citó la puntuación del 100 % de Astra en ExploitBench, una prueba que evalúa cómo los modelos pueden explotar errores conocidos, como prueba de ello.

Astra no solo es mejor para planificar ataques de día cero, sino que también es más eficiente. OpenAI demostró esta capacidad mediante una prueba interna realizada con 20 vulnerabilidades de alta gravedad de V8 que se hicieron públicas recientemente. Astra consumió menos tokens, detectó dos vulnerabilidades de día cero y superó a Sol en la generación de código ejecutable arbitrario.

La misma publicación decía que Astra podía encadenar errores desconocidos del navegador para escapar del entorno aislado y, durante las pruebas dirigidas por expertos, logró escalar privilegios del sistema operativo desde usuario ordinario hasta root.

Como mencionó TechCrunch, Astra se une al modelo Mythos de Anthropic, que se lanzó a principios de este año como el primer modelo de lenguaje a gran escala con esas capacidades.

Pachocki pide que no cunda el pánico por Astra

Pachocki, científico jefe de OpenAI, rechaza la histeria que rodea la idea de que OpenAI esté entrando en un terreno desconocido con Astra. Según él, no querría que se iniciara “una carrera hacia la falta de control a raíz de informes confusos”.

El ejecutivo de OpenAI insistió en que el laboratorio cumplió con su deber al utilizar el monitoreo de la cadena de pensamiento, la práctica de leer el razonamiento paso a paso que un modelo expone a medida que trabaja. Citó la profundidad del grafo computacional detrás de los modelos de vanguardia actuales de OpenAI, incluido Astra, que se sitúa a un factor de dos de GPT-4 en la publicación X.

Antes de Pachocki, el director ejecutivo de OpenAI, Sam Altman, también había hecho un llamamiento a la calma el mismo día en que se publicó la entrada del blog de Astra.

«Aquí hay una tensión evidente», escribió el martes, calificando a Astra de «muy buena» y argumentando que las medidas de seguridad deben avanzar al mismo ritmo que la capacidad bruta. Altman afirmó que OpenAI había dedicado todo el verano a garantizar que el modelo se lanzara con las medidas de seguridad necesarias.

El debate sobre la seguridad lleva semanas en marcha. El 18 de agosto, OpenAI se comprometió a suspender durante dos semanas el entrenamiento de aprendizaje por refuerzo para los modelos destinados a la implementación, con el fin de permitir a sus ingenieros reforzar los clústeres de investigación y optimizar la monitorización. El entrenamiento se reanudó el 28 de agosto.

Según OpenAI, Astra no estuvo involucrada en el ahora tristemente célebredentde Hugging Face. También afirmó que el modelo ni siquiera intentó salirse de su entorno controlado, incluso cuando se le presentó un escenario diseñado para incitarlo a recrear el episodio de Hugging Face.

Los laboratorios de IA ahora están siendo cautelosos con respecto a quién puede acceder a sus modelos de vanguardia

OpenAI ha declarado que ahora todos tendrán acceso a las funciones más avanzadas de Astra, reservando esas capacidades para las organizaciones que forman parte de la coalición Daybreak de OpenAI, mientras que las empresas de Daybreak Blue tendrán acceso a las funciones defensivas más sofisticadas.

Tal como Cryptopolitan informó, Anthropic también afirmó que solo las empresas que participan en su Proyecto Glasswing tendrán acceso a Mythos 5.1, que es básicamente Fable 5.1 con medidas de seguridad independientes.

OpenAI también anunció que supervisará y limitará las respuestas a consultas provenientes de cuentas que considere de alto riesgo. Además, Astra incluirá un sistema de monitoreo de la cadena de pensamiento para detectar comportamientos inapropiados y rechazar con mayor frecuencia solicitudes cibernéticas dañinas.

La mayor parte de la información sobre Astra fue proporcionada por la propia OpenAI, con una validación limitada por parte de terceros de las afirmaciones de OpenAI sobre seguridad o capacidades.

Yona Shavit, antigua empleada de OpenAI que ahora trabaja en la resiliencia de la IA en la Fundación OpenAI, preguntó públicamente si el comportamiento de Astra durante las pruebas refleja una alineación genuina o un modelo que simplemente sabía lo que los evaluadores querían ver.

OpenAI afirma que la tarjeta del sistema completo y las evaluaciones adicionales estarán disponibles cuando Astra se lance a gran escala. Hasta entonces, el alcance de sus capacidades cibernéticas y la solidez de las medidas de seguridad que las protegen siguen siendo difíciles de evaluar.

Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Preguntas frecuentes

¿Cuál es el umbral de ciberseguridad "crítico" y por qué Astra lo cumple?

Según el Marco de Preparación de OpenAI, un modelo es crítico si puededenty crear exploits de día cero funcionales en múltiples sistemas reforzados, o ejecutar ataques novedosos de extremo a extremo desde un objetivo de alto nivel, sin la supervisión de una persona en cada paso. OpenAI afirma que Astra es el primero de sus modelos en cumplir con este requisito.

¿Sobre qué advirtió realmente Jakub Pachocki?

Pachocki, científico jefe de OpenAI, afirmó que quería evitar "una carrera hacia la imposibilidad de ser monitoreada, desencadenada por informes confusos", y señaló que la profundidad del grafo computacional de Astra es casi el doble que la de GPT-4 y que OpenAI ha conservado el monitoreo de la cadena de pensamiento.

¿Quiénes tendrán acceso a las capacidades cibernéticas más potentes de Astra?

Las funciones de ciberseguridad más avanzadas se destinarán primero a un grupo limitado dentro de la coalición Daybreak de OpenAI, seguido de un acceso defensivo más amplio a través de Daybreak Blue, mientras que las cuentas de mayor riesgo se enfrentarán a respuestas restringidas.

Comparte este artículo
Hannah Collymore

Hannah Collymore

Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.

MÁS… NOTICIAS