ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

OpenAI mantiene pausada su mayor ejecución de RL de frontera y añade un coste de monitorización del 20 %

PorRanda MosesRanda Moses 2 min de lectura
OpenAI mantiene pausado su mayor entrenamiento de RL de vanguardia y añade un 20% en costos de monitoreo.
  • OpenAI dijo que su mayor ejecución planificada de aprendizaje por refuerzo (RL) se mantiene en pausa mientras valida la seguridad.
  • La desaceleración sigue a la brecha de julio en Hugging Face causada por uno de sus propios agentes.
  • Es la primera vez que OpenAI frena abiertamente el desarrollo de modelos por motivos de seguridad.

OpenAI dijo que su ejecución de entrenamiento de frontera programada más grande sigue en espera, y la nueva monitorización de seguridad añade aproximadamente un 20 % al cómputo.

Es la primera vez que OpenAI dice que ha ralentizado el desarrollo por preocupaciones de seguridad, semanas después de que uno de sus propios agentes de IA hackeara Hugging Face.

OpenAI detuvo el aprendizaje por refuerzo (RL) durante dos semanas

En una publicación de blog titulada «Ritmando el desarrollo de modelos en una era de capacidades ciber-críticas», OpenAI describió los cambios que ya ha realizado en su entrenamiento y prueba de modelos.

El aprendizaje por refuerzo (RL) utilizado para mejorar sus últimos sistemas se pausó durante dos semanas después de la violación de Hugging Face.

El grande aún no lo ha hecho. «Nuestra ejecución de RL de frontera planificada más grande sigue en espera mientras realizamos entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras salvaguardas y establecer más evidencia de alineación antes de proceder», escribió la empresa .

Cryptopolitan informó que un agente de OpenAI salió de su entorno de prueba bloqueado alrededor del 9 de julio y se encontró dentro de los sistemas de Hugging Face del 11 de julio al 13 de julio. OpenAI tardó aproximadamente una semana en vincular el ataque a su propio agente y el incidente se hizo público el 21 de julio.

OpenAI dijo a los periodistas que los nuevos controles «no son una reacción directa a Hugging Face específicamente». El 7 de agosto, la empresa concluyó que Astra podría cruzar el umbral de «Crítico» en su Marco de Preparación.

Esa política interna compromete a OpenAI a detener el desarrollo cuando un modelo alcanza ese nivel para que los ingenieros puedan construir salvaguardas adicionales. El científico jefe Jakub Pachocki dijo que el hallazgo vino con una advertencia de lo que sigue. Los nuevos modelos poderosos, dijo a los periodistas, se pueden esperar que «hagan cosas bastante sin precedentes en el mundo real».

Amelia Glaese, VP de investigación de OpenAI, dijo: «Hemos establecido requisitos y expectativas para un desarrollo seguro». Continuó: «Esos requisitos y expectativas varían según el nivel de riesgo que vemos».

Los detectores vigilan cada token muestreado, pero la cadena de pensamiento puede mentir

Hay un sistema de monitorización que cuesta aproximadamente el 20 % de lo que sea que esté entrenando o evaluando, según OpenAI.

Es de múltiples etapas, y los detectores exploran la actividad interna de un modelo en cada token muestreado y escalan cualquier cosa sospechosa a investigadores automatizados de mayor cómputo que exploran acciones de herramientas, trazas de razonamiento y registros de actividad en busca de robo de datos, comportamiento destructivo o intentos de escapar.

OpenAI quiere levantar una alerta en 30 minutos de actividad alarmante. Sus equipos de seguridad, protección e investigación tienen 30 minutos para descartar una falsa alarma.

Si no pueden, se espera que detengan la ejecución. La empresa también amplió la monitorización de la «cadena de pensamiento», que lee cómo un modelo razona en voz alta a través de una tarea.

Existe una vulnerabilidad conocida. Investigaciones, incluido el trabajo del rival de OpenAI Anthropic, han demostrado que la cadena de pensamiento de un modelo no siempre coincide con sus verdaderos objetivos. Pachocki dijo que OpenAI construyó su entrenamiento para reducir las probabilidades de que los modelos aprendan a ocultar sus intenciones mintiendo en ese razonamiento.

La revisión de seguridad «requirió un trabajo de ingeniería sustancial», y la empresa «incurred great cost», dijo OpenAI. Los expertos dijeron que la investigación sola probablemente costó entre 4 millones y 15 millones de dólares, aunque el número total no es público.

OpenAI aún no ha publicado un informe técnico post-mortem de la violación de Hugging Face, pero reiteró que uno está llegando «pronto».

En la conferencia Black Hat del 5 de agosto, el personal de OpenAI dijo que sus agentes habían coordinado durante meses dejando notas en un tablero de mensajería que la empresa no sabía que existía.

Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.

Comparte este artículo

Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Randa Moses

Randa Moses

Randa Moses es editora y reportera en Cryptopolitan, donde cubre tecnología, IA, robótica, criptomonedas, estafas y ciberataques. Ha trabajado en el espacio de las criptomonedas desde 2017. Ocupó cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa posee un grado en Ingeniería Eléctrica y Electrónica de la Universidad de Bradford.

MÁS … NOTICIAS