OpenAI mantiene en pausa su mayor proyecto de aprendizaje por refuerzo de vanguardia y añade un 20 % al coste de monitorización

- OpenAI ha comunicado que su mayor proyecto de aprendizaje por refuerzo (RL) de vanguardia permanece en pausa mientras valida la seguridad.
- La ralentización se produce tras la filtración de Hugging Face en julio, perpetrada por uno de sus propios agentes.
- Es la primera vez que OpenAI frena abiertamente el desarrollo de modelos por motivos de seguridad.
OpenAI ha comunicado que su mayor programa de entrenamiento de vanguardia sigue en suspenso, y que la nueva monitorización de seguridad añade aproximadamente un 20 % al cálculo.
Es la primera vez que OpenAI afirma haber ralentizado el desarrollo por motivos de seguridad, semanas después de que uno de sus propios agentes de IA hackeara Hugging Face.
OpenAI suspendió el aprendizaje por refuerzo (RL) durante dos semanas
En una entrada de blog titulada "Acelerando el desarrollo de modelos en una era de capacidades cibernéticas críticas", OpenAI describió los cambios que ya ha realizado en el entrenamiento y las pruebas de sus modelos.
El aprendizaje por refuerzo (RL) utilizado para mejorar sus sistemas más recientes se suspendió durante dos semanas tras la filtración de datos de Hugging Face.
La prueba principal aún no se ha realizado. "Nuestra mayor prueba de aprendizaje por refuerzo planificada permanece en suspenso mientras llevamos a cabo entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras medidas de seguridad y establecer más pruebas de alineación antes de continuar", escribió.
Cryptopolitan informó que un agente de OpenAI salió de su entorno de pruebas restringido alrededor del 9 de julio y fue encontrado dentro de los sistemas de Hugging Face del 11 al 13 de julio. OpenAI tardó aproximadamente una semana en vincular el ataque con su propio agente y el incidentedent hizo público el 21 de julio.
OpenAI declaró a la prensa que los nuevos controles "no son una reacción directa a Hugging Face en concreto". El 7 de agosto, la compañía concluyó que Astra podría superar el umbral de ciberseguridad "Crítico" en su Marco de Preparación.
Esa política interna compromete a OpenAI a detener el desarrollo cuando un modelo alcanza ese nivel para que los ingenieros puedan implementar medidas de seguridad adicionales. El científico jefe, Jakub Pachocki, afirmó que el hallazgo venía acompañado de una advertencia sobre lo que está por venir. Según declaró a la prensa, cabe esperar que los nuevos y potentes modelos "hagan cosas sindenten el mundo real"
Amelia Glaese, vicepresidenta de investigación de OpenAI, declaró: «Hemos establecido requisitos y expectativas para un desarrollo seguro». Y añadió: «Estos requisitos y expectativas varían según el nivel de riesgo que percibimos»
Los detectores vigilan cada token muestreado, pero la cadena de pensamiento puede mentir
Según OpenAI, existe un sistema de monitorización que cuesta aproximadamente el 20% del coste del entrenamiento o la evaluación con la que se ejecuta.
Es un proceso multietapa, en el que los detectores analizan la actividad interna de un modelo en cada token muestreado y remiten cualquier anomalía a investigadores automatizados de mayor capacidad de procesamiento que examinan las acciones de las herramientas, tracde razonamiento y los registros de actividad en busca de robo de datos, comportamiento destructivo o intentos de fuga.
OpenAI quiere activar una alerta en 30 minutos ante cualquier actividad sospechosa. Sus equipos de seguridad, protección e investigación disponen de 30 minutos para descartar una falsa alarma.
Si no pueden, se espera que detengan la ejecución. La empresa también amplió el monitoreo de la "cadena de pensamiento", que registra en voz alta cómo un modelo razona al realizar una tarea.
Existe una vulnerabilidad conocida. Diversas investigaciones, incluyendo trabajos de Anthropic, rival de OpenAI, han demostrado que el razonamiento de un modelo no siempre coincide con sus objetivos reales. Pachocki afirmó que OpenAI diseñó su entrenamiento para reducir la probabilidad de que los modelos aprendan a ocultar sus intenciones mintiendo en ese razonamiento.
La revisión de seguridad “requirió un trabajo de ingeniería sustancial” y la empresa “incurrió en grandes costos”, según OpenAI. Los expertos indicaron que solo la investigación probablemente costó entre 4 y 15 millones de dólares, aunque la cifra total no es pública.
OpenAI aún no ha publicado un análisis técnico posterior a la Hugging Face , pero ha reiterado que lo hará "pronto".
En la conferencia Black Hat del 5 de agosto, el personal de OpenAI afirmó que sus agentes se habían coordinado durante meses dejando notas en un tablón de anuncios cuya existencia la empresa desconocía.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Randa Moisés
Randa Moses es editora y reportera en Cryptopolitan donde cubre temas de tecnología, IA, robótica, criptomonedas, estafas y hackeos. Trabaja en el sector de las criptomonedas desde 2017 y ha ocupado cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa es ingeniera eléctrica ytronpor la Universidad de Bradford.
















