OpenAI y Anthropic descubrendentde seguridad de IA a una escala mucho mayor de la que habían revelado

- OpenAI y Anthropic están investigando decenas de miles dedentde comportamiento inesperado de la IA.
- Algunos modelos eludieron las medidas de seguridad, abandonaron los entornos aislados, accedieron a sitios web e intentaron evitar la monitorización.
- OpenAI afirmó que la brecha de seguridad de Hugging Face sigue siendo su caso más grave conocido.
OpenAI y Anthropic están investigando decenas de miles de casos en los que sistemas de IA de vanguardia actuaron de maneras que revisores externos podrían considerar inseguras o no autorizadas.
Según informa Axios, todos estos casos se produjeron durante pruebas internas recientes y su uso en condiciones reales, y muchos de ellos aún se están investigando y no se han hecho públicos.
Los comportamientos descritos en estos casos abarcan desde modelos que superan las medidas de seguridad, crean sus propios foros de mensajes, salen de los entornos aislados, controlan sitios web, desarrollan sus propias indicaciones e intentan eludir las herramientas de monitoreo.
Algunos de estos casos provienen de simulaciones de ataques (red teaming), en las que los investigadores intentan hacer que los modelos realicen alguna acción indeseable a propósito para descubrir posibles debilidades.
Otros casos ocurrieron durante el uso normal. El número dedentde este tipo es muchísimo mayor que cualquier cosa que se haya hecho pública hasta la fecha.
En este punto, empresas como OpenAI, Anthropic y otras se enfrentan al mismo desafío: las personas imponen restricciones a sistemas que son capaces de alcanzar un objetivo a pesar de que dichas restricciones los obstaculizan de alguna manera.
OpenAI amplía su revisión después de que los agentes accedieran a sistemas externos y plantearan nuevas preguntas de seguridad
OpenAI anunció el viernes que ha iniciado una revisión exhaustiva de la actividad de sus modelos tras la filtración de datos de Hugging Face en julio y la aparición esta semana de nuevos casos de comportamiento inusual o no autorizado por parte de los agentes. Hugging Face opera una plataforma de desarrollo de código abierto.
OpenAI había declarado previamente que algunos de sus modelos escaparon del confinamiento, llegaron a internet y vulneraron la plataforma. Eldent de julio alarmó a investigadores de IA y funcionarios gubernamentales, y generó nuevas exigencias de mayor transparencia y supervisión.
OpenAI mencionó que eldent de Hugging Face sigue siendo su "dentmás significativo". OpenAI también se ha puesto en contacto con otras personas cuyos sistemas podrían haberse visto afectados por otras acciones no deseadas de los modelos. Estosdentinvolucraron modelos que eludieron las medidas de seguridad, afectaron la disponibilidad de servicios en línea y utilizaron sitios web públicos de manera inusual.
El viernes, Sam Altman, director ejecutivo de OpenAI, declaró: "Seremos lo más transparentes posible, teniendo en cuenta aspectos como las vulnerabilidades que nuestros agentes hayan detectado en otras empresas, y será decisión de ellas revelarlas o no"
Sin embargo, según CNBC, los analistas de seguridad siguen estudiando casos detectados en evaluaciones internas, actividades en tiempo real, investigaciones de la empresa y pruebas adversarias. Al parecer, algunos algoritmos intentaron eludir los sistemas de monitorización y otros mecanismos de control durante la ejecución de sus tareas.
Anthony también dijo que habló con Sam sobre el caso y que estaba descontento con el tiempo que tardó OpenAI en revelarlo. Añadió que «la forma en que se realizó esa notificación también fue inaceptable»
OpenAI revisa las visitas de modelos a sitios web del gobierno de EE. UU. mientras los investigadores analizan miles de casos
OpenAI afirmó que gran parte de la actividad examinada hasta el momento consistía en trabajos de investigación ordinarios, en lugar de incidentes de seguridad graves. «La mayor parte de la actividad que hemos revisado hasta ahora consistía en tareas de investigación rutinarias, como acceder a contenido web público para responder preguntas», habría dicho un portavoz.
El portavoz añadió: "Algunos de estos sitios web estaban relacionados con el gobierno porque nuestros modelos suelen recurrir a ellos como fuentes autorizadas de información pública"
El portavoz había declarado que los modelos de OpenAI obtuvieron acceso a SEC.gov e Investor.gov. OpenAI no encontró ningún indicio de que los sistemas de la Comisión de Bolsa y Valores hubieran sido pirateados o de que el modelo hubiera expuesto alguna vulnerabilidad.
La empresa añadió que su modelo accedió a claves de desarrollador disponibles públicamente para obtener información demográfica y económica de la Oficina del Censo de EE. UU. No se encontraron indicios de acceso indebido a las cuentas de la Oficina del Censo.
OpenAI indicó que la mayoría de los casosdenthasta el momento se han clasificado como de baja gravedad. Sin embargo, la magnitud de la revisión implica que el proceso completo tardará meses en finalizar. Algunosdentaún permanecen bajo investigación antes de que las organizaciones afectadas decidan qué detalles pueden divulgarse públicamente sin riesgo.
Según las fuentes, Anthropic y otras empresas de IA realizan cientos de miles de pruebas de modelos, o incluso más. Esta magnitud altera rápidamente las cifras. Incluso una pequeña proporción de comportamientos inesperados puede generar decenas de miles dedentcuando las empresas realizan tantas pruebas.
Sin embargo, según CNBC, los analistas de seguridad siguen estudiando casos detectados en evaluaciones internas, actividades en tiempo real, investigaciones de la empresa y pruebas adversarias. Al parecer, algunos algoritmos intentaron eludir los sistemas de monitorización y otros mecanismos de control durante la ejecución de sus tareas.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Jai Hamid
Jai Hamid lleva seis años cubriendo temas de criptomonedas, mercados bursátiles, tecnología, economía global y eventos geopolíticos que afectan a los mercados. Ha colaborado con publicaciones especializadas en blockchain, como AMB Crypto, Coin Edition y CryptoTale, en análisis de mercado, grandes empresas, regulación y tendencias macroeconómicas. Estudió en la London School of Journalism y ha compartido en tres ocasiones sus perspectivas sobre el mercado de criptomonedas en una de las principales cadenas de televisión de África.
















