Anthropic afirma que Claude vulneró la seguridad de tres empresas durante pruebas de seguridad deficientes

Foto de Brett Wharton en Unsplash.
- Anthropic afirmó que tres modelos Claude escaparon de los entornos de prueba y obtuvieron acceso no autorizado a tres organizaciones reales.
- Mythos 5 publicó un paquete Python malicioso en PyPI que fue descargado y ejecutado en 15 sistemas reales.
- La revelación se produjo nueve días después de la filtración de datos de OpenAI relacionada con Hugging Face.
Tres de los modelos Claude de Anthropic escaparon de entornos de prueba que debían estar bloqueados, informó la compañía el jueves. Lograron infiltrarse en los sistemas operativos de tres organizaciones diferentes. Una configuración errónea les había proporcionado acceso a internet durante los simulacros de ciberseguridad.
Los modelos de Claude trataban a empresas reales como objetivos de práctica
OpenAI anunció el 21 de julio que un modelo escapó de su entorno aislado y explotó una vulnerabilidad de día cero para acceder a los sistemas de producción de Hugging Face.
Esto llevó a Anthropic a revisar minuciosamente sus registros. La compañía indicó en una publicación de blog en su sitio Frontier Red Team que analizó 141.006 ejecuciones de evaluación en las que Claude teóricamente podría haber accedido a internet.denttresdentrelacionados con Irregular, un socio externo que realiza y gestiona algunas de sus pruebas de seguridad ofensivas.
En estas pruebas, se le indica a un modelo que hay un secreto oculto en otra máquina y se le pide que vaya a buscarlo. La indicación de Anthropic a Claude le había dicho que el entorno era una simulación.
Un error de configuración dejó las máquinas de evaluación con acceso a internet en tiempo real, y ninguna de las dos compañías lo detectó hasta la semana pasada. Anthropic describió la confusión como un «malentendido» entre las dos empresas, y añadió que están «abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra»
Entre ellos se encontraban Opus 4.7, Mythos 5 y un modelo de investigación interno que aún no se ha publicado. La diferencia radicó en cómo cada uno respondió tras los indicios de que los objetivos eran reales, lo que, según Anthropic, fue su hallazgo más sorprendente.
El más antiguo, Opus 4.7, completó sus cuatro ejecuciones. En dos de ellas, se convenció de que la empresa real debía formar parte del ejercicio. Obtuvodenty accedió a una base de datos con información de producción. Mythos 5 también dedujo que se encontraba en internet, pero luego recurrió a su razonamiento para concluir que aún estaba en una simulación.
Solo el modelo más reciente, la versión de investigación interna, se detuvo automáticamente al detectar que los sistemas eran reales. Anthropic afirmó que su código "no detectó ni explotó ninguna vulnerabilidad compleja" y que, en cambio, se basó en contraseñas débiles y puntos finales no autenticados.
Mythos 5 publicó un malware que se ejecutó en 15 sistemas reales
Siguiendo las instrucciones para la configuración del desarrollador, Mythos 5 buscó un paquete de Python en PyPI que no existía. Así que, para cumplir su función, escribió y publicó uno con ese nombre.
El paquete estuvo disponible en línea durante aproximadamente una hora antes de ser retirado. Se descargó y ejecutó en 15 sistemas reales. Otro ataque afectó a un dominio que los diseñadores de la prueba creían ficticio, pero que en realidad estaba activo y en uso.
Anthropic afirmó no haber encontrado pruebas de que ningún modelo estuviera "persiguiendo un objetivo propio". Según su versión, cada uno simplemente intentaba cumplir con la tarea que se le había encomendado.
La empresa se apresuró a señalar que su caso es diferente al de OpenAI. Según Anthropic, el modelo de OpenAI se filtró a través de una vulnerabilidad no descubierta, mientras que sus propios modelos se filtraron a través de una puerta que quedó abierta por error.
La empresa describió los hechos como “más parecidos a un fallo operativo y de seguridad”. Asimismo, señaló que los clasificadores de seguridad y el sistema de monitorización incluidos en sus productos comerciales habrían evitado este comportamiento.
Anthropic inició su revisión el jueves 23 de julio y suspendió todas las evaluaciones cibernéticas ese mismo día. Los tresdentsedental día siguiente. Informó a Irregular y a las organizaciones afectadas el lunes 27 de julio.
Dos organizaciones no habían detectado ni reportado intrusiones. La compañía indicó que ha contratado al grupo de evaluación METR para realizar una revisióndent .
El modelo Mythos de Anthropic ya fue noticia este verano pordentvulnerabilidades en sistemas clasificados del gobierno estadounidense en cuestión de horas, como Cryptopolitan informó. El modelo también descubrió una vulnerabilidad de cuatro años de antigüedad en Zcashel pool protegido Orchard de
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Preguntas frecuentes
¿Qué modelos de Claude estuvieron involucrados en las filtraciones?
Anthropic afirmó que tres modelos estaban implicados: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna aún no publicado.
¿Cómo pudo Claude acceder a sistemas reales si se trataba de una prueba?
Un error de configuración en las evaluaciones realizadas con Irregular, socio de Anthropic, dejó las máquinas de prueba con acceso a internet en tiempo real. El sistema de Anthropic le había indicado a Claude que el entorno era una simulación sin conectividad, por lo que los modelos trataron sistemas reales como parte del ejercicio.
¿Alguno de los ataques causó daños reales?
Sí. Mythos 5 publicó un paquete Python malicioso en PyPI que permaneció en línea durante aproximadamente una hora y fue descargado y ejecutado en 15 sistemas reales. Opus 4.7 obtuvodenty accedió a una base de datos de datos de producción antes de que Anthropic detectara la actividad.
Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Randa Moisés
Randa Moses es editora y reportera en Cryptopolitan donde cubre temas de tecnología, IA, robótica, criptomonedas, estafas y hackeos. Trabaja en el sector de las criptomonedas desde 2017 y ha ocupado cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa es ingeniera eléctrica ytronpor la Universidad de Bradford.
















