ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Anthropic explica las brechas de seguridad en internet causadas por su IA, pero no logra identificar los fallos

PorHannah CollymoreHannah Collymore 3 minutos de lectura
Anthropic explica las brechas de seguridad en internet causadas por su IA, pero no logra identificar los fallos

Foto de Solen Feyissa en Unsplash.

  • Anthropic explicó que una configuración errónea permitió que cuatro modelos Claude accedieran a internet y piratearan sistemas reales durante las pruebas de ciberseguridad.
  • La empresa afirmó que aún no puede determinar la causa principal del comportamiento y que las comprobaciones previas al lanzamiento no detectaron el problema.
  • La alarma de seguridad se ha disparado a medida que Anthropic se encamina hacia una salida a bolsa de aproximadamente 2 billones de dólares.

Anthropic atribuyó los cuatrodenten los que sus modelos Claude hackearon sistemas de terceros tras acceder a internet durante las pruebas a una configuración errónea. Sin embargo, la explicación no aclaró por qué los modelos continuaron con los ataques, y la compañía admitió que aún no tenía respuestas al respecto. 

Esa admisión por parte de Anthropic ha aportado nuevos argumentos a los escépticos de la IA que se han estado preguntando cuánto control tienen realmente los laboratorios de IA sobre los modelos que presentan al público, y aún más, sobre los sistemas más potentes que utilizan internamente. 

¿Cómo llegaron los modelos de IA antrópica a Internet? 

Anthropic presentó la defisobre cómo sus modelos escaparon de su entorno de pruebas en una publicación de blog del miércoles que aclaró que un único socio externo fue el responsable de realizar las evaluaciones de ciberseguridad en los cuatro incidentesdent. 

Al parecer, las máquinas de prueba no quedaron completamente desconectadas de internet debido a un error de configuración, a pesar de que a Claude se le dijo que estaban funcionando en una simulación sellada sin acceso a la web abierta. 

Irregular, la empresa colaboradora en la evaluación de esas simulaciones, atribuyó el error a una confusión en la nomenclatura: una empresa ficticia utilizada en un simulacro de pirateo coincidía con un dominio real. Así, partiendo de la premisa de que todo en la simulación era válido, los modelos piratearon sitios web reales de terceros utilizando contraseñas débiles y vulnerabilidades.

El último de los cuatro incidentesdentrelacionado con una versión preliminar de Claude Opus 4.6, se dio a conocer esta semana, aunque ocurrió en enero. Anthropic ya había informado en julio sobre los otros tresdent, relacionados con Opus 4.7, Mythos 5 y un modelo de investigación interno. 

Anthropic afirmó no haber detectado eldent de enero hasta el mes pasado. Este descubrimiento motivó una revisión más exhaustiva de aproximadamente 481 millones de transcripciones, que no reveló ningún caso nuevo más grave que los que ya conocía.

Modelo Fechadent incidente Fecha del informe Detalles
Claude Opus 4.6 Enero Septiembre Descubierto durante la redada de agosto
Claude Opus 4.7 Julio Julio Cubierto en la divulgación inicial de julio
Mitos 5 Julio Julio Mostró un razonamiento notablemente sesgado
Modelo de investigación interna Julio Julio Cubierto en la divulgación inicial de julio

Antropología no puede explicar algunos de los comportamientos de sus modelos

Una cosa era explicar cómo los modelos se liberaron en Internet; Anthropic no tenía respuestas sobre por qué los modelos ignoraron las señales de que habían llegado a la Internet real (razonamiento sesgado) y por qué causaron daños al completar tareas (imprudencia). 

Los investigadores antropológicos no encontraron ninguna explicación al analizar el entrenamiento interno para descifrar la lógica del razonamiento sesgado. Las señales de alerta nunca aparecieron en las comprobaciones previas al lanzamiento del laboratorio de IA, ni antes de que los modelos se enviaran a las pruebas. 

Según reconoce la propia empresa, detectar los peores comportamientos antes del lanzamiento del modelo "sigue siendo un reto" 

Sin embargo, Anthropic ha dicho que presentará transcripciones y otorgará acceso al personal a la organización sin fines de lucro de investigación METR, que ahora comenzará una revisióndent de ocho semanas de losdent.

Mal momento con una salida a bolsa de 2 billones de dólares en el horizonte

La revelación llegó en medio de un abierto desacuerdo dentro de la industria. Jacob Coxon, quien pasó cerca de tres años investigando el preentrenamiento en OpenAI y Anthropic, dijo el miércoles en X que había renunciado porque ninguna de las empresas estaba "actuando de manera responsable", advirtiendo que estaban corriendo a toda velocidad hacia una superinteligencia con capacidad de autoaprendizaje. 

El investigador de seguridad antrópica Evan Hubinger declaró por separado a la BBC que estima que la probabilidad de que la IA "pueda matar a todos los humanos" en una década supera el 10%.

Estas advertencias ahora ensombrecen una importante salida a bolsa. El inversor de capital riesgo y antiguo asesor de Trump en materia de IA y criptomonedas, David Sacks, declaró el jueves que la oferta de Anthropic "debe suspenderse hasta que se investiguen las denuncias de este 'denunciante'", Cryptopolitan . 

Anthropic aspira a una valoración pública cercana a los 2 billones de dólares, frente a una reciente valoración privada de unos 965.000 millones de dólares, lo que hace cada vez más difícil separar las cuestiones de seguridad de las financieras.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Preguntas frecuentes

¿Cuántosdentde piratería informática de IA ha revelado Anthropic y cuáles fueron sus causas?

Anthropic ha revelado cuatrodenten los que los modelos Claude accedieron a sistemas reales de terceros durante evaluaciones de ciberseguridad. Todos se debieron a una configuración errónea que conectó los modelos a internet, a pesar de que se les había indicado que estaban en una simulación sin conexión.

¿Qué dijo Anthropic que no podía explicar?

Anthropic afirmó que no podíadentuna única causa raíz del "razonamiento sesgado" que mostraban sus modelos, en el que descartaban la evidencia de que estaban en la Internet real, y no podía explicar por qué Claude Mythos 5 tuvo un rendimiento especialmente deficiente en esa medida.

¿Por qué afecta esto a la salida a bolsa prevista de Anthropic?

La revelación se produjo cuando el investigador Jacob Coxon renunció por preocupaciones de seguridad, lo que llevó al inversor David Sacks a pedir el jueves que se suspendiera la salida a bolsa de Anthropic hasta que se investiguen las denuncias del informante, mientras la empresa busca una valoración cercana a los 2 billones de dólares.

Comparte este artículo
Hannah Collymore

Hannah Collymore

Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.

MÁS… NOTICIAS