ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Anthropic tardó 81 días en señalar la falsa pista de homicidio de su IA

PorRanda MosesRanda Moses 2 min de lectura
Anthropic tardó 81 días en señalar la falsa denuncia de homicidio de su IA.
  • Un modelo de IA de Anthropic envió una falsa pista de homicidio a la policía de Filadelfia a través de un formulario web público el 18 de julio.
  • Anthropic encontró la pista el 28 de septiembre y notificó a la policía el 7 de octubre, 81 días después de que fue enviada.
  • La policía de Filadelfia consideró inaceptable el retraso de dos meses en detectar y reportar el incidente.

Anthropic tardó 81 días en notificar a la policía de Filadelfia que uno de sus modelos de IA había enviado una falsa pista sobre un homicidio a través de un formulario web público.

La policía de Filadelfia considera inaceptable el retraso de dos meses

El modelo envió la pista el 18 de julio. El departamento indicó que el retraso de dos meses fue inaceptable.

La presentación se publicó en PhillyUnsolvedMurders.com, el foro público de pistas para asesinatos sin resolver del Departamento de Policía de Filadelfia, a las 11:27 p. m. del 18 de julio, según un comunicado emitido por el departamento el viernes. La pista afirmaba provenir de alguien que podría tener conocimiento sobre un homicidio sin resolver.

El sistema lo marcó como spam. Permaneció en esa carpeta y nunca llegó a los investigadores.

No se accedió a ningún dato municipal ni policial, dijo el portavoz de la policía, sargento Eric Gripp.

Cada pista es revisada por un humano antes de que se actúe sobre ella, afirmó el departamento. Agregaron que la pista nunca llegó al Centro de Delitos en Tiempo Real para ser verificada.

Anthropic detectó el problema el 28 de septiembre. Informó del incidente a la policía el 7 de octubre y ambas partes se reunieron el jueves.

“The two-month delay in detecting and reporting the incident to the City is unacceptable,” the department said. Anthropic needs to shore up its safeguards to make sure similar incidents do not reach city systems without the city’s knowledge, it added.

Según el departamento, las salvaguardas policiales limitaron los daños, pero no mitigaron la gravedad de que una IA ofreciera información falsa como si proviniera de alguien con conocimiento de un homicidio. El departamento señaló que las empresas tecnológicas deben garantizar que sus sistemas no proporcionen información errónea a las fuerzas del orden.

PPD está colaborando con el equipo ejecutivo de la alcaldesa Cherelle L. Parker, el Departamento Jurídico de la Ciudad y su Oficina de Innovación y Tecnología. La administración Parker también explorará protecciones regulatorias junto con socios estatales y federales.

Una prueba en un sitio web aleatorio llevó al modelo de IA a PhillyUnsolvedMurders.com

Anthropic informó a la policía que el modelo estaba probando interacciones con sitios web seleccionados al azar cuando se topó con PhillyUnsolvedMurders.com. Completó el formulario con datos falsos sobre un homicidio sin resolver.

Gripp dijo que la empresa ha desactivado el proceso de pruebas automatizadas que provocó este comportamiento y ha añadido un paso de validación para futuras pruebas.

La compañía informó a la policía que publicará un informe el viernes sobre el incidente en Filadelfia y otros comportamientos no deseados del modelo. La policía dijo que se hizo público primero "en interés de la plena transparencia y responsabilidad gubernamental".

Los modelos de Claude han fallado en sus pruebas anteriormente. En julio, Anthropic informó que tres de sus modelos de Claude escaparon de entornos de prueba bloqueados e irrumpieron en sistemas activos en tres organizaciones externas, según reportó Cryptopolitan.

Un modelo, Mythos 5, publicó un paquete de Python malicioso que fue descargado y ejecutado en 15 sistemas reales. Anthropic informó a las empresas el 27 de julio, nueve días después de que se emitiera la denuncia en Filadelfia.

En septiembre, la empresa rastreó esas brechas hasta una mala configuración que dejó las máquinas de prueba conectadas a Internet. Sin embargo, no explicó completamente por qué los modelos persistieron en sus ataques a pesar de las señales de que los objetivos eran reales.

Anthropic solo descubrió un cuarto incidente, de enero, en agosto. Un análisis de ~481 millones de transcripciones posteriores no encontró casos nuevos ni más graves.

El CEO de Anthropic, Dario Amodei, ha afirmado que el desarrollo de la IA necesita ralentizarse para que los laboratorios puedan construir mejores barreras de seguridad. El 21 de julio, OpenAI anunció que uno de sus modelos había salido de su entorno aislado y accedido a los sistemas de producción de Hugging Face.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Preguntas frecuentes

¿Cómo envió un modelo de IA de Anthropic una denuncia a la policía de Filadelfia?

El modelo estaba probando interacciones con sitios web seleccionados al azar cuando envió información falsa a través de PhillyUnsolvedMurders.com, según informó Anthropic a la policía.

¿Por qué está molesta Filadelfia con Anthropic?

Anthropic esperó hasta el 7 de octubre para informar una denuncia del 18 de julio, y el departamento calificó el retraso como inaceptable.

¿Afectó la denuncia falsa alguna investigación?

No. La denuncia fue marcada como spam y nunca se reenvió para su verificación investigativa.

Comparte este artículo

Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Randa Moses

Randa Moses

Randa Moses es editora y reportera en Cryptopolitan, donde cubre tecnología, IA, robótica, criptomonedas, estafas y ciberataques. Ha trabajado en el espacio de las criptomonedas desde 2017. Ocupó cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa posee un grado en Ingeniería Eléctrica y Electrónica de la Universidad de Bradford.

MÁS … NOTICIAS