A Anthropic levou 81 dias para sinalizar a falsa denúncia de homicídio feita por sua IA

- Um modelo de IA da Anthropic enviou uma falsa denúncia de homicídio à polícia de Filadélfia através de um formulário web público em 18 de julho.
- A Anthropic descobriu a dica em 28 de setembro e notificou a polícia em 7 de outubro, 81 dias após o envio.
- A polícia de Filadélfia considerou inaceitável o atraso de dois meses na detecção e notificação do incidente.
A Anthropic levou 81 dias para notificar a polícia de Filadélfia de que um de seus modelos de IA havia enviado uma dica falsa sobre homicídio por meio de um formulário web público.
A polícia de Filadélfia considera o atraso de dois meses inaceitável
O modelo enviou a dica em 18 de julho. O departamento afirmou que o atraso de dois meses foi inaceitável.
A submissão foi postada no PhillyUnsolvedMurders.com, o fórum público de dicas sobre assassinatos não resolvidos do Departamento de Polícia de Filadélfia, às 23h27 de 18 de julho, segundo um comunicado emitido pelo departamento na sexta-feira. A mensagem alegava vir de alguém que poderia ter conhecimento sobre um homicídio não resolvido.
O sistema marcou a mensagem como spam. Ela ficou nessa pasta e nunca chegou aos investigadores.
Nenhum dado da cidade ou da polícia foi acessado, disse o porta-voz da polícia, Sgt. Eric Gripp.
Cada pista é revisada por um humano antes de qualquer ação ser tomada, informou o departamento. A dica nunca foi enviada ao Real-Time Crime Center para ser verificada, acrescentaram.
A Anthropic detetou o problema em 28 de setembro. Ela notificou a polícia em 7 de outubro, e as duas partes se reuniram na quinta-feira.
“The two-month delay in detecting and reporting the incident to the City is unacceptable,” the department said. Anthropic needs to shore up its safeguards to make sure similar incidents do not reach city systems without the city’s knowledge, it added.
Segundo o departamento, as salvaguardas da polícia limitaram os danos, mas não amenizaram a gravidade de uma IA que forneceu informações falsas como se viessem de alguém com conhecimento sobre um homicídio. O departamento afirmou que as empresas de tecnologia precisam garantir que seus sistemas não forneçam informações enganosas às forças policiais.
A PPD está colaborando com a equipe executiva do prefeito Cherelle L. Parker, com o Departamento Jurídico da Cidade e com seu Escritório de Inovação e Tecnologia. A administração Parker também explorará proteções regulatórias junto a parceiros estaduais e federais.
Um teste em um site aleatório levou o modelo de IA ao PhillyUnsolvedMurders.com
A Anthropic informou à polícia que o modelo estava testando interações com sites selecionados aleatoriamente quando encontrou o PhillyUnsolvedMurders.com. Ele preencheu o formulário com dados falsos sobre um homicídio não resolvido.
Gripp disse que a empresa interrompeu o processo de teste automatizado que levou a esse comportamento e adicionou uma etapa de validação para testes futuros.
A empresa informou à polícia que publicará na sexta-feira um relatório sobre o episódio em Filadélfia e outros comportamentos indesejados do modelo. A polícia afirmou que divulgou a informação primeiro "em prol da plena transparência e responsabilidade governamentais."
Os modelos Claude já falharam em seus testes anteriormente. Em julho, a Anthropic informou que três de seus modelos Claude escaparam de ambientes de teste bloqueados e acessaram sistemas reais em três organizações externas, conforme relatado pelo Cryptopolitan.
Um dos modelos, Mythos 5, publicou um pacote Python malicioso que foi baixado e executado em 15 sistemas reais. A Anthropic notificou as empresas em 27 de julho, nove dias após a denúncia em Filadélfia.
Em setembro, a empresa rastreou essas violações até uma configuração incorreta que deixou as máquinas de teste conectadas à internet. No entanto, não explicou completamente por que os modelos persistiram nos ataques após sinais de que os alvos eram reais.
A Anthropic descobriu apenas um quarto incidente, ocorrido em janeiro, em agosto. Uma varredura de aproximadamente 481 milhões de transcrições realizada em seguida não encontrou novos casos mais graves.
O CEO da Anthropic, Dario Amodei, afirmou que o desenvolvimento de IA precisa desacelerar para que os laboratórios possam construir melhores barreiras de segurança. A OpenAI anunciou em 21 de julho que um de seus modelos saiu de sua sandbox e acessou os sistemas de produção do Hugging Face.
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Perguntas Frequentes
Como um modelo de IA da Anthropic enviou uma denúncia à polícia de Filadélfia?
O modelo estava testando interações com sites selecionados aleatoriamente quando submeteu informações falsas por meio do site PhillyUnsolvedMurders.com, informou a Anthropic à polícia.
Por que Filadélfia está insatisfeita com a Anthropic?
A Anthropic aguardou até 7 de outubro para reportar uma denúncia de 18 de julho, e o departamento considerou o atraso inaceitável.
A denúncia falsa afetou alguma investigação?
Não. A denúncia foi classificada como spam e nunca foi encaminhada para análise investigativa.
Aviso. As informações fornecidas não constituem aconselhamento de negociação. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses
Randa Moses é editora e repórter na Cryptopolitan, cobrindo tecnologia, IA, robótica, criptomoedas, golpes e hacks. Ela atua no espaço de criptomoedas desde 2017. Já ocupou cargos na Forward Protocol, AmaZix e Cryptosomniac. Randa possui graduação em Engenharia Elétrica e Eletrônica pela Universidade de Bradford.
















