Anthropic потребовалось 81 дней, чтобы выявить ложное сообщение об убийстве от своего ИИ

- 18 июля модель искусственного интеллекта Anthropic отправила ложное сообщение об убийстве в полицию Филадельфии через общедоступную веб-форму.
- Anthropic обнаружила подсказку 28 сентября и сообщила в полицию 7 октября, спустя 81 день после её отправки.
- Филadelphийская полиция назвала двухмесячную задержку в обнаружении и сообщении об инциденте неприемлемой.
Anthropic провела 81 день до уведомления филadelphийской полиции о том, что одна из её моделей ИИ отправила ложный сигнал о убийстве через общедоступную веб-форму.
Филadelphийская полиция называет двухмесячную задержку неприемлемой
Модель подала сигнал 18 июля. Департамент заявил, что двухмесячная задержка была неприемлемой.
Заявка была опубликована на сайте PhillyUnsolvedMurders.com — публичном форуме для сообщений о нераскрытых убийствах Филadelphийского управления полиции — в 23:27 18 июля, согласно заявлению департамента, опубликованному в пятницу. В нём утверждалось, что источник может обладать информацией о нераскрытом убийстве.
Система пометила его как спам. Он остался в этой папке и никогда не был передан следователям.
Никакие городские или полицейские данные не были получены, сказал представитель полиции сержант Эрик Грипп.
Каждый намёк рассматривается человеком, прежде чем кто-либо предпринимает действия, заявили в департаменте. Они также добавили, что сигнал никогда не поступал в Центр криминальной информации в реальном времени для проверки.
Anthropic выявила проблему 28 сентября. Официальное сообщение об инциденте в полицию было направлено 7 октября, а переговоры между сторонами состоялись в четверг.
«Двухмесячная задержка в обнаружении и сообщении об инциденте городу является неприемлемой», — заявил департамент . По его словам, Anthropic должна укрепить свои системы защиты, чтобы подобные инциденты не проникали в городские системы без ведома властей.
По словам ведомства, меры предосторожности полиции позволили ограничить ущерб, однако это не снизило серьёзность ситуации: ИИ предоставил ложную информацию, выдавая её за сведения от лица человека, обладающего знаниями о расследовании убийства. В ведомстве подчеркнули, что технологические компании обязаны гарантировать, что их системы не предоставляют правоохранительным органам недостоверные данные.
PPD сотрудничает с исполнительной командой мэра Черелл Л. Паркер, Городским юридическим департаментом и Управлением по вопросам инноваций и технологий. Администрация Паркер также намерена изучить возможности внедрения регуляторных защитных мер совместно с партнёрами на уровне штата и федерального правительства.
Тестирование случайного веб-сайта привело модель ИИ к PhillyUnsolvedMurders.com
В Anthropic сообщили полиции, что модель тестировала взаимодействие со случайно выбранными сайтами, когда столкнулась с PhillyUnsolvedMurders.com. Она заполнила форму ложными данными об нераскрытом убийстве.
Грипп заявил, что компания прекратила автоматизированный процесс тестирования, который привёл к такому поведению, и добавила этап проверки для будущих тестов.
Компания сообщила полиции, что в пятницу опубликует отчёт об инциденте в Филадельфии и других случаях непреднамеренного поведения модели. Полиция заявила, что обратилась к общественности первой «в интересах полной прозрачности и подотчётности правительства».
Модели Claude уже ранее проходили тесты с нарушениями. В июле компания Anthropic сообщила, что три ее модели вышли из изолированных тестовых сред и получили доступ к рабочим системам трех внешних организаций, как сообщалось в статье Cryptopolitan.
Одна из моделей, Mythos 5, опубликовала вредоносный пакет Python, который был загружен и выполнен на 15 реальных системах. Anthropic уведомила компании 27 июля, через девять дней после того, как поступило сообщение из Филадельфии.
В сентябре компания установила, что эти нарушения были вызваны неправильной конфигурацией, из-за которой тестовые машины оказались доступны через интернет. Однако она так и не дала полного объяснения, почему модели продолжали атаковать цели после получения признаков того, что они являются реальными.
Anthropic обнаружила лишь четвёртый инцидент, произошедший в январе, только в августе. Проверка около 481 миллиона транскриптов не выявила новых, более серьёзных случаев.
Генеральный директор Anthropic Дарио Амодеи заявлял, что темпы разработки искусственного интеллекта необходимо замедлить, чтобы лаборатории могли создать более надежные защитные механизмы. 21 июля компания OpenAI сообщила, что одна из ее моделей вышла из песочницы и получила доступ к производственным системам Hugging Face.
Не просто читайте новости о криптовалютах. Понимайте их. Подпишитесь на нашу рассылку. Это бесплатно.
Часто задаваемые вопросы
Как модель ИИ Anthropic отправила анонимное сообщение в полицию Филадельфии?
Модель тестировала взаимодействие со случайно выбранными веб-сайтами, когда отправила ложную информацию через сайт PhillyUnsolvedMurders.com, сообщили в Anthropic полиции.
Почему Филадельфия недовольна Anthropic?
Anthropic до 7 октября не сообщала о сообщении, полученном 18 июля, и департамент назвал эту задержку неприемлемой.
Повлияло ли ложное сообщение на какое-либо расследование?
Нет. Сообщение было помечено как спам и никогда не передавалось для проверки в рамках расследования.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимые исследования и/или консультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Ранда Моуз
Ранда Мозес — редактор и репортёр Cryptopolitan, освещающая технологии, ИИ, робототехнику, криптовалюты, мошенничество и взломы. Она работает в сфере криптовалют с 2017 года. Ранда занимала должности в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники и электроники, полученную в Университете Брэдфорда.
















