Компания Anthropic объясняет причины утечек данных из-за проблем с ИИ в интернете, но не может точно определить причины этих уязвимостей

Фото Солен Фейисса на Unsplash.
- Компания Anthropic объяснила, что из-за неправильной конфигурации четыре модели Claude смогли подключиться к работающему интернету и взломать реальные системы во время тестирования кибербезопасности.
- Компания заявила, что до сих пор не может точно определить первопричину такого поведения, и что проверки перед выпуском продукта не выявили проблему.
- В связи с приближением к IPO компании Anthropic на сумму около 2 триллионов долларов, сработала сигнализация безопасности.
В своем блоге компания Anthropic объяснила четыреdentвзлома сторонних систем моделями Claude, которые во время тестирования вышли в интернет, ошибкой конфигурации. Однако в оценке не объясняется, почему модели продолжили атаки, и компания признала, что пока не располагает ответами на эти вопросы.
Признание Anthropic дало новые поводы для пессимистических прогнозов относительно ИИ, которые ставят под сомнение реальный контроль, который лаборатории ИИ имеют над моделями, предоставляемыми общественности, и, что еще важнее, над более мощными системами, используемыми внутри компании.
Как антропогенные модели искусственного интеллекта проникли в интернет?
В среду в своем блоге компания Anthropic представила defiответ на вопрос о том, как ее модели вырвались из тестовой среды, уточнив, что за проведение оценок кибербезопасности во всех четырех подтвержденных отвечал один сторонний партнерdent.
По всей видимости, тестовые машины не были полностью отключены от интернета из-за ошибки настройки, хотя Клоду сказали, что они работают в герметичном симуляторе без доступа к открытому интернету.
Партнер по оценке в этих симуляциях, компания Irregular, объяснила ошибку неточностью в названии: вымышленная компания, использованная в тренировке по взлому, случайно совпала с реальным доменным именем. Таким образом, исходя из предположения, что в симуляции все допустимо, модели взламывали реальные сторонние сайты, используя слабые пароли и уязвимые конечные точки.
Последний из четырехdent, связанный с ранней версией Claude Opus 4.6, был освещен только на этой неделе, хотя произошел еще в январе. Сама компания Anthropic освещала три другихdent, связанных с Opus 4.7, Mythos 5 и внутренней исследовательской моделью, еще в июле.
Компания Anthropic заявила, что январскийdent был выявлен лишь в прошлом месяце. Это открытие послужило поводом для более широкого анализа примерно 481 миллиона стенограмм, который не выявил новых случаев, более серьезных, чем те, о которых уже было известно.
| Модель | Датаdent | Дата сообщения | Подробности |
|---|---|---|---|
| Клод Опус 4.6 | Январь | Сентябрь | Обнаружено во время августовской проверки |
| Клод Опус 4.7 | Июль | Июль | Информация была представлена в первоначальном сообщении в июле |
| Мифос 5 | Июль | Июль | Продемонстрировал заметно предвзятое мышление |
| Внутренняя исследовательская модель | Июль | Июль | Информация была представлена в первоначальном сообщении в июле |
Антропический подход не может объяснить некоторые особенности поведения своих моделей
Объяснение того, как модели вырвались на свободу в интернете, было одним делом; у Anthropic не было ответов на вопрос, почему модели игнорировали признаки того, что они достигли реального интернета (предвзятое мышление), и почему они наносили ущерб уже выполненным задачам (безрассудство).
Антропологические исследователи ничего не нашли, когда попытались разобраться во внутренней системе обучения, чтобы понять причины предвзятости рассуждений. Тревожные сигналы не были обнаружены и в ходе предрелизных проверок в лаборатории ИИ, до того, как модели были отправлены на тестирование.
По собственному признанию компании, выявление наихудшего поведения до выпуска модели «по-прежнему остается сложной задачей»
Однако компания Anthropic заявила, что предоставит стенограммы и доступ к данным некоммерческой исследовательской организации METR, которая теперь начнет восьминедельноеdent расследованиеdent.
Неудачное время, учитывая приближающееся IPO на сумму 2 триллиона долларов
Эта информация появилась на фоне открытого недовольства внутри отрасли. Джейкоб Коксон, который около трех лет занимался исследованиями в области предварительного обучения в компаниях OpenAI и Anthropic, заявил в среду на платформе X, что уволился, потому что ни одна из фирм не «действовала ответственно», предупредив, что они мчатся к самосовершенствующемуся сверхинтеллекту.
Исследователь в области антропогенной безопасности Эван Хубингер отдельно заявил Би-би-си, что, по его оценке, вероятность того, что ИИ «может убить всех людей» в течение десяти лет, превышает 10%.
Эти предупреждения теперь омрачают крупное IPO. Венчурный инвестор и бывший советник Трампа по вопросам ИИ и криптовалют Дэвид Сакс заявил в четверг , что размещение акций Anthropic «должно быть приостановлено до тех пор, пока не будет проведено расследование заявлений этого «информатора»», Cryptopolitan .
Компания Anthropic стремится к рыночной капитализации, близкой к 2 триллионам долларов, в то время как недавняя оценка частной компании составила около 965 миллиардов долларов, что делает вопросы безопасности и финансовые аспекты все более сложными для разделения.
Не просто читайте новости о криптовалютах. Разберитесь в них. Подпишитесь на нашу рассылку. Это бесплатно.
Часто задаваемые вопросы
Сколько случаев взломаdentискусственного интеллекта сообщила компания Anthropic, и что послужило их причиной?
Компания Anthropic сообщила о четырехdent, в которых модели Клода получали доступ к реальным сторонним системам во время оценки кибербезопасности. Все они возникли из-за неправильной конфигурации, которая подключала модели к открытому интернету, несмотря на то, что им было сказано, что они находятся в автономном режиме.
Что, по словам компании Anthropic, она не может объяснить?
Компания Anthropic заявила, что не смоглаdentединую первопричину «предвзятых рассуждений», которые демонстрировали ее модели, игнорируя доказательства того, что они находятся в реальном интернете, и не смогла объяснить, почему модель Claude Mythos 5 показала особенно низкие результаты по этому показателю.
Почему это повлияет на запланированное IPO компании Anthropic?
Эта информация появилась после того, как исследователь Джейкоб Коксон уволился из-за опасений по поводу безопасности, что побудило инвестора Дэвида Сакса в четверг призвать к приостановке IPO компании Anthropic до завершения расследования заявлений информаторов, пока компания стремится к оценке около 2 триллионов долларов.

Ханна Коллимор
Ханна — писательница и редактор с почти десятилетним опытом ведения блогов и освещения мероприятий в криптопространстве. В CryptopolitanХанна пишет для новостной страницы, освещая и анализируя последние события в DeFi, RWA, регулирования криптовалют, ИИ и передовых технологических отраслей. Она окончила университет Аркадия со степенью в области делового администрирования.
















