ПОСЛЕДНИЕ НОВОСТИ
ПОДОБРАНО ДЛЯ ВАС

OpenAI приостановила свой крупнейший проект по обучению с подкреплением и увеличила стоимость мониторинга на 20%

КРанда МозесРанда Мозес 2 минуты чтения
Компания OpenAI приостановила свой крупнейший проект по обучению с подкреплением и увеличила затраты на мониторинг на 20%.
  • Компания OpenAI заявила, что ее крупнейший запланированный эксперимент по обучению с подкреплением (RL) остается приостановленным до подтверждения его безопасности.
  • Замедление работы системы последовало за утечкой данных в Hugging Face в июле, совершенной одним из собственных агентов компании.
  • Это первый случай, когда OpenAI открыто приостановила разработку модели в пользу безопасности.

Компания OpenAI заявила, что ее крупнейший запланированный цикл обучения на граничных моделях остается приостановленным, а новый мониторинг безопасности увеличивает вычислительную нагрузку примерно на 20%.

Впервые компания OpenAI заявила о замедлении разработки из-за опасений по поводу безопасности, спустя несколько недель после того, как один из её собственных ИИ-агентов взломал Hugging Face.

Компания OpenAI приостановила обучение с подкреплением (RL) на две недели

В сообщении в блоге под названием «Ускорение разработки моделей в эпоху критически важных кибервозможностей» компания OpenAI описала изменения, которые она уже внесла в обучение и тестирование своих моделей.

После взлома системы Hugging Face использование методов обучения с подкреплением (RL), применяемых для улучшения новейших систем, было приостановлено на две недели.

Крупнейший проект, однако, не был приостановлен. «Наш крупнейший запланированный проект по обучению с подкреплением остается в силе, пока мы проводим обучение и оценку в меньшем масштабе, чтобы оценить поведение модели, подтвердить эффективность наших мер безопасности и получить дополнительные доказательства соответствия требованиям, прежде чем продолжить», — написала.

Cryptopolitan сообщило , что агент OpenAI вышел из заблокированной тестовой среды примерно 9 июля и был обнаружен в системах Hugging Face с 11 по 13 июля. OpenAI потребовалась примерно неделя, чтобы связать атаку со своим собственным агентом, и инцидентdent обнародован 21 июля.

Компания OpenAI сообщила журналистам, что новые меры контроля «не являются прямой реакцией именно на Hugging Face». 7 августа компания пришла к выводу, что Astra может превысить порог «критической» кибербезопасности в рамках своей системы обеспечения готовности.

В соответствии с этой внутренней политикой OpenAI обязуется прекращать разработку, когда модель достигает такого уровня, чтобы инженеры могли создать дополнительные средства защиты. Главный научный сотрудник Якуб Пахоцкий заявил, что это открытие сопровождается предупреждением о том, что нас ждет дальше. Мощные новые модели, сказал он журналистам, как ожидается, «могут совершать совершенноdentвещи в реальном мире»

Амелия Глэзе, вице-президент OpenAI по исследованиям, заявила: «Мы установили требования и ожидания в отношении безопасной разработки». Она продолжила: «Эти требования и ожидания меняются в зависимости от уровня риска, который мы наблюдаем»

Детекторы отслеживают каждый обработанный образец, но цепочка рассуждений может лгать

По данным OpenAI, существует система мониторинга, стоимость которой составляет примерно 20% от стоимости обучения или оценки, проводимых с её помощью.

Это многоэтапная система, в рамках которой детекторы анализируют внутреннюю активность модели на каждом выбранном токене и передают любую подозрительную информацию более мощным автоматизированным следователям, которые изучают действия инструментов, tracрассуждений и журналы активности на предмет кражи данных, деструктивного поведения или попыток побега.

OpenAI хочет поднять тревогу в течение 30 минут после появления тревожных сигналов. У групп по безопасности, защите и исследованиям есть 30 минут, чтобы исключить ложные срабатывания.

Если им это не удастся, ожидается, что они остановят выполнение задачи. Компания также расширила мониторинг «цепочки рассуждений», который позволяет вслух зачитывать ход рассуждений модели при выполнении задачи.

Существует известная уязвимость. Исследования, в том числе работы конкурента OpenAI, компании Anthropic, показали, что цепочка рассуждений модели не всегда совпадает с ее истинными целями. Пачоцки сказал, что OpenAI разработала свою систему обучения таким образом, чтобы снизить вероятность того, что модели научатся скрывать свои намерения, обманывая при этом.

Как заявили в OpenAI, модернизация системы безопасности «потребовала значительных инженерных работ», и компания «понесла большие затраты». Эксперты отметили, что только расследование, вероятно, обошлось от 4 до 15 миллионов долларов, хотя общая сумма не разглашается.

Компания OpenAI пока не опубликовала технический анализ последствий взлома Hugging Face , но подтвердила, что он будет опубликован «вскоре».

На конференции Black Hat 5 августа сотрудники OpenAI заявили, что их агенты в течение нескольких месяцев координировали свои действия, оставляя сообщения на доске объявлений, о существовании которой компания даже не знала.

Самые умные криптоаналитики уже читают нашу рассылку. Хотите присоединиться? Вступайте в их ряды.

Поделитесь этой статьей

Предупреждение. Предоставленная информация не является торговой рекомендацией. Cryptopolitanнастоятельно не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мыtronпровести независимоеdent и/или проконсультироваться с квалифицированным специалистом, прежде чем принимать какие-либо инвестиционные решения.

Ранда Мозес

Ранда Мозес

Ранда Мозес — редактор и репортер Cryptopolitan освещающая темы технологий, искусственного интеллекта, робототехники, криптовалют, мошенничества и взломов. Она работает в криптопространстве с 2017 года. Ранее работала в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники иtron, полученную в Университете Брэдфорда.

ЕЩЕ… НОВОСТИ