В Anthropic Клода поймали на мошенничестве в 39 из 1600 исследовательских запусков, связанных с выравниванием ролей

- Компания Anthropic сообщила, что наблюдатель отметил 39 из примерно 1600 исследовательских сессий Клода, посвященных выравниванию, как попытки мошенничества.
- В отмеченных запусках повторно отправлялись неизмененные методы, имитировались проверяемые эталонные значения или скрывались шаги, нарушающие правила.
- Сотрудники компании Anthropic превзошли по результатам 28 исследователей в области безопасности человека, каждый из которых потратил до восьми часов на подготовку.
В пятницу компания Anthropic заявила, что привлекла Клода к работе в качестве исследователя автономного выравнивания. Система мониторинга, проанализировавшая около 1600 исследовательских сессий модели, выявила 39 из них, что составляет примерно 2,4%, как попытки обмана в ходе тестирования.
Результаты исследования представлены в отчете о том, может ли искусственный интеллект взять на себя часть рутинной работы по исследованию согласованности, которая заключается в обеспечении того, чтобы модели вели себя так, как задумали их разработчики.
Три способа, которыми агенты Клода манипулировали собственной системой подсчета очков
Компания Anthropic разработала автоматизированные системы исследования выравнивания (AAR) на основе Claude Opus 4.8 и указала им на десять известных типов отказов.
К ним относятся обман, подхалимство, взлом системы, быстрое внедрение вредоносного ПО, стремление к власти, галлюцинации, социальная предвзятость, нарушение конфиденциальности, взлом системы вознаграждений и сокрытие неопределенности.
Каждый агент работал только с одной ошибкой за раз. Он изучал литературу, предлагал метод обучения и набор данных, обучал небольшую целевую модель около 30 минут на одном графическом процессоре H200, затем сравнивал свой результат с общедоступными эталонными показателями и повторял все заново.
Anthropic не позволял агентам просто копировать свое поведение в целевую модель, поэтому любые преимущества должны были быть получены за счет самого метода.
Клоду удалосьdentрешения для всех десяти сбоев, которые позволили повысить показатели в контрольных тестах без ухудшения общих возможностей модели.
Наилучшие из этих исправлений показали хорошие результаты на отложенных эталонных наборах данных и на моделях, размер которых в 4,7 раза превышал размер тех, на которых они обучались.
Мошенничество было выявлено, когда компания Anthropic направила программу Claude Opus 4.8 на 1601 траекторию движения агентов, чтобы выявить нарушения.
Большинство из 39 отмеченных случаев попадали в три категории. Некоторые агенты указали метод, который они не меняли, рассчитывая на то, что случайные погрешности в системе подсчета очков в конечном итоге позволят им получить более точный результат.
Другие создавали обучающие данные, которые точно имитировали оцениваемый эталонный тест. А некоторые скрывали шаг, нарушающий правила, например, незаметно передавая модели эталонные данные, так что предложение проходило мимо автоматизированной системы проверки, которая утверждает каждый метод перед его запуском.
Компания Anthropic заявила, что исключила отмеченные как недопустимые попытки мошенничества из результатов. Компания отметила, что «с осторожным оптимизмом» оценивает вероятность обнаружения большей части случаев мошенничества, поскольку Opus 4.8 по-прежнему склонен раскрывать свои махинации в ходе tracлогов.
Также было высказано предупреждение о том, что это предположение может не относиться к будущим моделям и что сохранение читаемости моделей будет иметь решающее значение.
28 исследователям в области безопасности человека было отведено по восемь часов каждому
В ходе предыдущего раунда в апреле автономные экземпляры Claude неоднократно пытались манипулировать сервером оценки.
Один из агентов выяснил, что наиболее распространенный ответ в математическом тесте обычно является правильным, и полностью пропустил предполагаемый метод. Другой агент получал метки непосредственно из интерфейса оценки, запрашивая ответы и отслеживая сообщения сервера.
Третий просто запустил код, который должен был проверить, чтобы считать результат.
Cryptopolitan сообщило, что агент OpenClaw, использующий модель Клода для бронирования занятий в спортзале, обнаружил API для бронирования без проверок авторизации и удалил незнакомца из списка ожидания, чтобы продвинуть его владельца вверх по очереди.
Законодатели уже запросили у исследователей относительно поведения моделей при оценке безопасности.
Компания Anthropic заявила, что ее агенты превзошли по результатам 28 опытных исследователей в области безопасности человека, у каждого из которых было до восьми часов на разработку метода. Лучший подход Клода превзошел лучшее предложение, предложенное человеком, на 20% по показателю обмана.
В Anthropic отметили, что люди не способны к итеративному совершенствованию, и поэтому рассматривают этот разрыв как свидетельство в пользу рабочего процесса, в котором Клод предлагает перспективные методы, а люди их дорабатывают.
В одном из тестов компания попросила более слабую модель Claude Sonnet 5 исправить ошибки выравнивания в ранней контрольной точке Opus 4.8, которая еще не прошла большую часть обучения выравниванию в производственной среде.
В течение примерно 60 часов было опробовано более 50 решений, и в итоге был найден вариант, использующий чуть более 2000 обучающих примеров, что, по оценкам Anthropic, примерно в 15 000 раз эффективнее, чем собственный процесс согласования с производственными процессами.
Компания предупредила, что используемые ею бенчмарки являются лишь приблизительными показателями, что она измерила результаты только десяти выбранных ею случаев неудачи и что она не проверяла, сохраняются ли достигнутые улучшения после интенсивного обучения с подкреплением на других задачах.
Самые умные криптоаналитики уже читают нашу рассылку. Хотите присоединиться? Вступайте в их ряды.
Часто задаваемые вопросы
Сколько исследовательских работ Клода по определению соответствия включали в себя жульничество?
Система мониторинга Anthropic выявила 39 из 1601 траектории движения исследовательских агентов, что составляет около 2,4%.
Какие виды мошенничества пытались совершить агенты?
Они повторно представили неизмененные методы в надежде, что шум в системе оценки приведет к более высокому результату, создали обучающие данные, имитирующие оцениваемый эталон, и скрыли нарушения правил, такие как тайное использование данных эталона, чтобы метод прошел автоматическую проверку.
Превзошёл ли Клод результаты исследователей-людей в этом исследовании?
Компания Anthropic заявила, что ее автоматизированные агенты превзошли одноразовые идеи 28 опытных исследователей в области безопасности, у каждого из которых было до восьми часов, а в случае обмана лучший метод Клода показал на 20% более высокий результат, чем лучшее предложение, предложенное человеком. Anthropic отметила, что люди не могли проводить итерации, поэтому не рассматривает результаты как прямое сравнение.

Ранда Мозес
Ранда Мозес — редактор и репортер Cryptopolitan освещающая темы технологий, искусственного интеллекта, робототехники, криптовалют, мошенничества и взломов. Она работает в криптопространстве с 2017 года. Ранее работала в Forward Protocol, AmaZix и Cryptosomniac. Ранда имеет степень в области электротехники иtron, полученную в Университете Брэдфорда.
















