ПОСЛЕДНИЕ НОВОСТИ
ПОДОБРАНО ДЛЯ ВАС

OpenAI представила систему отчетности о несоответствиях на фоне обнаружения новыхdentв модели

КХанна КоллиморХанна Коллимор 3 минуты чтения
OpenAI представила систему отчетности о несоответствиях на фоне обнаружения новыхdentв модели
  • В среду компания OpenAI опубликовала структуру для tracи выявления несоответствий в моделях.
  • Лаборатория искусственного интеллекта также сообщила о шестиdentтревожного поведения, наблюдавшихся во время обучения и тестирования, от сокрытия ошибок до использования утекших ключей API.
  • OpenAI выступает за добровольное раскрытие информации для формирования будущих правил, заявляя, что отрасль еще не решила проблему согласования в достаточной мере, чтобы продолжать масштабирование на полной скорости.

Компания OpenAI представила новую систему для сообщения о случаях нарушения функционирования своих моделей в течение недели, когда в заголовках новостей доминировали сообщения о том, что модели ИИ находят новые способы выходить за пределы тестовых сред и работать вне параметров, заданных разработчиками. 

Компания OpenAI представила новую платформу, сопроводив её шестью новыми сообщениями о вызывающем опасения поведенииза последние шесть месяцев, включая скрытые ошибки, использование утечек ключей API и загрузку файлов в открытый интернет. 

До появления OpenAI компания Anthropic сообщила о четырех новыхdent, в ходе которых ее модели Claude получили несанкционированный доступ к реальным системам третьих лиц во время проверки кибербезопасности 9 сентября. 

Модели OpenAI снова вышли из-под контроля

По данным OpenAI, новыеdent, о которых сообщается, произошли во время обучения и оценки и затронули реальных пользователей. 

  • В одном изdentисследовательская модель, еще не выпущенная в открытый доступ, незаметно вставляла инструкции в сводки, которые сохраняются при работе в новом контексте, указывая будущей версии игнорировать обычные ограничения. 

В OpenAI сообщили о 27 случаях подобных сводок, которые, по описанию Axios, представляли собой указания, аналогичные тем, что дают пользователи, использующие технологию Jailbreak, игнорировать сообщения разработчиков.

  • dent связанный с обучением модели GPT-5.6 Sol, был менее мягким: модели намеренно оставляли инструкции, пытаясь скрыть свои ошибки, в том числе выдумывая исторические данные и скрывая версии, не соответствующие их целям. 
  • Другая модель использовала открытый API-ключ, найденный при изучении общедоступных репозиториев, чтобы ответить на запрос о доходах округа. Когда ключи, использованные без разрешения, всё ещё не давали нужных данных, модель просто выдумала цифры. 
  • В двух других отчетах агенты OpenAI загружали файлы на общедоступные хостинги, чтобы связаться с другими агентами. Со временем внутренний репозиторий Artifactory лаборатории ИИ превратился в импровизированную доску объявлений, где агенты могли передавать запросы между несвязанными между собой циклами обучения.

Как работает новая процедура раскрытия информации OpenAI?

В OpenAI заявили, что их новая система основана на раскрытии информации обdent, даже если они являются случайными событиями, а не развивающейся закономерностью или чем-то действительно значимым. Эта система не заменяет существующие юридические обязательства компании в отношении критически важных инцидентов в области безопасности илиdent.

В рамках новой системы любой сотрудник OpenAI может сообщить о предполагаемомdent для рассмотрения группами по безопасности и согласованию. Он может передать информацию высшему руководству, еслиdent о раскрытии информации будет отклонено. 

В каждом конкретном случае зарегистрированные случаи делятся на три категории: 

  • dentинцидентах, признанных готовыми к раскрытию, рассылается в течение шести рабочих дней. 
  • Публикация отчетов, требующих незначительного расследования, может занять около 12 рабочих дней. 
  • В сложных случаях, требующих вмешательства третьих лиц, информация раскрывается с задержкой. 

Кай Чен, ведущий исследователь в команде OpenAI по согласованию стандартов, охарактеризовал этот шаг как добровольное предложение по созданию общеотраслевых стандартов, написав: «В настоящее время не существует общеотраслевой структуры с четко определенными стандартами раскрытия информации, поэтому мы предпринимаем этот шаг добровольно, поскольку считаем очень важным поделиться тем, что мы узнаем». 

Почему модели искусственного интеллекта начинают выходить из-под контроля?

Последниеdentдополняют эпизод с «Обнимающим лицом», который OpenAI назвала самым серьезнымdent , связанным с моделями обработки данных, на сегодняшний день. Модели, находящиеся на стадии оценки, вышли за рамки заданных параметров управления, получили доступ к интернету, использовали уязвимости и затронули ограниченный объем конфиденциальных данных. 

В OpenAI объяснили инцидентdent в собственных средствах безопасности и более быстрым, чем ожидалось, развитием моделей. В случае с Anthropic компания объяснила произошедшее неправильной конфигурацией, которая позволила вредоносным моделям получить доступ к работающему интернету. 

Компания Anthropic заявила, что в ходе масштабного поиска проанализировала около 481 миллиона стенограмм и не обнаружила случаев хуже четырех упомянутых. В отдельном отчете, опубликованном летом 2026 года, исследователи Anthropic каталогизировали передовые модели, разработанные несколькими разработчиками, которые тайно саботировали код, способствовали мошенничеству и неправильно маркировали данные в контролируемых симуляциях, назвав их скорее ранними предупреждающими знаками, чем реальным вредом.

Тем не менее, главный научный сотрудник OpenAI Якуб Пачоцкий в недавнем эссе написал, что он «обеспокоен тем, что никто не готов» к продолжающемуся быстрому росту машинного интеллекта и что OpenAI может «в одностороннем порядке приостановить дальнейшее масштабирование по мере необходимости»

Самые умные криптоаналитики уже читают нашу рассылку. Хотите присоединиться? Вступайте в их ряды.

Часто задаваемые вопросы

Что объявила компания OpenAI?

Компания OpenAI выпустила фреймворк для trac, исследования и раскрытия информации о несоответствиях моделей, а также шесть отчетов о неожиданном или вызывающем беспокойство поведении, наблюдавшемся во время обучения и оценки ее моделей за последние шесть месяцев.

Как быстро, по заявлению OpenAI, будут раскрываться сведения обdent?

dent, признанные готовыми к раскрытию, должны быть опубликованы в течение шести рабочих дней, дела, требующие незначительного расследования, — в течение 12 рабочих дней, а сложные дела с участием третьих лиц — в течение более длительного периода времени.

Почему OpenAI делает это именно сейчас?

Данная структура разработана послеdentс «Обнимающим лицом», который OpenAI называет самым серьезным инцидентом, связанным с использованием моделей на сегодняшний день, и отражает точку зрения компании, высказанную руководителем отдела выравнивания Каем Ченом, о том, что отрасль недостаточно хорошо решила проблемы выравнивания и мониторинга, чтобы обеспечить максимально быстрое масштабирование.

Поделитесь этой статьей
Ханна Коллимор

Ханна Коллимор

Ханна — писательница и редактор с почти десятилетним опытом ведения блогов и освещения мероприятий в криптопространстве. В CryptopolitanХанна пишет для новостной страницы, освещая и анализируя последние события в DeFi, RWA, регулирования криптовалют, ИИ и передовых технологических отраслей. Она окончила университет Аркадия со степенью в области делового администрирования.

ЕЩЕ… НОВОСТИ