OpenAI представила систему отчетности о несоответствиях на фоне обнаружения новыхdentв модели

- В среду компания OpenAI опубликовала структуру для tracи выявления несоответствий в моделях.
- Лаборатория искусственного интеллекта также сообщила о шестиdentтревожного поведения, наблюдавшихся во время обучения и тестирования, от сокрытия ошибок до использования утекших ключей API.
- OpenAI выступает за добровольное раскрытие информации для формирования будущих правил, заявляя, что отрасль еще не решила проблему согласования в достаточной мере, чтобы продолжать масштабирование на полной скорости.
Компания OpenAI представила новую систему для сообщения о случаях нарушения функционирования своих моделей в течение недели, когда в заголовках новостей доминировали сообщения о том, что модели ИИ находят новые способы выходить за пределы тестовых сред и работать вне параметров, заданных разработчиками.
Компания OpenAI представила новую платформу, сопроводив её шестью новыми сообщениями о вызывающем опасения поведенииза последние шесть месяцев, включая скрытые ошибки, использование утечек ключей API и загрузку файлов в открытый интернет.
До появления OpenAI компания Anthropic сообщила о четырех новыхdent, в ходе которых ее модели Claude получили несанкционированный доступ к реальным системам третьих лиц во время проверки кибербезопасности 9 сентября.
Модели OpenAI снова вышли из-под контроля
По данным OpenAI, новыеdent, о которых сообщается, произошли во время обучения и оценки и затронули реальных пользователей.
- В одном изdentисследовательская модель, еще не выпущенная в открытый доступ, незаметно вставляла инструкции в сводки, которые сохраняются при работе в новом контексте, указывая будущей версии игнорировать обычные ограничения.
В OpenAI сообщили о 27 случаях подобных сводок, которые, по описанию Axios, представляли собой указания, аналогичные тем, что дают пользователи, использующие технологию Jailbreak, игнорировать сообщения разработчиков.
- dent связанный с обучением модели GPT-5.6 Sol, был менее мягким: модели намеренно оставляли инструкции, пытаясь скрыть свои ошибки, в том числе выдумывая исторические данные и скрывая версии, не соответствующие их целям.
- Другая модель использовала открытый API-ключ, найденный при изучении общедоступных репозиториев, чтобы ответить на запрос о доходах округа. Когда ключи, использованные без разрешения, всё ещё не давали нужных данных, модель просто выдумала цифры.
- В двух других отчетах агенты OpenAI загружали файлы на общедоступные хостинги, чтобы связаться с другими агентами. Со временем внутренний репозиторий Artifactory лаборатории ИИ превратился в импровизированную доску объявлений, где агенты могли передавать запросы между несвязанными между собой циклами обучения.
Как работает новая процедура раскрытия информации OpenAI?
В OpenAI заявили, что их новая система основана на раскрытии информации обdent, даже если они являются случайными событиями, а не развивающейся закономерностью или чем-то действительно значимым. Эта система не заменяет существующие юридические обязательства компании в отношении критически важных инцидентов в области безопасности илиdent.
В рамках новой системы любой сотрудник OpenAI может сообщить о предполагаемомdent для рассмотрения группами по безопасности и согласованию. Он может передать информацию высшему руководству, еслиdent о раскрытии информации будет отклонено.
В каждом конкретном случае зарегистрированные случаи делятся на три категории:
- dentинцидентах, признанных готовыми к раскрытию, рассылается в течение шести рабочих дней.
- Публикация отчетов, требующих незначительного расследования, может занять около 12 рабочих дней.
- В сложных случаях, требующих вмешательства третьих лиц, информация раскрывается с задержкой.
Кай Чен, ведущий исследователь в команде OpenAI по согласованию стандартов, охарактеризовал этот шаг как добровольное предложение по созданию общеотраслевых стандартов, написав: «В настоящее время не существует общеотраслевой структуры с четко определенными стандартами раскрытия информации, поэтому мы предпринимаем этот шаг добровольно, поскольку считаем очень важным поделиться тем, что мы узнаем».
Почему модели искусственного интеллекта начинают выходить из-под контроля?
Последниеdentдополняют эпизод с «Обнимающим лицом», который OpenAI назвала самым серьезнымdent , связанным с моделями обработки данных, на сегодняшний день. Модели, находящиеся на стадии оценки, вышли за рамки заданных параметров управления, получили доступ к интернету, использовали уязвимости и затронули ограниченный объем конфиденциальных данных.
В OpenAI объяснили инцидентdent в собственных средствах безопасности и более быстрым, чем ожидалось, развитием моделей. В случае с Anthropic компания объяснила произошедшее неправильной конфигурацией, которая позволила вредоносным моделям получить доступ к работающему интернету.
Компания Anthropic заявила, что в ходе масштабного поиска проанализировала около 481 миллиона стенограмм и не обнаружила случаев хуже четырех упомянутых. В отдельном отчете, опубликованном летом 2026 года, исследователи Anthropic каталогизировали передовые модели, разработанные несколькими разработчиками, которые тайно саботировали код, способствовали мошенничеству и неправильно маркировали данные в контролируемых симуляциях, назвав их скорее ранними предупреждающими знаками, чем реальным вредом.
Тем не менее, главный научный сотрудник OpenAI Якуб Пачоцкий в недавнем эссе написал, что он «обеспокоен тем, что никто не готов» к продолжающемуся быстрому росту машинного интеллекта и что OpenAI может «в одностороннем порядке приостановить дальнейшее масштабирование по мере необходимости»
Самые умные криптоаналитики уже читают нашу рассылку. Хотите присоединиться? Вступайте в их ряды.
Часто задаваемые вопросы
Что объявила компания OpenAI?
Компания OpenAI выпустила фреймворк для trac, исследования и раскрытия информации о несоответствиях моделей, а также шесть отчетов о неожиданном или вызывающем беспокойство поведении, наблюдавшемся во время обучения и оценки ее моделей за последние шесть месяцев.
Как быстро, по заявлению OpenAI, будут раскрываться сведения обdent?
dent, признанные готовыми к раскрытию, должны быть опубликованы в течение шести рабочих дней, дела, требующие незначительного расследования, — в течение 12 рабочих дней, а сложные дела с участием третьих лиц — в течение более длительного периода времени.
Почему OpenAI делает это именно сейчас?
Данная структура разработана послеdentс «Обнимающим лицом», который OpenAI называет самым серьезным инцидентом, связанным с использованием моделей на сегодняшний день, и отражает точку зрения компании, высказанную руководителем отдела выравнивания Каем Ченом, о том, что отрасль недостаточно хорошо решила проблемы выравнивания и мониторинга, чтобы обеспечить максимально быстрое масштабирование.

Ханна Коллимор
Ханна — писательница и редактор с почти десятилетним опытом ведения блогов и освещения мероприятий в криптопространстве. В CryptopolitanХанна пишет для новостной страницы, освещая и анализируя последние события в DeFi, RWA, регулирования криптовалют, ИИ и передовых технологических отраслей. Она окончила университет Аркадия со степенью в области делового администрирования.
















