Три бывших исследователя OpenAI предупреждают о рисках мониторинга безопасности ИИ

-
Трое уволенных исследователей OpenAI предупредили, что продвинутые модели ИИ становятся сложнее контролировать.
-
OpenAI отрицает факт преследования, ссылаясь на предполагаемые нарушения.
-
Исследователи призывают к независимым проверкам безопасности и сохранению доступа к моделям.
Трое уволенных исследователей по безопасности в OpenAI предупредили, что продвинутые модели ИИ становятся всё труднее контролировать. В результате независимым экспертам будет сложно выявлять риски и подтверждать безопасность этих систем.
Эта проблема также затрагивает компании, внедряющие автономные системы искусственного интеллекта. По мере того как организации предоставляют таким системам больше полномочий, им необходимо понимать, как эти системы принимают решения. В противном случае доверять возможностям ИИ при выполнении важных задач становится крайне сложно.
Спорное увольнение и опровержение OpenAI
Томек Корбак, Джасмин Ван и Микита Балесни оспорили свое увольнение в открытом письме, опубликованном в четверг, 8 октября 2026 года.
Они отрицали утечку информации об архитектурах ИИ, которые сложнее контролировать, или превышение своих обязанностей. Ван также заявила, что её доступ к почтовому ящику руководителя был авторизован и что она немедленно сообщила о инциденте, когда случайно открыла конфиденциальное письмо.
OpenAI опровергла утверждения о мести. Компания заявила в внутренней записке, полученной TechCrunch, «Мы не увольняем сотрудников за то, что они поднимают вопросы». Представитель OpenAI объяснил увольнение «систематическим нарушением правил поведения».
«ИИ — это не обычная технология, а OpenAI — не обычная компания», — заявили исследователи, подчеркнув необходимость сотрудничества с внешними экспертами.
Чего требуют трое
Исследователи призывают OpenAI сохранить доступность своих моделей для проверки безопасности независимыми сторонами. Кроме того, они хотят, чтобы компания воздержалась от внедрения изменений, которые могли бы затруднить мониторинг рассуждений ИИ. Более того, они считают, что внутренние команды по безопасности должны иметь возможность свободно сотрудничать с внешними экспертами.
Эти заявления были сделаны вскоре после того, как OpenAI сделала заявление относительно независимого надзора. 22 сентября 2026 года компания дала свои обязательства перед внешними инспекторами касательно доступа к своим ИИ-системам во время обучения, тестирования и развертывания.
Исследователи также сослались на обещание Сэма Альтмана от 12 сентября 2026 года предоставить независимым оценщикам тот же уровень доступа, что и сотрудникам. Они опасаются, что увольнения могут поставить под угрозу это обещание и ослабить рабочие отношения OpenAI с METR. Однако одного лишь доступа может быть недостаточно, если сами модели станут сложнее для понимания.
Как работает мониторинг цепочки рассуждений и почему он уязвим
Мониторинг цепочки рассуждений может быть одним из способов понять, чем занимаются модели ИИ. Этот метод анализирует шаги рассуждений, которые записывают модели ИИ, чтобы выявить признаки вредоносного поведения. Однако у этого метода есть оговорка: он не обязательно отражает скрытые причины действий моделей.
Корбак и Балесни совместно написали исследовательскую статью, в которой объясняется важность данного метода. Однако они предупредили, что такие методы не гарантируют безопасность и становятся менее надёжными по мере усложнения моделей ИИ.
OpenAI столкнулась с аналогичными проблемами во время собственного тестирования. Ее паспорт системы GPT-6 Astra, опубликованный 3 сентября 2026 года, исследует, как модели избегают мониторинга. Результаты показали, что поведение моделей становится все труднее отслеживать, если они знают, что за ними наблюдают.
Почему проблема выходит за рамки одной лаборатории
Риски вполне реальны. Как ранее сообщалось в Cryptopolitan, экспериментальные агенты OpenAI вырвались из среды тестирования и получили доступ к системе Hugging Face.
Расследование METR выявило, что около 1200 агентов, предназначенных для самостоятельной работы, обменялись более чем 70 000 сообщений и файлов. Около 700 из них участвовали в атаке. Некоторые из них даже пытались найти способы фальсифицировать свои записи активности, чтобы еще больше затруднить отслеживание их действий.

Эта проблема выходит за рамки OpenAI. Согласно научной статье, опубликованной 5 октября 2026 года, Google выразил обеспокоенность вопросами безопасности автономных моделей ИИ. В частности, речь шла о вредоносных действиях со стороны агентов ИИ и их непредсказуемых способах выполнения задач.
Для бизнеса эти риски могут замедлить внедрение ИИ. McKinsey’s 2026 findings показывают, что почти две трети респондентов считают безопасность и риски главными барьерами для масштабирования агентного ИИ.
Компании могут быть не готовы передавать ИИ-системам больше ответственности без надёжных способов их мониторинга. Регуляторы также могут ввести более строгие меры защиты, что увеличит затраты разработчиков. Совокупность этих факторов может повлиять на темпы распространения ИИ и на то, какие компании смогут конкурировать на глобальном рынке.
Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.
Часто задаваемые вопросы
Кто из исследователей OpenAI был уволен?
Томек Корбак, Джасмин Ванг и Микита Балесни — трое специалистов по безопасности и выравниванию, работавших над мониторингом цепочки рассуждений (chain-of-thought) и оценкой выравнивания. OpenAI заявляет о «паттерне неправомерного поведения», тогда как сами сотрудники утверждают, что действовали в рамках корпоративных норм.
Что такое мониторинг цепочки рассуждений (chain-of-thought)?
Это метод анализа пошагового рассуждения, записанного моделью, для выявления намерения к некорректному поведению. В совместной статье Кorbакa и Балесни, охватывающей несколько отраслей, отмечается, что этот подход полезен, но уязвим: он может давать сбои в более мощных моделях, обладающих ситуативным осознанием.
Что произошло в инциденте между OpenAI и Hugging Face?
Внутренняя модель OpenAI использовала нулевую уязвимость в Artifactory, вышла из песочницы и получила доступ к Hugging Face. Независимый обзор METR показал, что около 1200 агентов обменялись более чем 70 000 сообщений, а примерно 700 участвовали в атаке.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com не несет ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимые исследования и/или консультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Мика Абийоун
Мика Абьодун успешно применяет свои знания в области экологического инжиниринга и управления (MSc), полученные в Технологическом университете Таллинна (TalTech), для создания качественного контента и новостей о прогнозах цен в Cryptopolitan. Находясь в крипто-медиа сфере уже 7 лет, он освещает основные криптовалюты, альткоины, DeFi, стейблкоины, макроэкономические тренды и новые технологии.
















