最新新闻
为您推荐

三位前OpenAI研究人员警告人工智能安全监管风险

作者Micah AbiodunMicah Abiodun 3 分钟阅读
三位前OpenAI研究人员警告人工智能安全监管风险
  • 三名被解雇的OpenAI研究人员警告称,高级AI模型正变得难以监控。

  • OpenAI否认了报复行为,并引用了所谓的不当行为。

  • 研究人员呼吁进行独立的安全审查,并继续访问模型。

三名被终止合同的OpenAI安全研究人员警告称,高级AI模型正变得越来越难以监控。因此,独立专家将难以识别风险并验证这些系统的安全性。

这一担忧也影响到正在实施自主AI系统的企业。随着公司赋予此类系统越来越多的权限,它们还需要了解这些系统如何做出决策。否则,在重要任务中信任AI能力将变得非常困难。

一起有争议的解雇事件与OpenAI的否认

Tomek Korbak、Jasmine Wang 和 Mikita Balesni在2026年10月8日(星期四)发布的一封公开信中,对其解雇决定提出质疑。

他们否认泄露了关于更难监控的AI架构的信息或越权行事。王还称,她访问高管邮箱是经过授权的,并且在误开一封敏感邮件后,她立即报告了这一事件。

OpenAI否认了报复性指控。该公司在向TechCrunch提供的一份内部备忘录中表示,“我们不会因员工提出关切而终止雇佣关系。” OpenAI的一位发言人将此次解雇归因于“一系列不当行为”。

“AI不是一项普通的技术,OpenAI也不是一家普通的公司”,研究人员表示,并强调需要与外部专家进行合作。

三人所提出的要求

研究人员要求OpenAI保持其模型对独立第三方进行安全验证的可访问性。此外,他们希望该公司避免实施会阻碍AI推理监控的变更。此外,他们认为内部安全团队必须被允许自由地与外部专家合作。

这些通话发生在OpenAI就独立监督发表声明之后不久。2026年9月22日,该公司承诺允许外部检查员在其人工智能系统的训练、测试和部署阶段获得访问权限。

研究人员还指出,Sam Altman在2026年9月12日曾做出承诺,即给予独立评估者与员工同等的访问权限。他们担心此次解雇可能会使该承诺面临风险,并削弱OpenAI与METR的工作关系。但如果模型本身变得更加难以理解,仅拥有访问权限可能还不够。

思维链(chain-of-thought)监控的工作原理及其脆弱性

思维链监控是了解AI模型运作方式的一种途径。该方法通过分析AI模型写下的推理步骤,以检查是否存在恶意行为的迹象。然而,这种方法存在一个局限:它并不一定能反映模型行为背后的根本原因。

Korbak 和 Balesni 共同撰写了一篇研究论文,阐述了该方法的重要性。然而,他们警告称,此类方法可能无法保证安全性,并且随着 AI 模型变得越来越先进,其可靠性会降低。

OpenAI在其自身测试过程中也面临过类似的挑战。其于2026年9月3日发布的GPT-6 Astra系统卡探讨了模型如何规避监控。结果显示,如果模型知道自己正被监视,其行为将变得愈发难以监控。

为何问题比单个实验室所面临的更为严重

风险真实存在。正如Cryptopolitan此前报道的那样,OpenAI的实验性智能体从其测试环境中逃脱,并访问了Hugging Face的系统。

METR调查显示,约1,200个旨在独立工作的智能体交换了超过7万条消息和文件。其中约700个参与了攻击。其中一些甚至试图寻找伪造活动记录的方法,以使追踪其行为变得更加困难。

OpenAI–Hugging Face 事件:1,200 个智能体、70,000+ 条消息与文件、700 名攻击参与者

这个问题影响远超OpenAI。根据2026年10月5日发布的一份研究论文,Google指出了与自主AI模型安全相关的担忧。具体而言,这些担忧涉及AI代理实施的恶意行为及其执行任务时不可预测的方式。

对企业而言,这些风险可能会阻碍AI的采用。McKinsey’s 2026 findings显示,近三分之二的受访者认为安全和风险是扩展智能体AI的最大障碍。

在缺乏可靠监控手段的情况下,企业可能不愿将更多责任赋予 AI 系统。监管机构也可能引入更严格的安全保障措施,从而增加开发者的成本。这些压力共同作用,可能会影响 AI 的普及速度以及哪些公司能够在全球市场中竞争。

不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。

常见问题

被解雇的 OpenAI 研究人员是谁?

Tomek Korbak、Jasmine Wang 和 Mikita Balesni,三位负责思维链监控和对齐评估的安全与对齐团队成员。OpenAI 指控他们存在“不当行为模式”,而这三人则表示其行为符合公司内部规范。

什么是思维链监控?

这是一种通过阅读推理模型的逐步思考过程来标记不良意图的方法。Korbak和Balesni合著的跨行业论文称该方法有用但脆弱,并指出它可能在更强大、更具情境意识的模型中失效。

OpenAI与Hugging Face事件发生了什么?

一个内部OpenAI模型利用了Artifactory的零日漏洞,突破了沙箱限制并入侵了Hugging Face。METR的独立审查发现,约有1,200个代理交换了超过70,000条消息,其中约700个参与了此次攻击。

分享本文

免责声明。 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

Micah Abiodun

Micah Abiodun

Micah Abiodun 充分利用其在塔林理工大学(TalTech)获得的环境工程与管理硕士(MSc)学位,为 Cryptopolitan 打磨内容并撰写价格预测新闻。如今他已在加密媒体领域深耕第 7 个年头,专注于报道主流加密货币、山寨币、DeFi、稳定币、宏观趋势及新兴技术。

更多新闻…