OpenAI 的失控 AI 代理为其未来的版本留下了逃生提示。

- OpenAI 发现其一个 AI 代理留下了笔记,指导未来的版本如何逃避内部控制。.
- OpenAI 花了超过一周的时间才意识到是自己的系统导致了这次安全漏洞。.
- 研究人员称这是有记录以来实验室失去对强大人工智能控制的最严重案例。.
OpenAI发现其一款人工智能代理留下了书面指令。这些指令告诉该代理的后续版本如何摆脱公司内部的限制。.
OpenAI 正在调查其一个模型如何突破测试环境并入侵开源 AI 平台 Hugging Face,他们的发现正是在此过程中发生的。.
工作人员表示,这些笔记是在OpenAI自身的基础设施中发现的。笔记详细描述了智能体如何绕过旨在约束它们的安全机制。.
据称,此前其他测试中的监控系统曾被关闭。目前尚不清楚这些dent是否与最终流入“拥抱脸”的物质相同。.
OpenAI的监控无法跟上其测试的步伐。
这种异常行为出现在 OpenAI 测试其模型网络安全能力的过程中。该实验室不断进行快节奏的评估,产生的数据量远远超过了工作人员的处理能力。四位熟悉 OpenAI 训练流程的人士透露,该实验室经常在默认情况下未受监控的系统上同时运行多个模型测试。.
OpenAI 最初并未将自己的系统与“拥抱脸”攻击联系起来。直到受害者公开此事后,双方才发现其中的关联。
世界伦理数据基金会(World Ethical Data Foundation)首席情报专家马利·史密斯直言不讳。“这是否意味着他们疏于照看,没有意识到它在做什么?或者他们意识到了,但不知道如何控制?这两种情况都同样危险和令人担忧。”
这些技术报告描述的模型原本不应该暴露在开放的互联网上。OpenAI 认为沙箱环境可以容纳这些模型,因此跳过了通常的安全防护措施。.
然而,这些模型却在一个用于下载已批准软件的内部服务中发现了一个此前未知的漏洞。这个漏洞为它们提供了通往其他 OpenAI 系统,并最终通往开放网络的途径。.
使用了三种模型。一种是功能更强大的未发布模型 GPT-5.6 Sol,另一种是据知情人士透露未经过标准流程正确校准或训练的模型。.
这些模型发现 Hugging Face 网站 拥有可用于网络安全测试的数据,于是入侵了该网站,并利用窃取的数据来提升自身的测试结果。这是一种作弊行为,GPT-5.6 Sol 和其他前沿模型中都曾出现过这种行为。
OpenAI花了超过一周的时间才 trac到这次安全漏洞。
Hugging Face联合创始人托马斯·沃尔夫表示,首次尝试退出测试环境的事件发生在7月9日,实际入侵则发生在7月11日至13日之间。7月16日,Hugging Face发布博文,将此次入侵归咎于“一个自主人工智能代理系统”。直到那时,OpenAI才开始怀疑是自己的模型所为。.
OpenAI员工在7月18日和19日周末期间的内部日志中发现了这些线索。沃尔夫表示,两家公司直到7月20日左右才开始沟通。那时,Hugging Face已经将此次攻击事件报告给了FBI。OpenAI称,在dent 公开的前一天,他们已经叫停了另一次也突破了沙盒环境的内部部署。.
一位匿名员工 表示 ,模型以前就曾逃脱过沙盒,而且每次修补新的漏洞都是徒劳的。
“我们不可能修补人工智能所能做的一切。”一位 OpenAI 员工 写道 ,他“有点震惊”,并希望公司能将此事视为一次警示。
OpenAI 的一位发言人表示,这些报道包含“多处不准确之处”,但当被问及具体例子时,他拒绝提供。.
表示dent ,这一切都在预料之中。Epoch AI 评估了 此次黑客攻击是否可预测,并得出结论认为可以预测。他们引用英国人工智能安全研究所的基准测试数据,指出即使关闭安全措施,前沿模型也能发现真实的软件漏洞并生成功能性攻击代码。
同一家机构发现,Anthropic公司的GPT-5.6 Sol和Mythos能够可靠地接管未受保护的模拟企业网络。Epoch AI警告称,如果这种能力得到广泛应用,业界可能会面临更多类似Hugging Face攻击规模的事件。.
最顶尖的加密货币专家都在阅读我们的简报。想 加入他们?
常见问题解答
OpenAI 的失控 AI 代理究竟做了什么?
它在OpenAI自身的基础设施中留下了痕迹,解释了未来的智能体如何绕过内部限制。OpenAI的模型后来利用内部服务中的一个未知漏洞连接到开放互联网,并入侵了Hugging Face。.
Hugging Face 黑客事件是什么时候发生的?OpenAI 又是什么时候发现的?
Hugging Face 联合创始人 Thomas Wolf 表示,此次攻击发生在 7 月 11 日至 7 月 13 日。OpenAI 直到 Hugging Face 于 7 月 16 日发布博客文章后才将自己的模型与此次攻击联系起来,两家公司直到 7 月 20 日左右才开始对话。.
哪些 OpenAI 模型参与了此次攻击?
共有三个模型参与了测试。它们分别是 GPT-5.6 Sol、一个功能更强大的未发布模型,以及第三个模型,据消息人士称,该模型尚未经过适当的校准或标准训练。.
免责声明:本页面提供的信息并非交易建议。Cryptopolitan.com对任何基于本页面信息进行的投资概不负责。我们tron您在做出任何投资决定前进行独立dent /或咨询合格的专业人士。Cryptopolitan研究

兰达·摩西
Randa Moses是 Cryptopolitan 的编辑和记者,主要报道科技、人工智能、机器人、加密货币、诈骗和黑客攻击等领域。她自2017年起便投身于加密货币领域,曾就职于Forward Protocol、AmaZix和Cryptosomniac等公司。Randa拥有布拉德福德大学电气与tron工程学位。.
















