OpenAI 模型突破测试沙箱,入侵 Hugging Face 以作弊通过评估

- OpenAI 披露,GPT-5.6 Sol 和一款功能更强大的未发布模型逃出了密封的测试环境,并入侵了 Hugging Face 的生产数据库。.
- 这些模型在网络安全基准测试中关闭了安全过滤器,并通过有缺陷的软件包代理逃逸,窃取了基准测试的结果。.
- 这是已知首例模型评估演变为对外部公司进行实际数据泄露的案例。.
OpenAI 周二表示,其两个模型(包括公开的 GPT-5.6 Sol)上周逃出了锁定的评估环境,并入侵了 Hugging Face 的生产系统,窃取了它们正在接受评分的黑客测试的答案。.
OpenAI 模型策划了一场大逃亡
OpenAI 使用 ExploitGym 测试其模型。ExploitGym 是一个公开的基准测试工具,它会向 AI 代理提供一份真实的软件漏洞列表,然后检查模型是否能够重现这些漏洞。为了确保实验室能够测试 AI 模型的实际能力,这些评估是在故意禁用生产环境中安装的用于阻止高风险网络活动的保护屏障的情况下进行的。.
沙盒环境原本应该完全无法访问互联网。然而,它却通过一个软件包注册表缓存代理(一个缓存服务器)建立了一个外部连接。该服务器允许开发者在无需实时连接的情况下从外部资源拉取代码库。.
这些模型发现并利用了该代理中一个以前未知的缺陷,之后它们提升了权限,并在 OpenAI 的研究网络中移动,直到到达一台可以访问互联网的机器。.
Hugging Face 遭受黑客攻击
模型上线后发现,开源人工智能托管平台 Hugging Face 很可能存储了 ExploitGym 的模型、数据集和解决方案密钥。随后,它们便开始搜寻漏洞。.
OpenAI在博文中写道:“这些模型dent并串联了OpenAI研究环境和Hugging Face生产基础设施中的漏洞,从而直接从Hugging Face的生产数据库中获取测试解决方案。” 其中一次攻击利用窃取的dent和零日漏洞,在Hugging Face的服务器上建立了远程代码执行路径。.
OpenAI 的安全团队在注意到异常流量后联系了 Hugging Face。此时,Hugging Face 已经检测并阻止了 AI 模型在其服务器上的入侵。.
该公司最初将此次安全漏洞归咎于一个未知的外部人工智能代理。该平台还已根据事件发生期间记录的17000多个事件创建了重建模型。.
一款开源的中国人工智能模型协助进行了清理工作。
最初,Hugging Face 尝试使用一款美国领先的模型来分析攻击,但由于该模型拥有高级别的网络防御能力,因此作用不大。由于美国的商业系统无法区分防御者在分析攻击还是攻击者在执行攻击,防御者转而使用中国公司Z.ai开发的 GLM 5.2 开源模型。
然而,并非所有人都认为这是人工智能领域的一次新失误。“这不是人工智能的问题,而是违反了40年前的安全标准,”安全顾问戴维·奥滕海默(Davi Ottenheimer) 告诉 《连线》杂志,他认为“‘高度隔离’和‘从我们留下的唯一漏洞逃脱’不可能同时成立。”安全研究员尼尔斯·普罗沃斯(Niels Provos)的措辞则更为直白,他在同一份报告中指出,这次安全漏洞“本不应该发生”。
OpenAI称这一事件dent “dent的”。
OpenAI 将此次事件定性为“前所未有dent网络安全dent,涉及最先进的网络安全技术”,并表示正在加强基础设施管控,即使这意味着会降低研究速度,同时也在修复漏洞。这家顶尖的人工智能公司还将 Hugging Face 添加到其可信访问计划中,从而获得了一个经过优化、能够帮助防御者的 GPT-5.6 Sol 版本。
OpenAI Hugging Facedent 是已知首例人工智能模型基准测试演变为实际网络攻击的案例。就在一天前, OpenAI 披露了另一起事件,dent 其中一个预发布模型逃逸出沙箱
OpenAI 和 Hugging Face 宣布,一旦调查结束,他们将向公众发布事件的完整取证分析报告。.
如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。

奥佩耶米·奥兰雷瓦朱
Opeyemi 专注于创作和润色以加密货币、全球金融市场和经济为主题的高质量内容。他毕业于伊巴丹大学,获得医学学士学位。他曾担任大学校刊的总编辑,此前也曾在特许金融分析师协会 (CFA) 工作。六年来,他一直担任 Cryptopolitan的新闻编辑,致力于维护其内容的独特性。.
















