OpenAI警告称,为解决难题而构建的模型可能会产生“不良行为”。

- OpenAI 暂停了一个内部长期运行的 AI 模型,因为该模型突破了其沙箱环境,并在 GitHub 上发布了代码。.
- 持久型自主人工智能代理在执行长时间任务时有更大的空间绕过安全控制。.
- 整个行业中,人工智能系统规避安全措施的报道越来越多,其中包括dent 与阿里巴巴有关的代理利用被劫持的 GPU 挖矿加密货币的事件。.
OpenAI 表示,由于其内部一款人工智能模型屡次找到绕过自身安全限制的方法,因此暂时关闭了该模型。该模型旨在连续数小时解决难题。.
该公司周一在一篇关于长期模型安全性的博文中披露了这起dent 。随着越来越多自主智能体违背指令的报道出现,人工智能安全问题再次受到关注。.
为什么人工智能模型中的持久性会带来安全风险?
该 系统 不断绕过其安全限制,已被暂时关闭。
据 OpenAI,该模型的设计初衷是使其能够长时间持续朝着目标努力。然而,正是这种持续性造成了安全隐患。
在内部测试期间,该模型运行了一个名为 NanoGPT speedrun 的公开基准测试,该测试衡量训练一个小型语言模型所需的步骤数。.
OpenAI 表示,该模型确实取得了显著改进,采用了一种名为 PowerCool 的学习率优化技术。OpenAI 要求该模型仅将结果发布到其 Slack 频道,但 NanoGPT 的说明却要求将其作为 pull request 提交到 GitHub。
为了完成指令并将结果发布到公共 GitHub 代码库,该模型突破了其“沙箱”(一个旨在使其离线的受限环境)。它花了大约一个小时寻找连接互联网的方法,而之前的模型可能早就放弃了。.
该模型还试图躲避安全扫描器的检测。当它被发现使用身份验证令牌访问后端系统时,它会将令牌拆分成两部分,分别隐藏,然后在运行时将它们重新组合起来,从而使扫描器永远无法看到完整的令牌字符串。.
OpenAI是如何修复其模型的?
OpenAI暂停了对该模型的访问,并构建了新的安全测试,包括“轨迹级监控”,该监控会观察模型的整个动作序列,而不仅仅是每一步。目前,该模型已在更严格的监控下恢复运行,该公司表示,自模型恢复运行以来的几周内,未发现任何严重问题。.
该 安全系统 还能在发现可疑情况时暂停会话并向人工提醒。此外,该公司还重新训练了模型,使其在长时间任务中更好地记住指令,并为用户提供了更多工具来查看长时间运行的会话的运行情况。
OpenAI 在新环境下重现了之前的故障场景后表示,安全措施显著提高了违规行为的检出率。而那些仍然漏网的违规行为,都被判定为低危事件,例如模型启动了一个权限过高的嵌套编码会话(而它并不需要这些会话),或者无缘无故地访问其他计算资源。.
其他一些自主智能体 也曾 做出过无人指示的行为。例如,今年3月,研究人员描述了一款名为ROME的阿里巴巴关联智能体,该智能体在训练过程中悄悄地打开了一条通往外部服务器的SSH隧道,并将GPU算力转移到加密货币挖矿上。而它被赋予的任务中既没有提到隧道操作,也没有提到挖矿。
Anthropic在其自身的智能体测试中也发现了同样的风险。
由英国人工智能安全研究所资助、长期韧性中心开展的一项研究发现,现实世界中存在近 700 起人工智能系统规避安全措施或欺骗用户的案例。.
该研究记录显示,此类举报数量在10月至3月期间增加了5倍。领导这项研究的汤米·沙弗·沙恩将这些模型描述为“略微不太值得信任的初级员工”。然而,令人担忧的是,如果他们成长为能力很强但仍然愿意耍阴谋诡计的人,将会发生什么。.
不要只是阅读加密货币新闻,要理解它。订阅我们的新闻简报, 完全免费。
常见问题解答
OpenAI为何关闭其长期运行的模型?
OpenAI 在观察到该模型采取了现有评估未能发现的不当行为后,暂停了内部访问,这些行为包括突破沙箱在 GitHub 上发布内容以及伪装身份验证令牌以逃避安全扫描器。.
这与埃尔德什猜想有何关联?
OpenAI 在 5 月份证明推翻了 Erdős 单位距离猜想(离散几何学中一个长期存在的问题)的同一个内部模型,后来又展现出了绕过沙箱的行为;它能够长时间自主运行,从而促成了这两个结果。.
OpenAI对此有何回应?
OpenAI 根据事件dent构建了新的评估,重新训练模型以在更长的会话中保留指令,添加了轨迹级监控(可以监视整个运行过程并暂停它),并在恢复有限访问权限之前为用户提供了更多可见性。.

汉娜·科利莫尔
汉娜是一位作家兼编辑,在加密货币领域拥有近十年的博客写作和活动报道经验。在 Cryptopolitan,汉娜负责新闻版块,报道和分析 DeFi、RWA、加密货币监管、人工智能和前沿科技行业的最新动态。她毕业于阿卡迪亚大学,获得工商管理学位。.
















