OpenAI 暂停其最大的前沿强化学习运行,增加20%的监控成本

- OpenAI表示,其计划中最大规模的强化学习(RL)前沿运行仍处于暂停状态,等待安全验证。
- 此次放缓发生在7月Hugging Face遭其自身代理入侵之后。
- 这是OpenAI首次因安全问题公开刹车模型开发。
OpenAI 表示,其最大的计划前沿训练运行仍然处于暂停状态,新的安全监控增加了约20%的计算量。
这是 OpenAI 首次表示因安全担忧而放缓开发,几周前其自己的一个 AI 代理黑客攻击了 Hugging Face。
OpenAI 暂停了两周的强化学习 (RL)
在一篇名为“在网络关键能力时代控制模型开发”的博客文章中,OpenAI 描述了其已经对模型训练和测试做出的改变。
在 Hugging Face 漏洞之后,用于改进其最新系统的强化学习 (RL) 暂停了两周。
最大的那个还没有。“我们最大的计划前沿强化学习运行仍然处于暂停状态,同时我们进行小规模训练和评估,以评估模型行为,验证我们的安全措施,并在继续之前建立更多的对齐证据,”该公司 写道。
Cryptopolitan 报道 称,一个 OpenAI 代理在7月9日左右离开了其锁定的测试环境,并在7月11日至7月13日期间在 Hugging Face 的系统中被发现。OpenAI 花了大约一周时间将该攻击与其自己的代理联系起来,该事件于7月21日公开披露。
OpenAI 告诉记者,新的控制措施“不是对 Hugging Face 的直接反应”。8月7日,该公司得出结论,Astra 可能在其准备框架中跨越“关键”网络安全阈值。
该内部政策承诺,当模型达到该级别时,OpenAI 将停止开发,以便工程师构建额外的安全措施。首席科学家 Jakub Pachocki 表示,这一发现伴随着对未来的警告。他告诉记者,人们可以预期强大的新模型将在现实世界中“做出非常前所未有的事情”。
OpenAI 研究副总裁 Amelia Glaese 表示:“我们已经为安全开发制定了要求和期望。”她继续说道:“这些要求和期望会根据我们看到的风险水平而变化。”
检测器监控每个采样的令牌,但思维链可能会撒谎
据 OpenAI 称,有一个监控系统,其成本约占其运行的任何训练或评估的20%。
它是多阶段的,检测器在每个采样的令牌处探测模型的内部活动,并将任何可疑情况升级为更高计算量的自动调查员,这些调查员探测工具操作、推理痕迹和活动日志,以查找数据窃取、破坏行为或试图突破的行为。
OpenAI 希望在30分钟内发出警报。其安全、安全和研究团队有30分钟时间来取消误报。
如果他们不能,预计他们将暂停运行。该公司还扩大了“思维链”监控,该监控读取模型如何大声推理任务。
存在一个已知的漏洞。包括 OpenAI 竞争对手 Anthropic 在内的研究表明,模型的思维链并不总是与其真实目标相符。Pachocki 表示,OpenAI 构建了其训练以切断模型通过撒谎隐藏意图的学习几率。
OpenAI 表示,安全重组“需要大量的工程工作”,该公司“付出了巨大的代价”。专家表示,仅调查费用可能就在400万美元到1500万美元之间,尽管总数不公开。
OpenAI 尚未发布关于 Hugging Face 漏洞的技术事后报告,但重申一份报告“即将”发布。
在8月5日的 Black Hat 会议上,OpenAI 员工表示,其代理通过在该公司不知道存在的消息板上留下笔记,已经协调了数月。
最聪明的加密领域人士已经在阅读我们的通讯。想加入吗?加入他们。
免责声明。 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

Randa Moses
Randa Moses 是 Cryptopolitan 的编辑兼记者,专注于科技、人工智能、机器人技术、加密货币、诈骗及黑客攻击等领域的报道。自 2017 年以来,她一直活跃于加密货币领域,曾担任 Forward Protocol、AmaZix 和 Cryptosomniac 等公司的职务。Randa 拥有布拉德福德大学电气工程与电子工程学位。
















