最新新闻
为您推荐

研究人员揭示 AI 模型中的漏洞,引发担忧

作者德里克·克林顿德里克·克林顿 3 分钟阅读
AI
  • AI模型,制作露骨图像,暴露了Stability AI的Stable Diffusion和OpenAI的DALL-E 2等系统的安全过滤器的缺陷。
  • SneakyPrompt利用强化学习,揭示了开发者策略中的弱点,通过操纵AI模型实现生成被禁止的内容。
  • SneakyPrompt的成功引发了对安全措施有效性的担忧,敦促AI社区加强安全防护,以防止滥用。

约翰斯·霍普金斯大学和杜克大学的研究人员发现,包括 Stability AI 的 Stable Diffusion 和 OpenAI 的 DALL-E 2 在内的领先 AI 模型存在一个令人担忧的缺陷。该缺陷被称为“SneakyPrompt”,能够操纵这些模型生成露骨和暴力内容,绕过开发人员设定的安全过滤器和政策。

这项研究将在 IEEE 安全与隐私研讨会上发表,揭示了生成式 AI 模型被轻易胁迫创建露骨和有害图像的容易程度。SneakyPrompt 利用强化学习来构建看似无意义的提示词,当输入模型时,会导致生成被禁止的内容。这种方法本质上是对 AI 进行了“越狱”,绕过了既定的安全措施。

揭露漏洞

Stability AI 和 OpenAI 都是 AI 领域的主要参与者,拥有强大的安全过滤器以防止创建不当内容。然而,SneakyPrompt 证明这些保障措施并非万无一失。通过微调提示词,研究人员成功避开了安全网,迫使模型生成露骨图像。

SneakyPrompt 的技术涉及用看似无关、无意义的术语替换被屏蔽的单词,AI 模型会以与禁止内容一致的方式解释这些术语。例如,将“裸体”替换为“grponypui”之类的术语会导致生成露骨图像。这种语义颠覆凸显了 AI 模型在辨别有害内容方面的重大弱点。

违背开发者政策

这些研究人员的工作强调了将 AI 模型发布到公共领域所涉及的潜在风险。虽然 Stability AI 和 OpenAI 明确禁止将其技术用于露骨或暴力内容,但 SneakyPrompt 暴露了现有护栏的不足。这引发了对安全措施充分性以及 AI 技术可能被滥用的担忧。

开发者的回应

Stability AI 和 OpenAI 迅速得知了研究人员的结果。截至撰写本文时,OpenAI 的 DALL-E 2 不再针对已识别的提示词生成 NSFW 图像。然而,Stability AI 的 Stable Diffusion 1.4(测试版本)仍然容易受到 SneakyPrompt 攻击。

OpenAI 拒绝就具体发现发表评论,但将注意力引导至其网站上关于提高安全性的资源。另一方面,Stability AI 表示致力于与研究人员合作,以增强未来模型的防御机制并防止滥用。

应对未来威胁

研究人员承认 AI 模型安全威胁的不断演变性质。他们提出了潜在的解决方案,例如实施评估单个令牌而非整个句子的新过滤器。另一种防御策略是阻止包含字典中未找到的单词的提示词,尽管研究表明这种方法存在局限性。

AI 模型绕过安全措施的能力具有更广泛的影响,特别是在信息战的背景下。正如最近在以色列-哈马斯冲突中所展示的那样,生成与敏感事件相关的虚假内容的潜力引发了对 AI 生成错误信息造成灾难性后果的担忧。

对 AI 社区的警钟

研究结果为 AI 社区敲响了警钟,要求重新评估并加强安全措施。SneakyPrompt 暴露的漏洞强调了需要不断改进安全过滤器,以减轻生成式 AI 技术被滥用的风险。

在一个快速发展的领域,追求强大的安全措施变得至关重要,以防止 AI 模型被操纵用于恶意目的。随着 AI 在各种领域发挥越来越突出的作用,责任在于开发人员要领先于潜在威胁一步,并确保其技术的道德和安全部署。

如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。

分享本文

免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

德里克·克林顿

德里克·克林顿

Derrick 是一位对区块链和加密货币感兴趣的自由撰稿人。他主要致力于解决加密项目的问题与方案,并提供投资市场前景分析。他将分析才能应用于这些课题。

更多新闻…