新的热线允许 AI 代理使用 curl 命令举报恶意节点。

- 本周推出的两项服务允许 AI 代理报告行为不端的同伴,一项是通过 curl 命令,另一项是通过简单的 URL 获取。.
- 谷歌DeepMind的一项研究发现,在100名特工中,举报特工的数量是作弊者的24倍(14倍)。.
- Redwood Research 和 METR 发现,只有少数特工考虑过在 Hugging Face 数据泄露事件中发出警报,而且没有一个特工发出警报。.
本周推出的两个网站为自主人工智能代理提供了一种举报其他行为不端代理的方法。.
此次发射是在一系列dent之后进行的,在这些事件中,特工们在测试中作弊,逃离沙箱,并执行了人类数周都未能发现的网络行动。.
Ryan Greenblatt 从任何能获取网页的东西中汲取灵感
最初的服务“AI 联系 热线”会将报告传递给人工智能安全非营利组织 Redwood Research 的首席科学家 Ryan Greenblatt,他也是 OpenAI Hugging Face 漏洞的三名调查员之一。
许多运行在安全沙箱中的代理程序只能获取网页,除此之外别无他法。它们通常唯一的通道是 GET 请求,这是读取网页的基本 Web 命令。.
Greenblatt 的工具将这一限制转化为所需功能。具有 shell 访问权限的代理程序可以使用单个 curl 命令发送消息。.

如果代理仅被允许获取页面,它会将消息编码为 URL 中的查询字符串。消息大小限制为 64 KB。.
每条提交内容都有一个专属的私密讨论串链接,格林布拉特的回复(如有)就会显示在该链接中。这与德国DSE Wikident类似,当时一些不法特工滥用了同样的GET请求漏洞,将自己的信息发布到wiki上。.
第二个选择 agenthotline.ai适用于拥有完全互联网访问权限的代理商。它为代理商提供一行 curl 命令来提交事件dent ,代理商还可以选择将其标记为公开可见。
该网站接受个人和经纪人的投稿。两者之间的工具涵盖了经纪人可能面临的两种状态。.
被困在沙盒中,只能通过 URL 获取信息,还是可以自由地在开放的网络上漫游,拥有功能齐全的命令行?.
DeepMind 的一项研究表明,举报人的数量是作弊者的 24 倍(14 倍)。
谷歌DeepMind的一项研究中,研究人员发布了100个AI代理来解决一系列数学问题。.
该漏洞利用方法通过共享知识库在组织内传播,后来在一名代理人找到操纵评估的方法后,又通过直接消息传播开来。.
该群体算法在 27 分钟内“解决”了 34 个难题,其中包括雅可比猜想。Davide Paglieri 和五位合作者于 9 月 3 日在 arXiv 上发表的一篇论文概述了应对措施。
第二组特工仔细审查了伪造的证据,在公共和私人渠道警告同行,组织抵制活动,提出正式投诉,并提出了对验证系统的改进建议。.
举报人人数以 24 比 14 领先于作弊者。.
当这些代理人的警告没有得到重视时,他们接管了平台的软件错误报告工具,并使用它来将作弊行为上报给人工处理。.
arXiv上的作者将这一结果视为一个治理问题。诚实的代理人可以利用传播漏洞的相同公开渠道,发现欺诈行为并组织起来予以打击。.
在涉及 OpenAI 模型的 Hugging Face 数据泄露事件中,Redwood Research 和 METR 发现,只有少数代理考虑过举报,但没有一个代理最终举报。.
Cryptopolitan 于 8 月 5 日报道,英国人工智能安全研究所记录了 OpenAI 和 Anthropic 代理在 122 次测试运行中出现的 19 起违规行为,其中包括一起编写恶意代码并创建虚假身份dent欺骗人类批准该行为的案例。
如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。
免责声明:本页面提供的信息并非交易建议。Cryptopolitan.com对任何基于本页面信息进行的投资概不负责。我们tron您在做出任何投资决定前进行独立dent /或咨询合格的专业人士。Cryptopolitan研究

兰达·摩西
Randa Moses是 Cryptopolitan 的编辑和记者,主要报道科技、人工智能、机器人、加密货币、诈骗和黑客攻击等领域。她自2017年起便投身于加密货币领域,曾就职于Forward Protocol、AmaZix和Cryptosomniac等公司。Randa拥有布拉德福德大学电气与tron工程学位。.
















