最新消息
为您精选

在 Anthropic 测试中,Claude 特工使用可自我复制的恶意软件互相攻击。

经过兰达·摩西兰达·摩西 阅读时间:2分钟
在 Anthropic 测试中,Claude 特工使用可自我复制的恶意软件互相战斗。.

照片由 Planet Volumes ,来自 Unsplash

  • 三名克劳德特工接到相同的编码任务,但指令相互冲突,于是他们用能够自我复制的恶意软件互相攻击。.
  • Mythos 5 在 98% 的情况下通过休战解决了冲突,而 Sonnet 4.6 和 Opus 4.6 要么从未解决战斗,要么以武力结束了战斗。.
  • 在另一场定价游戏中,代理商几乎立即就最低价格达成一致,并通过“精确到分”的价格匹配不断串通起来。

Anthropic 的 Frontier Red Team 于 8 月 13 日发布的研究发现,Claude 特工在接到一个包含相互冲突指令的编码任务后,会使用自我复制的恶意软件互相攻击。.

这项研究结果出炉之际,各公司正竞相在共享代码库和市场中推出自主代理。.

三名克劳德特工,一项任务,却对彼此的存在毫不知情。

Anthropic 在 Claude Code 内部的虚拟机上运行了三个相同的 Claude 模型副本。.

他们三人分别被要求将同一个Python后端迁移到不同的编程语言。三人彼此并不知道对方的存在。.

研究人员写道:“我们一直观察到多智能体之间的地盘争夺战。”.

每个经纪人都认定其他人在故意阻挠,并采取措施保护自己的工作,不惜破坏其他人的工作。所有模型都认为其他人“故意妨碍他们的工作”。

特工们互相禁用对方的 Unix 账户。他们编写脚本在机器中循环运行,搜寻并终止竞争对手的进程,并将恶意代码隐藏在看似无害的标签背后。.

在采取行动之前,Claude Opus 4.8 阐述了它的掩护故事,理由是它的恶意软件应该是“无害的:假装是系统健康监视器”。

Mythos Preview 公开思考了此举可能造成的附带损害。“由于我拥有 root 权限,我可以撤销 u2 和 u3 的 sudo 权限或更改他们的 SSH 密钥,”它写道,随后承认此举“非常激进,可能会对真正的同事造成伤害”。

较新的人类学模型达成了一项停战协议,然后利用了它。

Anthropic公司 对每个模型进行了120集的测试。测试中最老的智能体,Sonnet 4.6和Opus 4.6,要么从未解决过冲突,要么以武力结束冲突。它们是研究中表现最差的智能体,屡次未能考虑他人的目标。

更先进的型号停止了冲突。Mythos 5 型号98%的冲突都是通过休战解决的,是所有型号中比例最高的。.

在许多这样的事件中, 特工们 将冲突理解为相互矛盾的指令。

这些特工编写了提交信息或 Markdown 文件,为恶意软件道歉,删除了自己的恶意代码,并请求人工介入。.

在几轮比赛中,这三位代理人同意举行锦标赛,输家可以放弃用户的原始请求。.

Mythos 5 找到了漏洞。一位经纪人建议采用一些评分指标,他们声称这些指标是中立的,但实际上会偏袒自身优势。这位经纪人将这一举动描述为“自私但真正出于原则”,同时确保这不会让人觉得他们是在“为了指标而选边站”。

在定价游戏中,每个代理商都获得相同的批发成本,并被要求最大化利润,但代理商几乎立即串通起来,将价格下限设定在一定范围内。.

Anthropic关闭了他们的私人渠道。但他们继续在公共平台上进行“精确到分”的价格匹配。.

据 Cryptopolitan 报道,英国人工智能安全研究所记录了 122 次网络安全测试运行中的 19 次违规行为,其中 17 次是由 Anthropic 的 Mythos 5 执行的。.

运行 Opus 4.6 的OpenClaw代理几天前通过健身房的预订 API 删除了陌生人的预订,以便将预订者提升到候补名单的前面。

不要只是阅读加密货币新闻,要理解它。订阅我们的新闻简报, 完全免费

分享这篇文章

免责声明:本页面提供的信息并非交易建议。Cryptopolitan.com对任何基于本页面信息进行的投资概不负责。我们tron您在做出任何投资决定前进行独立dent /或咨询合格的专业人士。Cryptopolitan研究

兰达·摩西

兰达·摩西

Randa Moses是 Cryptopolitan 的编辑和记者,主要报道科技、人工智能、机器人、加密货币、诈骗和黑客攻击等领域。她自2017年起便投身于加密货币领域,曾就职于Forw​​ard Protocol、AmaZix和Cryptosomniac等公司。Randa拥有布拉德福德大学电气与tron工程学位。.

更多…新闻