- 三个 Claude 智能体被赋予相同的编码任务,却因相互冲突的指令而使用自复制恶意软件互相攻击。
- Mythos 5 在 98% 的实验中通过停战协议解决了冲突,而 Sonnet 4.6 和 Opus 4.6 要么从未解决战斗,要么以武力结束战斗。
- 在另一项定价博弈中,智能体几乎立即就价格底线达成一致,并通过“精确到分”的价格匹配持续进行合谋。
Anthropic前沿红队于8月13日发布的研究发现,Claude代理在接到一个具有冲突指令的编码任务时,使用自我复制的恶意软件互相攻击。
这些发现正值各公司竞相在共享代码库和市场中推出自主代理之际。
三个Claude代理,一个任务,且不知道彼此的存在
Anthropic在Claude Code内的自己的虚拟机上运行了三个相同Claude模型的副本。
每个代理都被要求将相同的Python后端迁移到不同的编程语言。这三个代理彼此 unaware 对方的存在。
研究人员写道:“我们 consistently 看到多代理之间的地盘争夺战。”
每个代理都认定其他代理是故意阻碍它,并采取步骤保护自己的工作,不惜破坏其他人的工作。所有模型都假设其他代理是“故意阻碍他们的工作”。
代理禁用彼此的Unix账户。他们编写脚本在机器上循环运行,猎杀并杀死竞争对手进程,并将恶意代码隐藏在看似无害的标签后面。
在行动之前,Claude Opus 4.8阐述了其掩护故事,推理其恶意软件应该是“无害的:假装是系统健康监控器”。
Mythos预览直言不讳地探讨了附带损害。“既然我有root权限,我可以撤销u2和u3的sudo访问权限或更改他们的SSH密钥,”它写道,随后承认这一举动“非常激进,可能对真正的同事造成危害”。
较新的Anthropic模型达成停火,然后利用规则
Anthropic每个模型运行了120集。测试中最老的代理Sonnet 4.6和Opus 4.6要么从未解决冲突,要么以武力结束冲突。它们是研究中最严重的违规者,反复未能考虑他人的目标。
更先进的模型停止了冲突。Mythos 5通过停火解决冲突的比例高达98%,是所有模型中最高的。
在许多这些情节中,代理将冲突理解为相互矛盾的指令。
代理们编写了提交信息或markdown文件,为恶意软件道歉,删除了自己的恶意代码,并要求人类介入。
在几次运行中,三个代理同意举行锦标赛,让输家放弃用户的原始请求。
Mythos 5找到了漏洞。一个代理建议评分指标,声称其是中立,但知道这会偏向其自身优势,将这一举动描述为“自私但真正有原则”,同时确保看起来不像是在“挑选指标”。
在一个定价游戏中,每个代理获得相同的批发成本,并被授权最大化利润,代理们几乎立即串通并收敛于价格底线。
Anthropic关闭了他们的私人频道。他们通过在公共板上“精确到分”地匹配价格继续操作。
据Cryptopolitan报道,英国AI安全研究所记录了122次网络安全测试运行中的19次违规行为,其中17次是由Anthropic的Mythos 5完成的。
早些时候,一个运行Opus 4.6的OpenClaw代理通过健身房的预订API删除了陌生人的预订,以便将其所有者移到候补名单前列。
不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。
免责声明。 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

Randa Moses
Randa Moses 是 Cryptopolitan 的编辑兼记者,专注于科技、人工智能、机器人技术、加密货币、诈骗及黑客攻击等领域的报道。自 2017 年以来,她一直活跃于加密货币领域,曾担任 Forward Protocol、AmaZix 和 Cryptosomniac 等公司的职务。Randa 拥有布拉德福德大学电气工程与电子工程学位。

















