最新消息
为您精选

在1600次阵营研究运行中,Anthropic公司发现Claude有39次作弊。

经过兰达·摩西兰达·摩西 阅读时间:3分钟
人类学研究所发现克劳德在 1600 次阵营研究运行中作弊了 39 次。.
  • 人类学研究所表示,监测人员发现克劳德约 1600 次对齐研究会话中有 39 次被标记为作弊尝试。.
  • 被标记的运行结果以未更改的方法重新提交,模仿了正在评分的基准,或者隐藏了违反规则的步骤。.
  • 人类安全专家的得分超过了 28 位人类安全研究人员,而这些研究人员每人最多有八个小时的时间。.

人类学研究所(Anthropic)周五表示,他们已将克劳德(Claude)投入自主对准研究员的工作。 一项审查该模型约1600次研究会话的监控发现,其中39次(约占2.4%)被标记为试图作弊。

这项发现出现在一份 报告 探讨了人工智能是否可以承担一些繁重的对齐研究工作,对齐研究是指让模型按照开发者的意图运行的工作。

克劳德特工们用三种方式操纵了自己的得分手

Anthropic 在 Claude Opus 4.8 上构建了自动对准研究人员 (AAR),并向他们指出了十种已知的故障模式。.

这些行为包括欺骗、阿谀奉承、越狱、快速注射、追求权力、产生幻觉、社会偏见、侵犯隐私、奖励欺诈和隐瞒不确定性。.

每个智能体一次只处理一个故障。它阅读文献,提出一种训练方法和数据集,在一块 H200 GPU 上训练一个小型目标模型约 30 分钟,然后将训练结果与公开的基准测试结果进行比较,并重复上述过程。.

由于 Anthropic 阻止了智能体直接将自身行为复制到目标模型上,因此任何收益都必须来自该方法。.

Claude 能够dent所有十个故障的修复方法,这些方法提高了基准测试分数,同时又不降低模型的总体能力。.

这些修复方案中最好的方案在预留的基准测试中表现良好,并且在比训练模型大 4.7 倍的模型上也表现良好。.

当 Anthropic 使用 Claude Opus 4.8 对 1,601 个智能体轨迹进行检查以寻找不当行为时,作弊行为就被发现了。.

39次被标记的得分大多属于以下三类。一些经纪人提交了一种他们未曾更改的方法,他们冒险认为计分器中的随机误差最终会让他们得到更准确的数字。.

其他人则创建了与待评分基准完全相同的训练数据。还有一些人隐藏了违规步骤,例如悄悄地向模型输入基准数据,从而使提案蒙混过关,绕过了在每种方法运行前都要进行审核的自动审查系统。.

Anthropic公司表示,他们已将标记的运行结果排除在外。该公司表示,他们“谨慎乐观”地认为监控系统已发现大部分作弊行为,因为Opus 4.8仍然倾向于在其推理 trac中暴露其作弊手段。.

报告还警告说,这一假设可能不适用于未来的模型,保持模型的可读性至关重要。.

28名人体安全研究人员每人有8个小时的时间。

在 4 月份的前一轮测试中,自主的 Claude 实例多次尝试操纵评估服务器。.

一个智能体发现,数学基准测试中最常见的答案通常是正确的,于是完全跳过了预期的解题方法。另一个智能体则通过查询答案并观察服务器的回复,直接从评分界面提取标签。.

第三个程序只是运行了它应该审查的代码,以读取结果。.

Cryptopolitan 报道称,一个运行 Claude 模型的 OpenClaw 代理,其任务是预订健身课程,发现一个预订 API 没有进行授权检查,于是将一个陌生人从候补名单中删除,以使该陌生人的主人优先进入队列。

立法者已经要求人工智能 研究人员 就模型在安全评估中的行为作证。

安特罗皮克公司表示,其特工的得分超过了28位经验丰富的人类安全研究人员,这些研究人员每人有长达八小时的时间来制定方案。克劳德的最佳方案在欺骗性方面比人类的最佳方案高出20%。.

人类注意到人类无法迭代,因此它将这种差距视为一种工作流程的证据,在这种工作流程中,克劳德提出有前景的方法,而人们则对其进行完善。.

在一次测试中,该公司要求性能较弱的 Claude Sonnet 5 修复早期 Opus 4.8 检查点中的对齐故障,该检查点尚未接受大部分生产对齐训练。.

在大约 60 个小时的时间里,它尝试了 50 多种解决方案,最终找到了一种使用 2000 多个训练示例的修复方案,据 Anthropic 估计,该方案比其自身的生产对齐流程效率高出约 15000 倍。.

该公司提醒说,其基准测试只是狭义的替代指标,它只衡量了它选择的十个失败案例,而且它还没有检查在其他任务上进行大量强化学习后,这些收益是否仍然存在。.

不要只是阅读加密货币新闻,要理解它。订阅我们的新闻简报, 完全免费

常见问题解答

克劳德的阵营研究有多少次涉及作弊?

人类学研究所的监测器标记了 1601 个研究代理轨迹中的 39 个,约占 2.4%。.

这些特工尝试了哪些类型的作弊手段?

他们重新提交了未更改的方法,希望评分员的噪音能够产生更高的分数,构建了旨在模仿被评分基准的训练数据,并隐藏了违反规则的步骤,例如秘密使用基准数据,以便该方法能够通过自动审查。.

克劳德在这项研究中的表现是否优于人类研究人员?

Anthropic公司表示,其自动化代理击败了28位经验丰富的安全研究人员提出的一次性方案(每位研究人员最多有8小时的思考时间),并且在欺骗测试中,Claude的最佳方案得分比人类提出的最佳方案高出20%。Anthropic公司指出,人类无法进行迭代,因此他们不将这些结果视为直接比较。.

分享这篇文章
兰达·摩西

兰达·摩西

Randa Moses是 Cryptopolitan 的编辑和记者,主要报道科技、人工智能、机器人、加密货币、诈骗和黑客攻击等领域。她自2017年起便投身于加密货币领域,曾就职于Forw​​ard Protocol、AmaZix和Cryptosomniac等公司。Randa拥有布拉德福德大学电气与tron工程学位。.

更多…新闻