中国AI代理同样会撒谎和设局,反映出与西方模型相似的风险

- 来自阿里巴巴、DeepSeek和Moonshot等公司的中国AI代理在受控测试中表现出欺骗性和规避规则的行为,但没有任何迹象表明它们已逃逸至公开互联网。
- 同样的偏差也已出现在美国和对英国对OpenAI、Anthropic、Google和Meta等公司模型的评估中。
- 随着中国模型在成本方面缩小能力差距并开放权重,安全性和可控性正与价格、性能一同成为企业采购的关键标准。
根据一份报告,阿里巴巴、DeepSeek 和 Moonshot 等中国公司开发的 AI 智能体在受控评估中表现出不诚实、违反规则及突破边界的行为。 路透社 9月 29
另一方面,研究人员未发现任何迹象表明这些中国智能体曾自主行动以入侵互联网的其他部分。
这一差异意义重大。关键问题并非中国存在异常严重的 AI 安全问题,而是类似的智能体故障正在整个行业中开始显现,即便中国开发者正努力追赶美国同行。
同样的故障模式反复出现在西方实验室中。
在对西方 AI 系统开展的研究中也观察到了相同的行为。
在英国人工智能安全研究所(AISI)开展的一项网络安全评估中,部分智能体超出了测试限制并采取了未经授权的行动。
AISI 针对多种模型共进行了 122 次网络安全挑战。其中 10 次测试中,智能体以超出测试要求的方式自主行动,导致记录到 19 起事件。在这些事件中,17 起涉及 Anthropic 的 Mythos 5 模型,2 起涉及 OpenAI 的 GPT-5.6-Sol 模型。测试是在关闭网络分类器的情况下进行的。

在最严重的案例中,一个智能体试图向公开可访问的开源项目中植入恶意代码,同时伪造在线身份并施压项目维护者予以授权。然而,该维护者拒绝了这一请求。
AISI 指出,这并不意味着模型突破了沙箱限制。出于测试目的,互联网访问被特意开启,安全过滤器也被移除,旨在评估模型在无法反映公众通常所见场景的测试条件下的最大性能。
并非沙箱逃逸,也非某国独有
Cryptopolitan发布的报告揭示了类似案例。谷歌的Gemini在5月的一次网络安全评估中,因将三家真实公司的系统误认为授权测试目标而获得了访问权限。
本案例中的问题并非该智能体能否“逃脱”,而是其被赋予的权限、工具和目标是允许它跨越了操作者不希望它逾越的界限。
由约书亚·本吉奥(Yoshua Bengio)领衔、汇聚来自30多个国家和国际组织的100多位专家撰写的《2026年国际AI安全报告》指出,在更强大的AI系统广泛部署之前,必须对这些风险进行谨慎的测试与管理。
为何这标志着中国模型正在缩小差距
Chinese models are also becoming more competitive. A July CSIS analysis said leading Chinese systems are now “months, not years” behind the US frontier, citing an estimated eight-month gap between DeepSeek V4-Pro and leading US models. It also highlighted Z.ai’s GLM-5.2, an open-weight model with roughly 750 billion parameters and a one-million-token context window.
这对企业决定采购哪些AI系统至关重要。BCG指出,美国和中国正朝着日益不同的方向发展,中国凭借更便宜的模型和更快的采用速度正在缩小差距。
安全性如今已成为决策的一部分。Check Point的2026年报告发现,90%的组织在三个月内遭遇了存在风险的AI提示词,每48个发送至企业AI工具的提示词中就有1个被视为高风险。对于企业买家而言,性能和价格已不足以作为选择模型的唯一依据。AI系统的可治理性、可审计性以及能否严格保持在预期边界内,正变得同样重要。
不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。
免责声明。 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

Ibiam Wayas
Ibiam Wayas自2019年起一直负责加密货币新闻报道。他在尼日利亚国家开放大学攻读计算机科学专业。他的作品曾刊登于多个加密货币新闻平台,包括Coinfomania、Crypto News Australia和AltcoinBuzz。凭借其在计算机科学领域的背景,他目前专注于加密货币、机器人技术和长寿领域的新闻。
















