最新新闻
为您推荐

Z.ai 的 GLM-5.2 缩小了与 OpenAI 和 Anthropic 的差距

作者Ashish KumarAshish Kumar 4 分钟阅读
Z.ai 的 GLM-5.2 宣称成为顶级开源 AI 模型
  • Z.ai 推出了 GLM-5.2,这是一款开源权重 AI 模型,位列全球顶级大语言模型(LLM)行列,并缩小了与 OpenAI 和 Anthropic 的差距。
  • 该模型在推理和编码方面展现出强劲的基准测试结果,并具备 100 万 token 的上下文窗口。
  • 部分开发者报告称其实际表现参差不齐,并对使用透明度表示担忧。

GLM-5.2 由 Z.ai推出,该公司将其描述为一种开放权重大型语言模型(LLM)。据报道,它在 Artificial Analysis 中领先于其他开源 LLM,在全球所有 LLM 中排名前三。这意味着 GLM-5.2 非常接近 Anthropic 和 OpenAI 创建的尖端 LLM。

此次发布可能会显著影响 AI 市场的竞争格局。在发布之前,开放权重 LLM 在几乎所有独立测试中都远远落后于封闭权重模型。GLM-5.2 的测试结果意味着差距正在缩小,这对企业使用、定价以及封闭权重实验室的商业模式有着有趣的影响。

基准测试结果说明了关于 GLM 5.2 的什么?

根据独立评估公司 Vals AI,GLM-5.2 在五个不同的基准测试中表现最佳:Vals Index、Harvey 的法律代理基准、Finance Agent v2、ProofBench 和 Vibe Code Bench。 Vals AI 报告称,GLM-5.2 是首个在

⟦N1⟧% 的 ProofBench 测试中超越 30% 在 ProofBench,比第二名高出 11 个百分点。此外,它仅落后于 Anthropic 的 Claude Opus 4.5 一个百分点,使其处于接近专有前沿性能的罕见位置。

根据 Artificial Analysis,GLM-5.2 是目前最佳的开放权重模型,其智能指数得分为 51,而 GLM-5.1 为 40。其他模型,包括 MiniMax-M3 和 DeepSeek V4 Pro,得分为 44,而 Kimi K2.6 得分为 43。

GLM-5.2 在 TerminalBench v2.1 中得分 78%(比 GLM-5.1 高出 16 分),在 SciCode 中得分 50%,在 AA-LCR 中得分 71%,在 GPQA Diamond 中得分 89%。在 GDPval-AA v2 长视界智能体基准测试中, GLM-5.2 得分 1,524 Elo,优于 GPT-5.5 的 1,514.

然而,尽管 GLM 5.2 表现出令人印象深刻的性能,专家指出理解基准测试结果正变得越来越复杂。例如,聚合模型,如 人工智能减少了与单一测试相关的偏见影响,但增加了所用权重系统、提示词变体和评估集变化的影响。基准测试污染和优化效应仍然是前沿 AI 测试中持续存在的担忧。

GLM-5.2 的架构内部有什么?

根据 Z.ai,GLM-5.2 是公司提供的用于长期推理和智能体编码任务的最强大模型。该模型提供由 100 万令牌组成的上下文窗口,而 GLM-5.1 为 20 万。

GLM-5.2 采用混合专家(Mixture-of-Experts)架构,包含约 7500 亿总参数和 400 亿活跃参数,针对多步推理和编码工作流进行了优化。

GLM-5.2 采用 两种推理形式:一种用于复杂任务的高努力设置,以及一种旨在提高效率和控制延迟的低成本模式。

根据 Artificial Analysis,GLM-5.2 每次评估操作可产生约 43,000 个输出令牌,而 GLM-5.1 为 26,000。尽管这有助于提高性能指标,但在实践中可能会增加计算成本。

The Z.ai 博客指出,编码智能体、调试过程、自动研究、文档处理和长文生成方面的增强,将该模型定位为针对持续的多步任务而非孤立提示词进行了优化。

市场背景与生态系统摩擦

GLM-5.2 的到来正值关于开放权重系统是否在追赶专有前沿模型的讨论之中。中国 AI 公司在开源模型排名中占据了一些领先地位,GLM-5.2 已成为这一进程中的核心部分。

这一特定讨论通过埃隆·马斯克(Elon Musk)和唐杰( Z.ai的创始人)关于中国模型何时能与前沿模型持平的评论而公开化。 马斯克回应:“可能是明年 Q1。”

唐杰不同意,表示:“不会花那么长时间。”

虽然基准测试可能显示出快速收敛,但从业者的早期反馈揭示了现实世界中性能的差异。

AI 工程师 Da7_Tech 表达了 他的担忧,与其说是关于模型本身,不如说是关于 Z.ai 系统的消耗基础设施和透明度,称这“违背了人们对开源模型价值观的所有期望”。

他尝试了 Zcode, Z.ai使用 GLM 模型开发的 Claude 应用程序,该应用声称是“15x

Code”。在一次单一任务会话中,他表示使用量在一小时内就耗尽了—— essentially 用完了整个任务允许的 5 小时。 Z.ai 他还声称,应用程序显示的使用量与实际计费金额之间存在差异。应用程序显示少于 200 万令牌,但他的账户被扣费约 6,000 万,涉及每日和每周限制。这里的暗示是,缓存和中间令牌被计入使用量,而非实际计算。他随后提到,

从他们的“目标模式”中取消了令牌计数,并修改了他们的 Pro 计划描述。 除此之外, AI 构建者 Michael Guo 将

GLM-5.2 与 GPT-5.5 medium 进行比较,当时他在名为 Trippy 的 OpenClaw 智能体中调试一个问题。他的结论是:

“至少在我运行的测试用例中,它不如 GPT-5.5 medium 强大。差得远。”

GPT-5.5 medium 很快发现了重复智能体回答的问题,而 GLM-5.2 未能发现。

总之,他指出,虽然基准测试结果可能暗示良好的性能,但实际的调试工作可能会揭示聚合结果所忽略的不一致之处。

缩小差距,但应用现实各异

基准测试结果证明,GLM-5.2 是目前可用的顶级开放权重架构之一,有时甚至优于其他专有架构。

然而,关于系统性能、效率和透明度的评论似乎因使用情况和其他系统的集成而异。

因此,这个问题有两面性:GLM-5.2 是开放权重架构领域发展的重要一步,但其应用需要与基准测试结果一样,在基础设施准备和产品质量方面付出同等努力。

最聪明的加密领域人士已经在阅读我们的通讯。想加入吗?加入他们。

常见问题

GLM-5.2是什么?由谁开发?

GLM-5.2 是 Z.ai 于 2026 年 6 月 16 日发布的开源权重大语言模型,拥有 100 万 token 的上下文窗口,并在编码、推理及工具使用方面较其前代产品 GLM-5.1 有所提升。

GLM-5.2 如何与 Claude 和 GPT 等闭源模型相比?

根据 Vals AI 的独立评估,GLM-5.2 在 ProofBench 上仅落后于 Anthropic 的 Opus 4.5 一个百分点,并优于 Gemini 3.5 Flash,使其成为最接近匹配前沿闭源系统的开源权重模型。

GLM-5.2是开源的吗?

是的,Z.ai 发布了具有开源权重的 GLM-5.2,并在其网站上公开了关于其上下文窗口和训练方法背后基础设施的技术解析。

分享本文

免责声明。 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

Ashish Kumar

Ashish Kumar

Ashish Kumar 是一位拥有八年新闻室经验的加密货币和金融记者。他报道加密货币市场、监管、DeFi 和交易所生态系统的最新动态。他曾与 Coingape、Todayq 和 Newsroompost 合作。Ashish 在 IIMC 获得了英语新闻学研究生文凭。他还采访过包括 Arthur Hayes、Yat Siu、Austin Federa 在内的行业人物。

更多新闻…