最新新闻
为您推荐

DeepSeek 推出 mHC 但面临同行评审障碍

作者Enacy MapakameEnacy Mapakame 3 分钟阅读
DeepSeek 推出 mHC,但面临同行评审障碍。
  • DeepSeek 提出了一种在不增加计算力的情况下扩展 AI 的新方法。
  • 研究人员看到了希望,但警告称仍需更多测试。
  • mHC 可能重塑大语言模型的训练方式。

在开发和维持 AI 的成本日益增加以及可用硬件有限的背景下,DeepSeek 提出了一项开发和扩展人工智能(AI)的新计划。

这家中国初创公司认为,它可以在不增加芯片和因此增加功耗的情况下,创建显著更好的 AI 模型。尽管提出的 mHC 概念已引起许多该主题研究人员的广泛关注,但通常认为它仍处于早期阶段。

需要进一步研究来确定该方法在开发更大 AI 系统方面的好处。上周发布了一份详细阐述 mHC 概念的技术论文,由 DeepSeek 创始人兼首席执行官梁文锋共同撰写。

DeepSeek 重新思考网络设计以扩展 AI

这项工作的主要组成部分之一是对信息如何在多层神经网络的不同层之间传输的重新评估。

神经网络中的每一层都将处理过的信息形式传递给模型中的下一层,从而形成所谓的“残差学习网络”(ResNet)。由微软研究院的何恺明等人大约十年前开发,ResNets 为当今许多最先进的 AI 系统提供了基础。

DeepSeek 开发的一个概念是在字节跳动于 2024 年推出 Hyper-Connections 之后创建的。超连接允许信息在网络中通过多条路径传输,而不仅仅是一条主路径,这可以提高学习速度和体验的丰富性。

然而,虽然它们可能有益,但也可能导致有问题的训练情况,即模型经历训练不稳定或完全失败。

根据香港城市大学的宋林奇(音译)的说法,DeepSeek 的研究是对现有思想的进步,是对 DeepSeek 如何看待其他公司工作的延续,而不是从头开始发明新东西。

ResNet 被比作单车道高速公路,而超连接类似于多车道高速公路;然而,宋警告说,没有适当规则的多车道可能导致更多的碰撞。

香港科技大学的郭松教授认为,这篇研究论文可能表明 AI 研究 研究行为的转变。他认为,研究可能不再继续对现有模型的设计进行小修改,而是演变为基于理论结构开发新模型。

研究人员测试 mHC 但提出实际担忧

尽管人们对 mHC 在深度学习中测试取得的最新里程碑感到兴奋,但专家强调研究尚未完成。DeepSeek 提供的测试仅在测试具有 270 亿参数 的模型时使用了四条数据路径。

“实验验证了高达 270 亿参数的模型,但它如何在当今规模大一个数量级的前沿模型上表现?”

郭松教授。

当今可用的 AI 模型更大,通常具有数千亿个参数,而几年前 300 亿参数还是标准。

郭也表达了这些观点,并表示目前尚无法得出结论 mHC 是否能够在 AI 技术的前沿开展工作。他还表示,mHC 运行所需的基础设施可能对于较小的研究机构来说过于先进,对于公司来说在移动设备上使用也不现实。

根据 Cryptopolitan 的报道,DeepSeek 的流行源于其发布了 DeepSeek V3 大型语言模型,随后又在几周后发布了其 DeepSeek-R1 推理模型。

在基准测试中将模型结果与竞争对手进行比较时,尽管仅使用了其他竞争语言模型所用训练数据的一小部分,但两个模型都能够达到或超过竞争对手的结果。

如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。

Enacy Mapakame

Enacy Mapakame

Enacy Mapakame 是一位拥有超过 10 年商业与财经新闻经验的记者。她专注于资本市场及新兴技术领域,涵盖元宇宙、人工智能和加密货币。Enacy 拥有媒体与社会研究荣誉学士学位。

更多新闻…