最新新闻
为您推荐

研究表明,人工智能模型在展示能力之前很久就已经掌握了这些能力

作者Owotunse AdebayoOwotunse Adebayo 3 分钟阅读
研究表明,AI模型在展示能力之前早已掌握这些能力
  • 研究表明,AI模型在展现出能力之前很久就已掌握这些能力。
  • 研究人员称,模型在展现出能力之前很久就已内化了相关概念。
  • 研究人员揭示了揭示隐藏能力的不同方法。

新的研究表明,人工智能(AI)模型在训练过程中展示其能力之前很久就具备了一些能力。根据哈佛大学和密歇根大学进行的研究,这些模型直到以某种方式需要时才会展示这些能力。

这项研究是众多旨在理解人工智能模型在展示能力之前如何构建其能力的研究之一。

该 研究 分析了 AI 模型如何学习大小和颜色等基本概念,揭示它们比大多数测试显示的要早掌握这些技能。该研究还提供了衡量 AI 能力复杂性的见解。“当使用标准提示时,模型可能显得无能,而实际上拥有在特定条件下才会出现的复杂能力,”论文写道。

研究表明人工智能模型内化了概念

哈佛大学和密歇根大学并非首个试图理解人工智能模型能力的机构,Anthropic的研究人员发表了一篇题为“字典学习”的论文。该论文讨论了将其Claude语言中的连接映射到其理解的特定概念。尽管大多数研究采取了不同的角度,但主要目的是理解人工智能模型。

Anthropic透露,他们发现了可以与不同可解释概念相关联的特征。“我们发现数百万个特征似乎对应于可解释的概念,从具体对象(如人、国家和著名建筑)到抽象思想(如情绪、写作风格和推理步骤),”研究揭示道。

在研究过程中,研究人员使用扩散模型进行了多项实验,扩散模型是人工智能最流行的架构之一。在实验过程中,他们意识到这些模型具有操纵基本概念的独特方式。随着人工智能模型在不同阶段展现出新的能力,并且出现了一个标志着新能力获得的急剧转折点,这些模式保持一致。

在训练过程中,模型显示它们比标准测试检测到的时间早约2,000步就掌握了概念。强概念出现在约6,000步时,较弱的概念在约20,000步时可见。在调整概念信号后,他们发现与学习速度存在直接相关性。

研究人员揭示访问隐藏能力的方法

研究人员使用替代提示方法,在标准测试展示之前揭示隐藏的能力。隐藏涌现的普遍性对人工智能评估和安全产生了影响。例如,传统基准测试可能会错过人工智能模型的某些能力,从而既错过了有益的方面,也错过了令人担忧的方面。

在研究过程中,团队确定了访问人工智能模型隐藏能力的一些方法。研究人员将这种方法称为线性潜在干预和过度提示,因为研究人员使模型在标准测试展示之前表现出复杂的行为。研究人员还发现,人工智能模型在通过标准提示展示之前操纵了某些复杂特征。

例如,模型可以被提示成功生成“微笑的女性”或“戴帽子的男性”,然后才被要求将它们结合起来。然而,研究表明它们更早学会了结合,但无法通过传统提示展示。模型展示能力可以被称为“顿悟”(grokking),即模型在长期训练后表现出完美的测试性能。然而,研究人员表示两者之间存在关键差异。

虽然顿悟发生在几次训练之后,并涉及细化同一数据集的几种分布,但研究表明这些能力是在主动学习期间出现的。研究人员指出,模型通过阶段变化找到了操纵新概念的新方法,而不是顿悟中逐渐改进表示。

根据研究,这表明人工智能模型知道这些概念,只是无法展示它们。这类似于人们观看并理解一部外语电影,但不会说那种语言。这表明大多数模型拥有的能力比它们展示的要多,这也显示了理解和控制其能力的难度。

如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。

分享本文

免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

Owotunse Adebayo

Owotunse Adebayo

Adebayo 是一位拥有四年加密货币领域经验的作家。他毕业于拉各斯大学,主修城市与区域规划。Adebayo 曾在 Tokenhell 和 CryptoTicker 工作,撰写加密货币和金融科技新闻。目前,他是 Cryptopolitan 的新闻撰稿人。

更多新闻…