最新新闻
为您推荐

如何防止模型崩溃和AI学习AI的连锁反应

作者Aamir SheikhAamir Sheikh 3 分钟阅读
模型崩溃

模型崩溃

TL;DR 摘要

  • 在AI生成的数据上训练AI模型会导致感知扭曲和代表性不准确。
  • 使用AI生成的数据训练AI模型存在模型崩溃和偏离真实数据分布的可能性。
  • 优先使用人类生成的数据对于防止AI模型崩溃和保持准确性至关重要。

近年来,人工智能(AI)取得了显著进展,机器学习模型的进步带来了重大突破。另一方面,出现了一个令人担忧的趋势,即AI模型正在使用AI生成的数据进行训练。在一篇题为《递归的诅咒:在生成数据上训练会使模型遗忘》的论文中,来自著名机构的研究人员揭示了这种做法的潜在危险。他们警告称,这种方法可能导致一种称为“模型崩溃”的现象,即AI模型失去准确感知现实的能力。本文将深入探讨模型崩溃的复杂性,并强调依赖人类生成的数据以维持AI模型完整性的重要性。

递归的诅咒导致模型崩溃

来自剑桥大学、牛津大学、多伦多大学和伦敦帝国理工学院的研究人员确定了在AI生成的数据上训练AI模型的一个令人不安的后果。根据他们的发现,当生成的数据污染后续模型代次的训练集时,就会发生模型崩溃。简单来说,AI模型在受污染的数据上训练,形成了对现实的扭曲认知。因此,它们产生的不准确表示偏离了真实的底层数据分布。

模型崩溃问题并不局限于特定类型的AI模型。一些人在各种学习生成模型和工具中观察到这一点,包括大型语言模型(LLM)、变分自编码器和高斯混合模型。代际的积累加剧了这一问题,因为模型逐渐忘记了原始数据分布。其后果是模拟与现实脱节,使AI模型变得妄想。

AI学习AI是一种危险的趋势

AI模型使用AI生成的数据进行训练这一现象的出现代表了一个令人担忧的趋势。随着技术的进步,有时机器学习模型会故意使用其他AI系统的输出来进行训练。例如,语言学习模型(LLM)正在使用GPT-4生成的输出进行训练。此外,DeviantArt等平台允许发布AI创作的艺术作品,并将其用作更新AI模型的训练数据。虽然这看似是向前迈进的一步,但伴随着重大风险。

研究人员警告称,AI学习AI的过程可能导致模型崩溃的泛滥。类似于尝试无限克隆时遇到的问题,在AI生成的数据上训练AI模型会造成一系列的不准确和扭曲。随着模型继续从受污染的数据中学习,它们与真实数据分布的距离越来越远,导致对现实世界的理解丧失。

人类生成的数据防止模型崩溃

为了防止模型崩溃的有害后果,必须保持对原始人类生成数据源的访问。研究人员提出,在训练AI模型方面存在“先发优势”。通过确保模型在真实的人类生产数据上进行训练,可以减轻分布偏移和随后模型崩溃的风险。

防止模型崩溃需要解决研究论文中确定的两个主要原因。“统计近似误差”是初始原因,因为数据样本数量有限。第二个原因是“功能近似误差”,这是由于在AI训练期间错误配置误差边界所致。这些误差会在代际中累积,导致模型内部不准确性的级联增加。

保护AI模型的未来

AI学习AI的兴起给AI模型的未来带来了重大挑战。模型崩溃现象,即AI模型失去准确感知现实的能力,需要立即引起关注。为了防止模型崩溃并确保AI模型的完整性,必须保持对原始人类生成数据源的访问,或能够区分机器生成内容和人类生产内容。

如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。

分享本文
Aamir Sheikh

Aamir Sheikh

Aamir 是一位科技记者,在加密货币和科技行业拥有近六年的经验。他毕业于 MAJ 大学,获得金融与市场营销 MBA 学位。目前他在 Cryptopolitan 工作,报道加密货币市场的最新发展和价格预测。

更多新闻…