没有人类知识,AI无法繁荣——必须补偿原创创作者

- 训练 AI 模型需要大量数据集,而这些数据集最好基于人类知识。
- 报纸、研究机构以及网络门户都在投入资源收集并发布信息。
- 内容原创者的补偿必不可少,因为如今 AI 公司正从企业处获取内容授权。
训练AI模型需要大量的数据集,其产生良好结果的能力直接取决于系统输入的数据。信息并非免费获取,我们在这里谈论的是大量的知识产权。
但AI公司并不这样思考;他们理所当然地认为可以利用几代作家产生的所有知识;他们的“合理使用”概念也与最初的理解不同;而且他们不喜欢向内容创作者付费,而这些创作者正是使他们的模型具备今日能力的人。
人类知识的窃取
我们在报纸、杂志、书籍、在线档案和研究论文中看到的内容,涉及大量的辛勤工作和汗水,但这离不开将不同形式的内容带给公众的作家、编辑、研究人员和出版商。
这种来之不易的认可和知识不应被某家公司免费利用,就像发生的那样。
“互联网上公开可用的信息。”
来源: OpenAI.
是的,这就是OpenAI在被问及用于训练其AI系统的内容时会说的话,包括其从第三方许可的信息以及其用户和人类训练师提供的信息。
谈到许可内容,公司现在正在寻求它,但我们没有关于OpenAI在推出其初始GPT模型之前是否从供应商处许可任何信息的信息。该模型必须在非免费用于商业目的的受版权保护材料上进行了训练。

补偿原创创作者
直到一年前,大多数在线或离线撰写的文本都是人类努力的成果。尽管存在点击诱饵和低质量内容,但它们至少是由理解人类心理和思维过程的人类创造的,而生成式AI应用程序正是基于此类信息构建的。
但今天,公司在训练其AI模型时面临着一个新问题,即机器生成的内容在整个互联网上占主导地位,这无论如何都不被认为是高质量内容。此类内容正在困扰可用于训练AI模型的资源,因为当使用这些模型通常产生的无用冗长内容进行训练时,它们无法产生高质量的输出。AI在AI上循环通常被称为AI自噬或克隆。
为了防止这种情况发生,AI公司必须将其素材来源限制在可信来源上,即报纸、杂志和托管大量人类生产知识的公共论坛。如上所述,还可以计算更多,但这种必要性和来自报纸的诉讼迫使他们许可内容并为其正在进行的利用行为付费。
像Reddit这样的大型网络公共论坛也在考虑将其内容授权给AI公司。该公司表示,他们更喜欢商业合作而非诉讼,但如果商业谈判失败,也不排除提起诉讼。如果你不允许在YouTube视频中使用受版权保护的配乐,那么为什么AI公司可以被允许使用这些内容来训练其用于商业目的模型?
版权所有权是一个问题,因为AI公司不断侵犯它。另一方面,AI无法自行收集新新闻,首先需要人类努力从不同来源收集新闻并确认,然后AI模型才能使用这些信息,在这种情况下不补偿人力资源是一种剥削。
如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。
免责声明: 所提供的信息不构成交易建议。Cryptopolitan.com 对基于本页信息进行的任何投资不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

Aamir Sheikh
Aamir 是一位科技记者,在加密货币和科技行业拥有近六年的经验。他毕业于 MAJ 大学,获得金融与市场营销 MBA 学位。目前他在 Cryptopolitan 工作,报道加密货币市场的最新发展和价格预测。
















