科技巨头推动边界以满足AI的数据胃口

- 科技巨头采用有争议的方法收集 AI 数据。
- OpenAI 转录 YouTube 视频,Google 和 Meta 正考虑购买受版权保护的内容。
- 关于 AI 使用海量数据集的法律与伦理争议随之兴起。
无论是OpenAI、Google和Meta的工作,还是AI资助的工业部门,其中包括以各种创造性但具有争议的方式收集或积累大量数字数据的手段,很明显,自动化能力和能力正在增加。值得注意的是,涉及采取上述措施(即考虑法律限制和公司政策)的努力,相当于用于训练AI系统的大量数据。
OpenAI的Whisper计划:挖掘YouTube对话
我们的Whisper故事始于去年。由于优质英语文本的严重短缺导致教育交付延迟,Whisper是Google的下一步。它理解了YouTube的对话海洋,并开发为文本,一个文本转语音应用程序。这个由AI驱动的工具本身,包括超过一百万小时的YouTube视频由AI审核以生成新文本(本质上,新的对话),已被用于训练从最先进的到GPT-4(ChatGPT聊天机器人的最新版本)的AI模型。
尽管一些员工认为OpenAI的微软镜头会从各个方面抄袭YouTube,但抄袭的道德性仍然有争议;此外,一些员工承认,精确符合YouTube的意图是不可能的。同样,为了提取文本内容以喂养AI模型而对视频进行算法处理所获得的异议,可能被视为对视频创作者版权的威胁,引起愤怒。
Facebook和Instagram的母公司Meta也担心使用西蒙和舒斯特(Simon & Schuster)等出版公司的受版权保护的元素。同时,它还讨论了获取一般网络内容,可能会陷入版权侵权。
数据危机:推动非传统方法
充满竞争的数据收集有助于注意数据的关键地位,并在AI技术的发展中识别它。语言AI命令越来越多的训练数据集,包括英联邦,这些数据集今天从外部来源如维基百科和Reddit中被操纵。对于科技公司——特别是那些难以触及非常常见数据源(如传统数据存储)的公司——创建AI驱动模型可能是一个替代解决方案,在这种情况下可能是可取的。
科技公司表明数据收集对于AI训练是必要的,而同一过程在法律上在法庭上受到质疑。在辩护中,OpenAI和微软赢得了关于非法使用版权材料针对他们的指控。尽管如此,他们说他们的行为符合合理使用原则。近年来,版权持有人向美国版权局提交的应用数量已超过10,000件,这清楚地表明,AI时代的版权法是独特且全新的。因此,主要参与者始终面临与侵犯大量作品相关的危险,理由是这些模型基于此使用AI没有许可目的。
对大规模数据集的迫切需求
总体而言,Jared科学家Kaipan在规模上的工作无意中在AI发展中产生了史诗般的影响。数据驱动的内容是AI训练过程所需的组成部分之一,但如果没有经过良好训练且运行有效的模型,它无法发挥良好作用。随着人工智能技术的发展,市场对数据的需求以高速度增长,使公司面临与法律、道德和隐私相关的问题。因此,人工智能算法必须利用这些数据集才能在市场中取得成功。
VIPs的数据收集行为正在被扭曲以用于AI增强;典型的方法论誓言正在变得粗糙。无论是通过他们的YouTube演讲还是创建合成数据生成,这些公司都是致力于发现法律、伦理和隐私问题真相的领导者。
它们后来可能会成为大海上的笑柄。由于驱动创新过程的大量数据集的出现,社会领导者被要求积极参与建设性对话,以制定规则,使创新努力与知识产权和隐私的道德原则相平衡。
原始故事来源:https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。
免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

James Kinoti
加密货币爱好者 James 热衷于分享金融科技、加密货币以及区块链和前沿技术领域的知识。加密货币行业的最新创新、加密游戏、AI、区块链技术以及其他技术是他关注的重点。他的使命是紧跟各行业变革性应用的步伐。















