最新新闻
为您推荐

科技巨头未经许可使用 YouTube 字幕进行 AI 训练

作者Brenda KananaBrenda Kanana 2 分钟阅读
科技巨头未经许可使用 YouTube 字幕进行 AI 训练
  • 苹果及其他AI开发商(如Anthropic和Nvidia)被曝出未经许可使用YouTube字幕来训练其AI系统。
  • “YouTube字幕”数据集由EleutherAI开发,并于2020年发布。
  • OpenAI曾利用长达一百万小时的YouTube视频来训练其GPT-4模型。 

发现 Apple、Nvidia 和 Anthropic 使用 YouTube 字幕来训练 AI 模型,这违反了 YouTube 的政策。Proof News 和 Wired 的一份报告显示,这些公司使用了数千个 YouTube 视频转录文本的数据集,但未获得适当的许可。 

延伸阅读: 英国监管机构对微软的人才招聘展开调查

该 研究 显示,Apple、Nvidia 和 Anthropic 使用了 YouTube 字幕数据集。该数据集包含来自 48,000 个频道的 173,536 个 YouTube 视频的转录文本。这些视频包括 Khan Academy 和 MIT 等教育频道、The Wall Street Journal 等新闻频道,以及 MrBeast 和 Marques Brownlee 等顶级创作者。

知名 YouTuber 对数据剥削做出反应

知名 YouTuber Marques Brownlee 在 X 上就此事 发表评论。他说,“Apple 从其他公司收集了用于 AI 的数据。其中一家公司收集了大量 YouTube 视频的数据/转录文本,包括我的。 ” 虽然 Apple 可能没有直接抓取数据,但 Brownlee 指出这个问题将持续存在。

“YouTube 字幕”数据集由 EleutherAI 开发,并于 2020 年发布。它包含 5.7GB 的数据,其中包括已从该平台删除的 YouTube 视频的字幕。 

根据 YouTube 的条款和条件,禁止通过“自动化手段”访问视频。已删除视频字幕的存在只会加剧这一问题,引发关于隐私和版权侵权的疑问。

同样卷入调查的 Salesforce 也承认使用了该数据集。 

“研究论文中提到的 Pile 数据集于 2021 年为学术和研究目的而训练。该数据集公开可用,并在宽松许可下发布。”

Salesforce 发言人 

然而,未经许可使用 YouTube 内容至今仍有争议。4 月,YouTube 首席执行官 Neal Mohan 表示,使用 YouTube 视频、转录文本或片段进行 AI 训练是政策的“明显违反”。然而,据《纽约时报》报道,OpenAI 使用了一百万小时的 YouTube 视频来训练其 GPT-4 模型。 

关于 AI 公司使用互联网内容的法律纠纷爆发

自 ChatGPT 发布以来,AI 公司未经授权在互联网上使用内容的问题日益增多。此外,内容创作者起诉 Stability AI 和 Midjourney,称其未经许可抓取受版权保护的作品。YouTube 的母公司 Google 面临集体诉讼,声称此类法律行动威胁到生成式 AI 的基础。 

在 接受《华尔街日报》采访时,OpenAI 的 CTO Mira Murati 没有详细说明该公司是否使用社交媒体平台上的视频来训练这个新模型。微软 AI 首席执行官 Mustafa Suleyman 表示,自 20 世纪 90 年代以来,基于他所谓的“社会契约”,开放网络上的内容一直被视为合理使用。

不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。

免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

Brenda Kanana

Brenda Kanana

Brenda 拥有 4 年以上专注于加密货币、人工智能及新兴技术的经验。她曾就职于 Zycrypto、Blockchain Reporter 和 The Coin Republic,如今以 Cryptopolitan 为家。她在蒙巴萨技术大学获得的社会学学位使她能够始终把握读者的脉搏。

更多新闻…