Tech-Giganten verwenden YouTube-Untertitel ohne Erlaubnis für das AI-Training

- Apple und andere KI-Entwickler wie Anthropic und Nvidia wurden dabei erwischt, wie sie YouTube-Untertitel ohne Erlaubnis zum Training ihrer KI-Systeme verwenden.
- Der „YouTube Subtitles“-Datensatz wurde von EleutherAI entwickelt und 2020 veröffentlicht.
- OpenAI nutzte eine Million Stunden an YouTube-Videos, um sein GPT-4-Modell zu trainieren.
Apple, Nvidia und Anthropic wurden dabei erwischt, wie sie YouTube-Untertitel zum Trainieren von KI-Modellen nutzen, was gegen die YouTube-Richtlinien verstößt. Ein Bericht von Proof News und Wired zeigte, dass solche Unternehmen einen Datensatz mit Transkripten aus Tausenden von YouTube-Videos verwendet haben, ohne dafür ordnungsgemäß eine Lizenz erworben zu haben.
Auch lesen: Britische Aufsichtsbehörde ermittelt wegen Microsofts Rekrutierung von KI-Talents
Die Studie ergab, dass Apple, Nvidia und Anthropic den YouTube-Untertitel-Datensatz verwendet haben. Dieser Datensatz besteht aus Transkripten von 173.536 YouTube-Videos von 48.000 Kanälen. Die Videos umfassen Bildungskanäle wie Khan Academy und MIT, Nachrichtensender wie The Wall Street Journal sowie Top-Creator wie MrBeast und Marques Brownlee.
Beliebte YouTuber reagieren auf Datenmissbrauch
Marques Brownlee, ein beliebter YouTuber, äußerte sich zur Angelegenheit auf X. Er sagte: „Apple hat Daten für KI von anderen Firmen gesammelt. Eine davon hat viele Daten/Transkripte von YouTube-Videos gesammelt, darunter auch meine.” Obwohl Apple die Daten möglicherweise nicht direkt gescraped hat, wies Brownlee darauf hin, dass dieses Problem bestehen bleiben wird.
Der „YouTube Subtitles“-Datensatz wurde von EleutherAI entwickelt und 2020 veröffentlicht. Er enthält 5,7 GB Daten, darunter Untertitel von YouTube-Videos, die von der Plattform entfernt wurden.
Laut den Nutzungsbedingungen von YouTube ist der Zugriff auf Videos „auf automatisiertem Weg“ untersagt. Das Vorhandensein von Untertiteln entfernter Videos verschärft das Problem noch weiter und wirft Fragen bezüglich Datenschutz und Urheberrechtsverletzungen auf.
Salesforce, eine ebenfalls in die Untersuchung verwickelte Organisation, hat承认, den genannten Datensatz verwendet zu haben.
„Der im Forschungsbericht erwähnte ‚The Pile‘-Datensatz wurde 2021 für akademische und Forschungszwecke trainiert. Der Datensatz war öffentlich verfügbar und unter einer großzügigen Lizenz veröffentlicht worden.“
Sprecher von Salesforce
Die Nutzung von YouTube-Inhalten ohne Genehmigung ist jedoch bis heute umstritten. Im April erklärte YouTube-CEO Neal Mohan, dass die Verwendung von YouTube-Videos, Transkripten oder Clips zum Training von KI eine „klare Verletzung
Rechtsstreitigkeiten über den Einsatz von Internetinhalten durch KI-Unternehmen brechen aus
Das Problem der nicht autorisierten Nutzung von Internetinhalten durch KI-Konzerne hat sich nach dem Start von ChatGPT verschärft. Darüber hinaus klagen Content-Ersteller gegen Stability AI und Midjourney, weil diese urheberrechtlich geschützte Werke angeblich ohne Erlaubnis gescraped haben. Googles Muttergesellschaft YouTube sah sich mit Sammelklagen wegen ähnlicher Vorwürfe konfrontiert; dabei wurde betont, dass solche rechtlichen Schritte die Grundlagen des generativen KI-Fortschritts gefährden.
In einem Interview mit der Wall Street Journal gab OpenAI-CTO Mira Murati keine weiteren Details dazu, ob das Unternehmen Videos von Social-Media-Plattformen zum Training dieses neuen Modells verwendet hat. Microsoft-AI-CEO Mustafa Suleyman erklärte, dass Inhalte im offenen Web seit den 1990er-Jahren als „Fair Use
Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Brenda Kanana
Brenda verfügt über mehr als 4 Jahre Erfahrung mit Spezialisierung auf Kryptowährungen, künstliche Intelligenz und aufkommende Technologien. Sie war bei Zycrypto, Blockchain Reporter und The Coin Republic tätig und hat nun Cryptopolitan zu ihrer Heimat gemacht. Ihr Soziologiestudium an der Mombasa Technical University hält sie nah am Puls ihrer Leser.
















