DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Les géants de la technologie utilisent les sous-titres de YouTube pour l'entraînement de l'IA sans autorisation

ParBrenda KananaBrenda Kanana 2 min de lecture
Les géants de la technologie utilisent les sous-titres de YouTube pour l'entraînement de l'IA sans autorisation
  • Apple et d’autres développeurs d’IA, tels qu’Anthropic et Nvidia, ont été pris à utiliser les sous-titres de YouTube sans autorisation pour entraîner leurs systèmes d’intelligence artificielle.
  • Le jeu de données « Sous-titres YouTube » a été développé par EleutherAI et publié en 2020.
  • OpenAI a utilisé un million d’heures de vidéos YouTube pour entraîner son modèle GPT-4. 

Apple, Nvidia et Anthropic ont été surpris à utiliser les sous-titres YouTube pour entraîner des modèles d’IA, ce qui va à l’encontre des politiques de YouTube. Un rapport de Proof News et Wired a montré que de telles entreprises avaient utilisé un jeu de données de transcriptions de milliers de vidéos YouTube sans obtenir correctement la licence pour le faire. 

À lire également : Le régulateur britannique lance une enquête sur l’acquisition de talents IA par Microsoft

L’étude a révélé qu’Apple, Nvidia et Anthropic ont utilisé le jeu de données YouTube Subtitles. Ce jeu de données se compose de transcriptions de 173 536 vidéos YouTube provenant de 48 000 chaînes. Les vidéos incluent des chaînes éducatives comme Khan Academy et MIT, des chaînes d’actualités comme The Wall Street Journal, et des créateurs de premier plan comme MrBeast et Marques Brownlee.

Les YouTubers populaires réagissent à l’exploitation des données

Marques Brownlee, un YouTuber populaire, a commenté la question sur X. Il a déclaré : « Apple a recueilli des données pour l’IA auprès d’autres entreprises. L’une d’elles a collecté beaucoup de données/transcriptions de vidéos YouTube, y compris les miennes. » Bien qu’Apple n’ait peut-être pas gratté les données directement, Brownlee a souligné que ce problème persistera.

Le jeu de données « YouTube Subtitles » a été développé par EleutherAI et publié en 2020. Il contient 5,7 Go de données, qui incluent les sous-titres des vidéos YouTube qui ont été supprimées de la plateforme. 

Selon les conditions d’utilisation de YouTube, l’accès aux vidéos par « moyens automatisés » est interdit. L’existence de sous-titres de vidéos supprimées n’ajoute qu’à la question, soulevant des interrogations sur la vie privée et les violations de droits d’auteur.

Salesforce, une organisation également impliquée dans l’enquête, a également admis avoir utilisé ledit jeu de données. 

« Le jeu de données The Pile mentionné dans l’article de recherche a été entraîné en 2021 à des fins académiques et de recherche. Le jeu de données était publiquement disponible et publié sous une licence permissive. »

Porte-parole de Salesforce 

Cependant, l’utilisation du contenu YouTube sans autorisation reste controversée à ce jour. En avril, le PDG de YouTube, Neal Mohan, a déclaré que l’utilisation de vidéos YouTube, de transcriptions ou d’extraits pour l’entraînement de l’IA constituait une « violation claire » des politiques. Cependant, selon le New York Times, OpenAI a utilisé un million d’heures de vidéos YouTube pour entraîner son modèle GPT-4. 

Des batailles juridiques éclatent sur l’utilisation par les entreprises d’IA du contenu internet

Le problème des entreprises d’IA utilisant du contenu d’Internet sans autorisation s’est intensifié après le lancement de ChatGPT. Par ailleurs, des créateurs de contenu intentent des procès à Stability AI et Midjourney pour avoir, selon eux, extrait des œuvres protégées par le droit d’auteur sans permission. Google, propriétaire de YouTube, a fait face à des actions collectives pour des allégations similaires, affirmant que ce type de poursuites judiciaires menace les fondements de l’IA générative. 

Dans une interview avec The Wall Street Journal, la CTO d’OpenAI, Mira Murati, n’a pas précisé si l’entreprise utilisait des vidéos de plateformes de médias sociaux pour entraîner ce nouveau modèle. Le PDG de Microsoft AI, Mustafa Suleyman, a déclaré que le contenu du web ouvert était considéré comme une utilisation équitable depuis les années 1990, selon ce qu’il a appelé le « contrat social ».

Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Brenda Kanana

Brenda Kanana

Brenda possède plus de 4 ans d'expérience spécialisée en cryptomonnaies, intelligence artificielle et technologies émergentes. Elle a travaillé chez Zycrypto, Blockchain Reporter et The Coin Republic, et fait désormais de Cryptopolitan son foyer. Son diplôme en sociologie de l'Université technique de Mombasa lui permet de rester alignée avec les préoccupations de ses lecteurs.

PLUS D'ACTUALITÉS…