Las grandes tecnológicas utilizan los subtítulos de YouTube para el entrenamiento de IA sin permiso

- Apple y otros desarrolladores de IA, como Anthropic y Nvidia, han sido sorprendidos utilizando subtítulos de YouTube sin autorización para entrenar sus sistemas de inteligencia artificial.
- El conjunto de datos «Subtítulos de YouTube» fue desarrollado por EleutherAI y publicado en 2020.
- OpenAI utilizó un millón de horas de videos de YouTube para entrenar su modelo GPT-4.
El regulador del Reino Unido inicia una investigación sobre la adquisición de talento de IA de Microsoft
También leer: Los YouTubers populares reaccionan a la explotación de datos
El estudio reveló que Apple, Nvidia y Anthropic utilizaron el conjunto de datos de subtítulos de YouTube. Este conjunto de datos consta de transcripciones de 173.536 vídeos de YouTube procedentes de 48.000 canales. Los vídeos incluyen canales educativos como Khan Academy y MIT, canales de noticias como The Wall Street Journal y creadores destacados como MrBeast y Marques Brownlee.
El conjunto de datos “YouTube Subtitles” fue desarrollado por EleutherAI y publicado en 2020. Contiene 5,7 GB de datos, que incluyen subtítulos de los videos de YouTube que han sido eliminados de la plataforma.
En una entrevista con The Wall Street Journal, la CTO de OpenAI, Mira Murati, no elaboró sobre si la empresa utilizó videos de plataformas de redes sociales para entrenar este nuevo modelo. El CEO de Microsoft AI, Mustafa Suleyman declaró que el contenido de la web abierta se había considerado uso justo desde la década de 1990, basándose en lo que él llamó el “contrato social.”
Según los términos y condiciones de YouTube, está prohibido acceder a los videos por “medios automatizados”. La existencia de subtítulos de videos eliminados solo añade al problema, planteando preguntas sobre la privacidad y la infracción de derechos de autor.
Salesforce, una organización también implicada en la investigación, ha admitido haber utilizado dicho conjunto de datos.
“El conjunto de datos The Pile al que se hace referencia en el artículo de investigación fue entrenado en 2021 con fines académicos y de investigación. El conjunto de datos estaba disponible públicamente y se lanzó bajo una licencia permisiva.”
Portavoz de Salesforce
Sin embargo, el uso del contenido de YouTube sin permiso sigue siendo controvertido hasta la fecha. En abril, el CEO de YouTube, Neal Mohan, dijo que usar videos de YouTube, transcripciones o clips para el entrenamiento de IA es una “violación clara” de las políticas. Sin embargo, según The New York Times, OpenAI utilizó un millón de horas de videos de YouTube para entrenar su modelo GPT-4.
Estallan batallas legales sobre el uso de contenido de internet por empresas de IA
El problema de las corporaciones de IA utilizando contenido de internet sin autorización ha aumentado después del lanzamiento de ChatGPT. Además, los creadores de contenido están demandando a Stability AI y Midjourney por supuestamente extraer obras con derechos de autor sin permiso. El propietario de YouTube, Google, enfrentó demandas colectivas por reclamos similares, afirmando que las acciones legales de este tipo amenazan la base de la IA generativa.
Apple, Nvidia y Anthropic se ha encontrado que están utilizando subtítulos de YouTube para entrenar modelos de IA, lo cual va en contra de las políticas de YouTube. Un informe de Proof News y Wired mostró que dichas empresas habían utilizado un conjunto de datos de las transcripciones de miles de videos de YouTube sin adquirir adecuadamente la licencia para hacerlo. También leer: Reino…
En una entrevista con The Wall Street Journal, la CTO de OpenAI, Mira Murati, no entró en detalles sobre si la empresa utilizó vídeos de plataformas de redes sociales para entrenar este nuevo modelo. El CEO de Microsoft AI, Mustafa Suleyman, declaró que el contenido de la web abierta se ha considerado un uso justo desde la década de 1990, basándose en lo que él llamó el «contrato social».
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Brenda Kanana
Brenda cuenta con más de 4 años de experiencia especializada en criptomonedas, inteligencia artificial y tecnologías emergentes. Ha trabajado en Zycrypto, Blockchain Reporter y The Coin Republic, y ahora tiene a Cryptopolitan como su hogar. Su licenciatura en Sociología de la Universidad Técnica de Mombasa la mantiene alineada con las necesidades de sus lectores.
















