ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Gigantes da tecnologia usam legendas do YouTube para treinamento de IA sem permissão

PorBrenda KananaBrenda Kanana 2 min de leitura
Gigantes da tecnologia usam legendas do YouTube para treinamento de IA sem permissão
  • A Apple e outros desenvolvedores de IA, como Anthropic e Nvidia, foram pegos usando legendas do YouTube sem permissão para treinar seus sistemas de IA.
  • O conjunto de dados "Legendas do YouTube" foi desenvolvido pela EleutherAI e publicado em 2020.
  • A OpenAI usou um milhão de horas de vídeos do YouTube para treinar seu modelo GPT-4. 

A Apple, a Nvidia e a Anthropic foram encontradas usando legendas do YouTube para treinar modelos de IA, o que vai contra as políticas do YouTube. Um relatório da Proof News e da Wired mostrou que essas empresas usaram um conjunto de dados das transcrições de milhares de vídeos do YouTube sem adquirir adequadamente a licença para fazê-lo. 

Também leia: Regulador do Reino Unido inicia investigação sobre aquisição de talentos de IA pela Microsoft

O estudo revelou que Apple, Nvidia e Anthropic usaram o conjunto de dados de Legendas do YouTube. Este conjunto de dados consiste em transcrições de 173.536 vídeos do YouTube de 48.000 canais. Os vídeos incluem canais educacionais como Khan Academy e MIT, canais de notícias como The Wall Street Journal e criadores de topo como MrBeast e Marques Brownlee.

YouTubers populares reagem à exploração de dados

Marques Brownlee, um YouTuber popular, comentou sobre o assunto na X. Ele disse, “A Apple reuniu dados para IA de outras empresas. Uma delas coletou muitos dados/transcrições de vídeos do YouTube, incluindo os meus. ” Embora a Apple possa não ter raspado os dados diretamente, Brownlee apontou que esse problema persistirá.

O conjunto de dados “Legendas do YouTube” foi desenvolvido pela EleutherAI e publicado em 2020. Ele contém 5,7 GB de dados, que incluem legendas de vídeos do YouTube que foram removidos da plataforma. 

De acordo com os termos e condições do YouTube, acessar vídeos por “meios automatizados” é proibido. A existência de legendas de vídeos removidos apenas adiciona à questão, levantando perguntas sobre privacidade e violação de direitos autorais.

A Salesforce, uma organização também implicada na investigação, admitiu ter usado o referido conjunto de dados. 

“O conjunto de dados The Pile, referido no artigo de pesquisa, foi treinado em 2021 para fins acadêmicos e de pesquisa. O conjunto de dados estava publicamente disponível e foi lançado sob uma licença permissiva.”

Porta-voz da Salesforce 

No entanto, o uso de conteúdo do YouTube sem permissão ainda é controverso até hoje. Em abril, o CEO do YouTube, Neal Mohan, disse que usar vídeos, transcrições ou clipes do YouTube para treinamento de IA é uma “violação clara” das políticas. No entanto, de acordo com o New York Times, a OpenAI usou um milhão de horas de vídeos do YouTube para treinar seu modelo GPT-4. 

Batalhas legais eclodem sobre o uso de conteúdo da internet por empresas de IA

A questão das corporações de IA usando conteúdo da internet sem autorização aumentou após o lançamento do ChatGPT. Além disso, criadores de conteúdo estão processando a Stability AI e a Midjourney por supostamente raspando obras protegidas por direitos autorais sem permissão. O proprietário do YouTube, Google, enfrentou ações coletivas relacionadas a alegações semelhantes, afirmando que ações legais desse tipo ameaçam a base da IA generativa. 

Em uma entrevista com o The Wall Street Journal, a CTO da OpenAI, Mira Murati, não elaborou se a empresa usou vídeos de plataformas de mídia social para treinar este novo modelo. O CEO da Microsoft AI, Mustafa Suleyman, declarou que o conteúdo da web aberta havia sido considerado uso justo desde a década de 1990 com base no que ele chamou de “contrato social.”

Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Brenda Kanana

Brenda Kanana

Brenda tem mais de 4 anos de experiência especializada em criptomoedas, inteligência artificial e tecnologias emergentes. Ela trabalhou na Zycrypto, Blockchain Reporter, The Coin Republic e agora faz do Cryptopolitan seu lar. Sua graduação em Sociologia pela Mombasa Technical University mantém-a alinhada com o pulso de seus leitores.

MAIS … NOTÍCIAS