Gigantes da Tecnologia Empurram os Limites para Alimentar a Fome de Dados da IA

- Gigantes da tecnologia recorrem a métodos controversos para coletar dados de IA.
- A OpenAI transcreve vídeos do YouTube, e Google e Meta estão considerando comprar conteúdo com direitos autorais.
- Debates legais e éticos surgem sobre o uso de vastos conjuntos de dados pela IA.
Seja qual for o trabalho da OpenAI, Google e Meta, a IA a financiar o setor industrial, que compreende vários meios como a recolha ou acumulação de enormes volumes de dados digitais de formas diferentes, criativas mas controversas, é claro que as capacidades e habilidades de automação estão a aumentar. Notavelmente, os esforços que envolvem ações como tomar as medidas acima delineadas (ou seja, ter em consideração os limites legais e as políticas corporativas) são equivalentes à quantidade considerável de dados utilizada para treinar os sistemas de IA.
A iniciativa Whisper da OpenAI: Mineração de conversas no YouTube
A nossa história Whisper começou apenas no ano passado. Existe uma escassez esmagadora de textos em inglês de primeira qualidade que causam atrasos na entrega da educação. Whisper foi o próximo passo da Google. Entendeu o oceano de diálogos do YouTube e foi desenvolvido como texto, uma aplicação de texto-para-fala. A própria ferramenta alimentada por IA, composta por mais de um milhão de horas de vídeos do YouTube auditados por IA para gerar novos textos (essencialmente, uma nova conversa), tem sido utilizada para treinar modelos de IA produzidos desde o estado da arte até ao GPT-4, a versão mais recente do chatbot ChatGPT.
Embora alguns funcionários argumentassem que o filme da Microsoft da OpenAI plagiarizaria o YouTube de forma abrangente, a ética do plágio ainda era debatível; além disso, alguns trabalhadores admitiram que seria impossível alinhar-se precisamente com as intenções do YouTube. Da mesma forma, a aquisição de objeção no processamento algorítmico dos vídeos para extrair o conteúdo textual para alimentar os modelos de IA poderia ter sido considerada uma ameaça aos direitos autorais dos criadores de vídeo, causando indignação.
A Meta, a empresa-mãe do Facebook e do Instagram, também estava preocupada com o uso de elementos protegidos por direitos autorais de editoras como a Simon & Schuster, entre outras. Ao mesmo tempo, discutiu também a aquisição de conteúdo geral da web, potencialmente para se envolver em violação de direitos autorais.
A crise de dados: Impulsionar abordagens não convencionais
A recolha de dados, cheia de competição, ajuda a notar a posição pivotal dos dados e a identificá-la no desenvolvimento da tecnologia de IA. A linguagem para uma IA exige conjuntos de dados de treino cada vez mais amplos, incluindo a Commonwealth, que são manipulados a partir de fontes externas como a Wikipedia e a Reddit hoje em dia. Para as empresas de tecnologia — especialmente aquelas com dificuldade em alcançar fontes de dados muito comuns como as lojas de dados tradicionais — criar modelos alimentados por IA pode ser uma solução alternativa que pode ser desejável nesses casos.
As empresas de tecnologia indicam que a recolha de dados é necessária para o treino da IA, enquanto o mesmo processo está em questão legalmente nos tribunais. Em sua defesa, a OpenAI e a Microsoft venceram uma alegação sobre o uso ilegal de material protegido por direitos autorais contra elas. Ainda assim, afirmaram que as suas ações se enquadravam no princípio legal de uso justo. Nos últimos anos, o número de candidaturas apresentadas ao Escritório de Direitos Autorais dos EUA pelos titulares de direitos autorais excedeu as 10.000, o que mostra claramente que a lei de direitos autorais na era da IA é única e nova. Consequentemente, os principais jogadores enfrentam sempre perigos relacionados com a violação de muitas obras sob a alegação de que não há fins licenciados para os modelos que utilizam IA com base nisso.
A imperatividade de conjuntos massivos de dados
No geral, o trabalho de Kaipan de Jared, cientista da escala, tem sido involuntariamente épico no desenvolvimento da IA. O conteúdo orientado por dados é um dos componentes da IA necessários para o processo de treino, mas não pode funcionar bem sem os modelos que foram bem treinados e operam eficazmente. Com o aumento da tecnologia de inteligência artificial, a demanda por dados para ter sucesso no mercado aumenta a um ritmo elevado, deixando as empresas com questões relacionadas com a lei, ética e privacidade. Portanto, os algoritmos de inteligência artificial devem utilizar estes conjuntos de dados para ter sucesso no mercado.
O comportamento de recolha de dados dos V.IPs está a ser desfigurado para melhorias da IA, o juramento metodológico típico está a ser grosseirizado. Seja através de uma das suas palestras no YouTube ou da criação de dados sintéticos generativos, estas empresas são líderes numa missão para descobrir quais são verdadeiramente as questões legais, éticas e de privacidade.
Podem tornar-se uma piada no mar mais tarde. Devido ao aparecimento dos enormes conjuntos de dados necessários para impulsionar o processo de inovação, os líderes da sociedade são obrigados a participar ativamente num diálogo construtivo para desenvolver as regras e padrões nos quais os esforços de inovação são equilibrados com os princípios éticos dos direitos de propriedade intelectual e da privacidade.
História original de: https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

James Kinoti
Entusiasta de criptomoedas, James encontra prazer em compartilhar conhecimento sobre fintech, criptomoedas, blockchain e tecnologias de fronteira. As últimas inovações no setor de cripto, jogos cripto, IA, tecnologia blockchain e outras tecnologias são sua principal preocupação. Sua missão: manter-se atualizado com aplicações transformadoras em diversos setores.















