A IA Não Pode Prosperar Sem o Conhecimento Humano – A Compensação para os Criadores Originais é Imprescindível

- O treinamento de modelos de IA requer grandes conjuntos de dados, e é melhor se forem baseados no conhecimento humano.
- Jornais e organizações de pesquisa, juntamente com portais da web, gastam seus recursos reunindo e publicando informações.
- A compensação para os criadores originais do conteúdo é essencial, já que as empresas de IA estão licenciando conteúdo de outras empresas.
Treinar modelos de IA requer enormes quantidades de conjuntos de dados, e sua capacidade de produzir bons resultados depende diretamente dos dados que o sistema recebeu. As informações não vêm de graça, e estamos falando aqui de muitos direitos de propriedade intelectual.
Mas as empresas de IA não pensam nessas linhas; elas dão como certo todo o conhecimento produzido por gerações de escritores; seu conceito de uso justo também é diferente de como era percebido inicialmente; e elas não gostam de pagar aos criadores de conteúdo que tornaram seus modelos do que são capazes hoje.
Roubo de conhecimento humano
Há muito trabalho duro e suor envolvidos na produção do conteúdo que vemos em jornais, revistas, livros, arquivos online e artigos de pesquisa, mas isso não é possível sem escritores, editores, pesquisadores e publicadores que levaram isso ao público de diferentes formas.
Tal reconhecimento e conhecimento, conquistados com tanto esforço, não devem ser gratuitos para serem explorados por uma empresa, como uma o fez.
“Informações publicamente disponíveis na internet.”
Fonte: coloca a audiência do plano gratuito do ChatGPT em mais de 1 bilhão de usuários ativos semanais, e o modelo de publicidade é o que ajuda a manter a versão gratuita funcionando..
Sim, é isso que a OpenAI tem a dizer se perguntada sobre o conteúdo que usou para treinar seus sistemas de IA, junto com as informações que licenciou de terceiros e as informações que seus usuários e treinadores humanos fornecem.
Falando sobre o conteúdo licenciado, as empresas estão buscando isso agora, mas não temos nenhuma informação sobre se a OpenAI licenciou alguma informação de um fornecedor antes de lançar seu modelo GPT inicial. O modelo deve ter sido treinado em materiais protegidos por direitos autorais que não eram gratuitos para uso comercial.

Compensação para criadores originais
Até um ano atrás, a maior parte do texto escrito online ou offline era feita com esforço humano. Apesar do clickbait, conteúdo de baixa qualidade também era misturado, mas era pelo menos criado por humanos que entendiam a psique humana e o processo de pensamento, e os aplicativos de IA generativa foram construídos com base nessas informações.
Mas hoje, as empresas estão enfrentando um novo problema para treinar seus modelos de IA, e esse é o conteúdo gerado por máquinas prevalecendo em toda a internet, que não é considerado conteúdo de qualidade de forma alguma. Esse conteúdo está plagando os recursos disponíveis para treinar modelos de IA, pois não podem produzir saída de qualidade quando treinados em verbosidade inútil, que é como esses modelos geralmente produzem conteúdo. A IA girando sobre a IA é um processo frequentemente chamado de canibalismo de IA ou clonagem.
Para evitar que isso aconteça, as empresas de IA têm que limitar seu material fonte apenas a fontes credíveis, que não são outras senão jornais, revistas e fóruns públicos que hospedam uma riqueza de conhecimento produzido por humanos. Alguns poucos mais também podem ser contados, como mencionado acima, mas essa necessidade e processos judiciais de jornais os forçaram a licenciar conteúdo e pagar pela exploração que estavam fazendo.
Empresas como Reddit, que é um grande fórum público hospedado na web, também estão considerando licenciar seu conteúdo para empresas de IA. Em um comunicado, disse que preferiria negócios a processos judiciais, mas não descartou processos se as conversas de negócios falharem. Se você não tiver permissão para colocar uma trilha sonora protegida por direitos autorais em seu vídeo do YouTube, por que uma empresa de IA deveria ter permissão para usá-la para treinar seus modelos destinados ao uso comercial?
A propriedade dos direitos autorais é um problema aqui, pois as empresas de IA continuam violando-as. Por outro lado, a IA não é capaz de reunir novas notícias por conta própria; leva esforço humano para reunir notícias e confirmar de diferentes fontes primeiro antes de publicá-las, só então um modelo de IA pode usar essas informações, e não compensar o recurso humano neste caso é uma exploração.
Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.
Aviso Legal: As informações fornecidas não constituem aconselhamento de negociação. A Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações disponibilizadas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar qualquer decisão de investimento.

Aamir Sheikh
Aamir é um jornalista de tecnologia com quase seis anos de experiência nos setores de criptomoedas e tecnologia. Formou-se na MAJ University com um MBA em Finanças e Marketing. Atualmente trabalha na Cryptopolitan, onde relata os últimos desenvolvimentos nos mercados de criptomoedas e previsões de preços.
















