La IA no puede florecer sin conocimiento humano: la compensación a los creadores originales es indispensable

- El entrenamiento de modelos de IA requiere grandes conjuntos de datos, y es mejor si se basan en el conocimiento humano.
- Los periódicos y las organizaciones de investigación, junto con los portales web, dedican sus recursos a recopilar y publicar información.
- La compensación a los creadores originales del contenido es imprescindible, ya que ahora las empresas de IA licencian contenido de otras compañías.
Entrenar modelos de IA necesita grandes cantidades de conjuntos de datos, y su capacidad para producir buenos resultados depende directamente de los datos que se han alimentado al sistema. La información no viene gratis, y aquí estamos hablando de muchos derechos de propiedad intelectual.
Pero las empresas de IA no piensan de esta manera; dan por sentado todo el conocimiento producido por generaciones de escritores; su concepto de uso justo también es diferente de cómo se percibía originalmente; y no les gusta pagar a los creadores de contenido que hicieron que sus modelos fueran capaces de lo que son hoy.
Robo de conocimiento humano
Hay mucho trabajo duro y sudor involucrado en producir el contenido que vemos en periódicos, revistas, libros, archivos en línea y artículos de investigación, pero eso no es posible sin escritores, editores, investigadores y editores que lo llevaron al público en diferentes formas.
Tal reconocimiento y conocimiento tan difícilmente ganado no debería ser gratuito para ser explotado por una empresa, como lo hizo una.
“Información que está públicamente disponible en internet.”
Fuente: OpenAI.
Sí, eso es lo que OpenAI tiene que decir si se le pregunta sobre el contenido que utilizó para entrenar sus sistemas de IA, junto con la información que licenció de terceros y la información que sus usuarios y entrenadores humanos proporcionan.
Hablando del contenido licenciado, las empresas lo están buscando ahora, pero no tenemos ninguna información sobre si OpenAI licenció alguna información de un proveedor antes de lanzar su modelo GPT inicial. El modelo debió haber sido entrenado con materiales con derechos de autor que no eran de uso libre para fines comerciales.

Compensación para los creadores originales
Hasta hace un año, la mayor parte del texto escrito en línea o fuera de línea se hacía con esfuerzo humano. A pesar del clickbait, el contenido de baja calidad también se mezclaba, pero al menos era creado por humanos que entendían la psicología y el proceso de pensamiento humano, y las aplicaciones de IA generativa se construyeron sobre la base de tal información.
Pero hoy en día, las empresas enfrentan un nuevo problema para entrenar sus modelos de IA, y ese es el contenido generado por máquinas que prevalece en todo internet, el cual no se considera contenido de calidad por ningún medio. Tal contenido está plagando los recursos disponibles para entrenar modelos de IA, ya que no pueden producir resultados de calidad cuando se entrenan con verbosidad inútil, que es cómo estos modelos suelen generar contenido. La IA generando sobre IA es un proceso a menudo llamado canibalismo de IA o clonación.
Para evitar que esto suceda, las empresas de IA tienen que limitar su material fuente a fuentes creíbles únicamente, que no son otras que periódicos, revistas y foros públicos que albergan una gran cantidad de conocimiento producido por humanos. Unos pocos más también se pueden contar, como se mencionó anteriormente, pero esta necesidad y las demandas de los periódicos las han obligado a licenciar contenido y pagar por la explotación que estaban cometiendo.
Empresas como Reddit, que es un gran foro público alojado en la web, también están considerando licenciar su contenido a empresas de IA. En una declaración, dijo que preferirían los negocios sobre las demandas, pero no descartaron las demandas si las conversaciones comerciales fracasan. Si no se te permite poner una banda sonora con derechos de autor en tu video de YouTube, ¿por qué se debería permitir que una empresa de IA use eso para entrenar sus modelos destinados al uso comercial?
La propiedad de los derechos de autor es un problema aquí, ya que las empresas de IA siguen violándolos. Por otro lado, la IA no es capaz de recopilar noticias nuevas por sí misma; se necesita esfuerzo humano para recopilar noticias y confirmarlas desde diferentes fuentes en primer lugar antes de publicarlas, solo entonces un modelo de IA puede usar esa información, y no compensar al recurso humano en este caso es una explotación.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Aviso de responsabilidad (Disclaimer): La información proporcionada no constituye asesoramiento de inversión. Cryptopolitan.com no asume responsabilidad alguna por las inversiones realizadas basándose en la información contenida en esta página. Recomendamos encarecidamente realizar investigaciones independientes o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Aamir Sheikh
Aamir es un periodista tecnológico con casi seis años de experiencia en los sectores de criptomonedas y tecnología. Se graduó de la Universidad MAJ con un MBA en Finanzas y Marketing. Ahora trabaja con Cryptopolitan, donde informa sobre los últimos desarrollos en los mercados de criptomonedas y predicciones de precios.
















