ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Los gigantes tecnológicos empujan los límites para alimentar el apetito de datos de la IA

PorJames KinotiJames Kinoti 3 min de lectura
IA
  • Los gigantes tecnológicos recurren a métodos controvertidos para recopilar datos de IA.
  • OpenAI transcribe videos de YouTube, y Google y Meta están considerando comprar contenido con derechos de autor.
  • Surgen debates legales y éticos sobre el uso de grandes conjuntos de datos por parte de la IA.

Ya sea por el trabajo de OpenAI, Google y Meta, la IA financiando el sector industrial, que comprende varios medios como la recopilación o acumulación de enormes volúmenes de datos digitales de diferentes maneras creativas pero controvertidas, está claro que las capacidades de automatización están aumentando. Cabe destacar que los esfuerzos que implican acciones como tomar las medidas descritas anteriormente (es decir, tener en cuenta los límites legales y las políticas corporativas) equivalen a la considerable cantidad de datos utilizados para entrenar los sistemas de IA.

La iniciativa Whisper de OpenAI: extrayendo conversaciones de YouTube

Nuestra historia de Whisper comenzó hace apenas un año. Hay una escasez abrumadora de textos en inglés de primera calidad que causan retrasos en la entrega de la educación. Whisper fue el siguiente paso de Google. Entendió el océano de diálogos de YouTube y se desarrolló como texto, una aplicación de texto a voz. La herramienta en sí, impulsada por IA, que consta de más de un millón de horas de videos de YouTube auditados por IA para generar nuevos textos (esencialmente, una nueva conversación), ha sido utilizada para entrenar modelos de IA producidos desde el estado del arte hasta GPT-4, la última versión del chatbot ChatGPT.

Aunque algunos empleados argumentaron que el metraje de Microsoft de OpenAI plagiaría a YouTube de manera generalizada, la ética del plagio seguía siendo debatible; además, algunos trabajadores admitieron que sería imposible alinearse precisamente con las intenciones de YouTube. De manera similar, la adquisición de objeciones al procesar algorítmicamente los videos para extraer los contenidos textuales para alimentar los modelos de IA podría haberse considerado una amenaza para los derechos de autor de los creadores de video, causando indignación. 

Meta, la empresa matriz de Facebook e Instagram, también estaba preocupada por el uso de elementos con derechos de autor de editoriales como Simon & Schuster, entre otras. Al mismo tiempo, también discutió la adquisición de contenido web general, potencialmente para verse atrapada en infracción de derechos de autor.

El procesamiento de datos: impulsando enfoques no convencionales

La recopilación de datos, llena de competencia, ayuda a notar la posición pivotal de los datos e identificarlos en el desarrollo de la tecnología de IA. El lenguaje en una IA requiere conjuntos de datos de entrenamiento cada vez más grandes, incluyendo la Commonwealth, que son manipulados hasta Wikipedia y Reddit desde fuera de estas fuentes hoy en día. Para las empresas tecnológicas, especialmente aquellas que tienen dificultades para acceder a fuentes de datos muy comunes como las tiendas de datos tradicionales, crear modelos impulsados por IA puede ser una solución alternativa que puede ser lo suficientemente deseable en tales casos.

Las empresas tecnológicas indican que la recopilación de datos es necesaria para el entrenamiento de la IA, mientras que el mismo proceso está en cuestión legalmente en los tribunales. En su defensa, OpenAI y Microsoft ganaron una acusación sobre el empleo ilegal de material con derechos de autor contra ellos. Aún así, dijeron que sus acciones caían dentro del principio legal de uso justo. En los últimos años, el número de solicitudes presentadas a la Oficina de Derechos de Autor de EE. UU. por titulares de derechos de autor ha superado las 10.000, lo que muestra claramente que la ley de derechos de autor en la era de la IA es única y nueva. En consecuencia, los principales actores siempre enfrentan peligros relacionados con la infracción de muchas obras bajo la excusa de que no hay propósitos con licencia para los modelos que utilizan IA sobre esta base.

La imperativa necesidad de conjuntos masivos de datos

En general, el trabajo de Kaipan de Jared, científico de la escala, ha sido accidentalmente épico en el desarrollo de la IA. El contenido impulsado por datos es uno de los componentes de la IA necesarios para el proceso de entrenamiento, pero no puede funcionar bien sin los modelos que han sido entrenados bien y operan eficazmente. Con el aumento de la tecnología de inteligencia artificial, la demanda de datos para tener éxito en el mercado se eleva a un ritmo alto, dejando a las empresas con preguntas relacionadas con la ley, la ética y la privacidad. Por lo tanto, los algoritmos de inteligencia artificial deben utilizar estos conjuntos de datos para tener éxito en el mercado.

El comportamiento de recopilación de datos de los V.I.P.s está siendo desfigurado para mejoras de IA; el juramento metodológico típico está siendo vulgarizado. Ya sea a través de una de sus charlas en YouTube o la creación de datos sintéticos generativos, estas empresas son líderes en una misión por descubrir cuáles son realmente los temas de la ley, la ética y la privacidad.

Pueden convertirse en una broma en el mar más tarde. Debido a la aparición de los enormes conjuntos de datos necesarios para impulsar el proceso de innovación, los líderes de la sociedad deben participar activamente en un diálogo constructivo para desarrollar las reglas y estándares en los que los esfuerzos de innovación se equilibran con los principios éticos de los derechos de propiedad intelectual y la privacidad.

Historia original de: https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html

Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.

Comparte este artículo

Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

James Kinoti

James Kinoti

Entusiasta de las criptomonedas, James encuentra placer en compartir conocimientos sobre fintech, criptomonedas, así como blockchain y tecnologías de vanguardia. Las últimas innovaciones en la industria de las criptomonedas, los juegos cripto, la IA, la tecnología blockchain y otras tecnologías son su preocupación. Su misión: mantenerse al día con aplicaciones transformadoras en diversas industrias.

MÁS … NOTICIAS