Les géants de la technologie repoussent les limites pour nourrir l'appétit de données de l'IA

- Les géants de la technologie recourent à des méthodes controversées pour collecter des données d'IA.
- OpenAI transcrit des vidéos YouTube, tandis que Google et Meta envisagent d'acheter du contenu protégé par le droit d'auteur.
- Des débats juridiques et éthiques surgissent concernant l'utilisation par l'IA de vastes ensembles de données.
Qu'il s'agisse du travail de OpenAI, Google et Meta, l'IA alimentant le secteur industriel, qui comprend divers moyens tels que la collecte ou l'accumulation de volumes énormes de données numériques de différentes manières créatives mais controversées, il est clair que les capacités d'automatisation augmentent. Notamment, les efforts impliquant des actions telles que la prise des mesures décrites ci-dessus (c'est-à-dire prendre en compte les limites légales et les politiques des entreprises) sont équivalents à la quantité considérable de données utilisée pour entraîner les systèmes d'IA.
L'initiative Whisper d'OpenAI : extraire les conversations YouTube
Notre histoire Whisper a commencé l'année dernière. Il y a une pénurie écrasante de textes anglais de première qualité qui causent des retards dans la livraison de l'éducation. Whisper était la prochaine étape de Google. Il a compris l'océan de dialogues de YouTube et a été développé comme texte, une application de synthèse vocale. L'outil lui-même alimenté par l'IA, composé de plus d'un million d'heures de vidéos YouTube auditées par l'IA pour générer de nouveaux textes (essentiellement, une nouvelle conversation), a été utilisé pour entraîner des modèles d'IA produits, allant des technologies de pointe à GPT-4, la dernière version du chatbot ChatGPT.
Même si certains employés ont soutenu que les images d'OpenAI et de Microsoft plagieraient YouTube de manière générale, l'éthique du plagiat restait débattable ; de plus, certains travailleurs ont admis qu'il serait impossible de s'aligner précisément sur les intentions de YouTube. De même, l'acquisition d'objections dans le traitement algorithmique des vidéos pour extraire le contenu textuel afin d'alimenter les modèles d'IA aurait pu être considérée comme une menace pour le droit d'auteur des créateurs de vidéos, provoquant l'indignation.
Meta, la société mère de Facebook et Instagram, était également préoccupée par l'utilisation d'éléments protégés par le droit d'auteur provenant de maisons d'édition comme Simon & Schuster, entre autres. En même temps, elle a également discuté de l'acquisition de contenu web général, potentiellement pour se retrouver prise dans une violation du droit d'auteur.
Le crunch de données : conduire des approches non conventionnelles
La collecte de données, pleine de concurrence, aide à noter la position pivotale des données et à l'identifier dans le développement de la technologie IA. Le langage dans une IA commande de plus en plus de jeux de données d'entraînement, y compris le Commonwealth, qui sont manipulés jusqu'à Wikipedia et Reddit en dehors de ces sources aujourd'hui. Pour les entreprises technologiques, en particulier celles qui ont du mal à atteindre des sources de données très courantes comme les magasins de données traditionnels, la création de modèles alimentés par l'IA peut être une solution alternative qui peut être souhaitable dans de tels cas.
Les entreprises technologiques indiquent que la collecte de données est nécessaire pour l'entraînement de l'IA, tandis que le même processus est remis en question devant les tribunaux. À leur défense, OpenAI et Microsoft ont gagné une allégation concernant l'utilisation illégale de matériel protégé par le droit d'auteur. Cependant, ils ont affirmé que leurs actions relevaient du principe légal d'utilisation équitable. Ces dernières années, le nombre de demandes soumises au Bureau des droits d'auteur des États-Unis par les titulaires de droits d'auteur a dépassé les 10 000, ce qui montre clairement que la loi sur le droit d'auteur à l'ère de l'IA est unique et toute nouvelle. Par conséquent, les principaux acteurs font toujours face à des dangers liés à la violation de nombreuses œuvres sous le prétexte qu'il n'y a pas de finalités licenciées pour les modèles utilisant l'IA sur cette base.
L'impératif pour des ensembles de données massifs
Dans l'ensemble, le travail de Kaipan de Jared, scientifique de l'échelle, a été involontairement épique dans le développement de l'IA. Le contenu basé sur les données est l'un des composants de l'IA nécessaires au processus d'entraînement, mais il ne peut pas fonctionner correctement sans les modèles qui ont été bien entraînés et fonctionnent efficacement. Avec l'augmentation de la technologie d'intelligence artificielle, la demande de données pour réussir sur le marché s'élève à un taux élevé, laissant les entreprises avec des questions liées au droit, à l'éthique et à la vie privée. Par conséquent, les algorithmes d'intelligence artificielle doivent utiliser ces ensembles de données pour réussir sur le marché.
Le comportement de collecte de données des VIP est déformé pour les améliorations de IA ; le serment méthodologique typique est grossi. Qu'il s'agisse de l'une de leurs conférences YouTube ou de la création de données synthétiques génératives, ces entreprises sont des leaders en mission pour découvrir ce que sont véritablement les questions de droit, d'éthique et de vie privée.
Ils pourraient devenir une plaisanterie sur la mer plus tard. En raison de l'apparition des énormes ensembles de données nécessaires pour conduire le processus d'innovation, les dirigeants de la société sont tenus de participer activement à un dialogue constructif pour développer les règles et les normes dans lesquelles les efforts d'innovation sont équilibrés avec les principes éthiques des droits de propriété intellectuelle et de la vie privée.
Histoire originale de : https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

James Kinoti
Passionné de crypto, James prend plaisir à partager ses connaissances sur la fintech, la cryptomonnaie ainsi que la blockchain et les technologies de pointe. Les dernières innovations dans l'industrie crypto, les jeux cryptos, l'IA, la technologie blockchain et d'autres technologies occupent ses pensées. Sa mission : rester à la page des applications transformatrices dans divers secteurs.















