L'IA ne peut s'épanouir sans la connaissance humaine – La compensation des créateurs originaux est indispensable

- L'entraînement des modèles d'IA nécessite de vastes ensembles de données, et il est préférable qu'ils soient fondés sur des connaissances humaines.
- Les journaux et les organismes de recherche, ainsi que les portails web, consacrent leurs ressources à la collecte et à la publication d'informations.
- Une rémunération des créateurs originaux du contenu est indispensable, car les entreprises d'IA licencient désormais du contenu auprès de sociétés.
L'entraînement des modèles d'IA nécessite d'énormes ensembles de données, et leur capacité à produire de bons résultats dépend directement des données fournies au système. L'information n'est pas gratuite, et nous parlons ici de nombreux droits de propriété intellectuelle.
Mais les entreprises d'IA n'ont pas cette approche ; elles considèrent comme acquises toutes les connaissances produites par des générations d'écrivains ; leur concept d'utilisation équitable est également différent de celui perçu initialement ; et elles n'aiment pas payer les créateurs de contenu qui ont permis à leurs modèles d'atteindre leurs capacités actuelles.
Vol de la connaissance humaine
Il y a beaucoup de travail acharné et de sueur impliqués dans la production du contenu que nous voyons dans les journaux, les magazines, les livres, les archives en ligne et les articles de recherche, mais cela n'est pas possible sans les écrivains, les éditeurs, les chercheurs et les éditeurs qui ont rendu cela public sous différentes formes.
Une telle reconnaissance et une telle connaissance, acquises au prix de tant d'efforts, ne devraient pas être gratuites et exploitées par une entreprise, comme cela a été fait.
« L'information qui est publiquement disponible sur Internet. »
Source : OpenAI.
Oui, c'est ce que dit OpenAI lorsqu'on lui demande le contenu qu'il a utilisé pour entraîner ses systèmes d'IA, ainsi que les informations qu'il a licenciées auprès de tiers et les informations fournies par leurs utilisateurs et leurs entraîneurs humains.
En ce qui concerne le contenu licencié, les entreprises le recherchent désormais, mais nous ne disposons d'aucune information sur le fait qu'OpenAI ait licencié des informations auprès d'un fournisseur avant le lancement de son modèle GPT initial. Le modèle a dû être entraîné sur des matériaux protégés par le droit d'auteur qui n'étaient pas libres d'utilisation à des fins commerciales.

Compensation des créateurs originaux
Jusqu'à l'année dernière, la plupart des textes écrits en ligne ou hors ligne étaient le fruit d'un effort humain. Malgré les titres accrocheurs, du contenu de faible qualité était également mélangé, mais il était au moins créé par des humains qui comprenaient la psyché et le processus de pensée humains, et les applications d'IA générative ont été construites sur la base de telles informations.
Mais aujourd'hui, les entreprises font face à un nouveau problème pour l'entraînement de leurs modèles d'IA, à savoir la prédominance du contenu généré par la machine sur l'ensemble d'Internet, qui n'est en aucun cas considéré comme du contenu de qualité. Ce type de contenu pollue les ressources disponibles pour l'entraînement des modèles d'IA, car ils ne peuvent pas produire de résultats de qualité lorsqu'ils sont entraînés sur du verbiage inutile, ce qui est la façon habituelle dont ces modèles génèrent du contenu. L'IA qui génère du contenu à partir d'IA est un processus souvent appelé cannibalisme de l'IA ou clonage.
Pour empêcher cela de se produire, les entreprises d'IA doivent limiter leur matériel source aux sources crédibles uniquement, qui ne sont autres que les journaux, les magazines et les forums publics qui hébergent une richesse de connaissances produites par des humains. Quelques autres peuvent également être comptées, comme mentionné ci-dessus, mais cette nécessité et les poursuites judiciaires intentées par les journaux les ont forcées à licencier du contenu et à payer pour l'exploitation qu'elles effectuaient.
Des entreprises comme Reddit, qui est un grand forum public hébergé sur le web, envisagent également de licencier leur contenu aux entreprises d'IA. Dans une déclaration, elles ont indiqué préférer les accords commerciaux aux poursuites judiciaires, mais n'ont pas exclu les poursuites si les négociations commerciales échouent. Si vous n'êtes pas autorisé à inclure une bande-son protégée par le droit d'auteur dans votre vidéo YouTube, pourquoi une entreprise d'IA devrait-elle être autorisée à l'utiliser pour entraîner ses modèles à des fins commerciales ?
La propriété des droits d'auteur est un problème ici, car les entreprises d'IA continuent de les violer. D'un autre côté, l'IA n'est pas capable de rassembler de nouvelles informations par elle-même ; il faut un effort humain pour rassembler des nouvelles et les confirmer à partir de différentes sources avant de les publier. Ce n'est qu'alors qu'un modèle d'IA peut utiliser ces informations, et ne pas compenser la ressource humaine dans ce cas constitue une exploitation.
Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.
Avertissement : Les informations fournies ne constituent pas des conseils de trading. Cryptopolitan.com décline toute responsabilité quant aux investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener des recherches indépendantes et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Aamir Sheikh
Aamir est journaliste technologique avec près de six ans d'expérience dans les secteurs de la cryptomonnaie et de la technologie. Il est diplômé de l'université MAJ avec un MBA en finance et marketing. Il travaille désormais pour Cryptopolitan, où il rend compte des dernières évolutions des marchés de la cryptomonnaie et des prévisions de prix.
















