Défis et considérations dans la formation des grands modèles de langage (LLM)

- L'entraînement des LLM implique des défis liés aux données, au matériel et au juridique.
- Les LLM possèdent des capacités remarquables mais présentent également des limites.
- L'impact environnemental, les questions de droits d'auteur et les lois sur la vie privée façonnent le paysage des LLM.
La formation de grands modèles de langage (LLM) comme GPT-4, GPT-NeoX, PaLM, OPT et Macaw présente des défis formidables. Ces avancées en apprentissage automatique ont attiré une attention substantielle, avec le GPT-4 d’OpenAI sous les projecteurs. Le parcours de développement de tels modèles implique de surmonter des obstacles liés aux données, au matériel et aux aspects juridiques, nécessitant souvent les ressources de grandes organisations.
Révéler l’architecture des LLM
Les LLM, principalement construits sur des architectures de transformateurs avec potentiellement des milliards de paramètres, subissent un pré-entraînement à l’aide de données textuelles auto-supervisées. L’alignement des modèles avec les préférences humaines implique l’apprentissage par renforcement avec retour humain (RLHF). Ces modèles présentent des capacités remarquables dans diverses tâches comme la génération de contenu, la programmation, la traduction et la synthèse. Pourtant, des limites persistent. Roland Meertens, un scientifique en apprentissage automatique, souligne que bien que ChatGPT complète automatiquement le texte, ce n’est pas un moteur de connaissances.
Les LLM « hallucinent » occasionnellement ou inventent des faits, conduisant à des inexactitudes et des erreurs de raisonnement. OpenAI reconnaît ce phénomène et insiste sur une utilisation prudente dans des contextes à haut risque. Le protocole exact, tel que la révision humaine, l’ancrage contextuel ou l’évitement des applications critiques, devrait s’aligner sur des cas d’utilisation spécifiques.
**Les complexités de la formation des LLM**
La formation des LLM à partir de zéro implique un processus complexe. Les entités corporatives avec des données abondantes peuvent opter pour conserver la formation en interne. Cependant, cet effort demande des ressources significatives, le rendant réalisable pour les acteurs majeurs comme les géants de la technologie ou les domaines aux portées contraintes. L’accès aux données s’avère pivotal, mais obtenir l’accès à des ensembles de données étendus similaires à ceux de Google et Facebook est difficile. Des préoccupations éthiques entourent les sources de données publiques, exigeant un nettoyage minutieux en raison de contenu explicite.
Exigences en matériel et en calcul
La formation des LLM nécessite l’accès à du matériel haute performance et des accélérateurs spécialisés tels que les GPU ou les TPU. Les pannes de matériel pendant la formation sont courantes, nécessitant des redémarrages manuels ou automatiques. Les techniques de parallélisme partitionnent les modèles en segments s’adaptant à la mémoire des dispositifs, utilisant efficacement le calcul. Une bande passante de communication élevée est vitale pour le mouvement des données, augmentant les coûts de formation. La formation consomme un temps substantiel, et les coûts peuvent atteindre des millions de dollars.
Impact environnemental et efficacité énergétique
L’empreinte environnementale de la formation des LLM est substantielle, avec une consommation d’énergie estimée et des émissions de carbone atteignant des niveaux significatifs. Une efficacité matérielle améliorée aide à atténuer l’empreinte carbone. À mesure que le matériel évolue, l’efficacité énergétique s’améliore, incitant les praticiens à envisager des options plus vertes. Concevoir des logiciels avec la durabilité à l’esprit est crucial pour minimiser l’utilisation d’énergie.
Enjeux juridiques et questions de propriété intellectuelle
Les LLM soulèvent des préoccupations juridiques, notamment des litiges liés au droit d'auteur concernant l'entraînement sur des matériaux protégés. Les incertitudes juridiques dans ce domaine naissant rendent les modèles économiques et les règles ambigus. Des procès entourant l'utilisation de la propriété intellectuelle des données d'entraînement sont à l'horizon. Des entreprises comme OpenAI et Google pourraient faire face à des défis juridiques, avec des implications pour l'avenir de l'industrie.
Les lois sur la vie privée posent des défis supplémentaires, obligeant les applications LLM à se conformer à des réglementations telles que le RGPD, la California Consumer Privacy Act et d'autres. Garantir que les chatbots et les systèmes d'apprentissage automatique oublient les informations apprises reste un problème complexe, soumis à des interprétations évolutives de la législation existante.
Impact des mesures réglementaires
La réglementation est sur le point de façonner le paysage des LLM. Les exigences strictes de l'AI Act de l'UE concernant les modèles de base pourraient avoir des implications profondes, touchant à la fois les modèles propriétaires et open source. Les efforts de Sam Altman pour plaider en faveur de la réglementation de l'IA visent à établir un fossé législatif, potentiellement au profit des grandes entreprises par rapport aux acteurs plus petits.
Compte tenu de l'impact environnemental, des coûts, des complexités techniques et des préoccupations éthiques, opter pour des LLM open source existants ou des APIs commerciales est une stratégie prudente. Ces options offrent des alternatives viables à l'entreprise complexe de former un LLM à partir de zéro.
Former des LLM est une entreprise multifacette, exigeant des décisions stratégiques et une compréhension globale des considérations liées aux données, au matériel, à l'éthique, au juridique et à l'environnement. À mesure que le paysage évolue, les parties prenantes doivent peser les avantages par rapport aux complexités et prendre des choix éclairés qui s'alignent sur les objectifs et les valeurs de leurs organisations.
Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

John Palmer
John Murangiri a rejoint Cryptopolitan avec des compétences en analyse de marché. John (alias JP) est diplômé de l'Université de Nairobi d'un baccalauréat en communication de masse et études médiatiques. Il a précédemment contribué à des analyses du marché crypto pour InsideBitcoins.com et Metacoingraph.















