De petits modèles IA surpassent les plus grands en efficacité, révèle une étude de Google

- Les modèles d'IA plus petits surpassent les modèles plus grands dans la génération d'images, redéfinissant l'efficacité.
- En IA, plus grand n'est pas toujours meilleur : une étude de Google et de Johns Hopkins le démontre.
- Révolutionner l'IA : des modèles plus petits ouvrent la voie à une technologie accessible et efficace.
Parmi toutes les études qui ont essayé de systématiser le domaine de l'intelligence artificielle (IA) et qui ont lutté avec la question de savoir s'il existe un point où de petits modèles IA peuvent surpasser les plus grands en efficacité, l'étude de Google Research et de l'Université Johns Hopkins a enfin réfuté cet argument. Elle a montré que dans le contexte de la génération d'images, les petits modèles ont tendance à mieux performer que leurs homologues plus grands. Le 2 mai, l'étude dirigée par Kangfu Mei et Zhengzhong Tu a révélé les propriétés de mise à l'échelle des modèles de diffusion latente (LDM). Ils ont découvert que les changements dans la résolution de l'image de sortie n'apportent pas d'altérations significatives, cependant, l'augmentation de la taille du modèle peut conduire à des améliorations substantielles.
Repenser l'efficacité des modèles IA
Les études ont employé des LDM de 39 millions à 5 milliards de paramètres avec des variantes pour des tâches incluant la génération texte-image, la super-résolution et la super-résolution dirigée par le sujet, tandis que les participants ont suivi des processus d'entraînement et d'évaluation soigneusement pratiqués et évalués. Le fait prouvé que les petits modèles tiennent leur propre, même s'ils ne sont pas plus grands que ceux avec lesquels ils sont comparés, montre que lorsque le calcul est limité, les petits modèles peuvent même dépasser les plus grands.
Les explorations faites par cette étude se révèlent complexes. Le premier point digne d'intérêt est que les petits modèles sont performants et offrent la même ou une efficacité d'échantillonnage plus élevée à travers tous les types de diffuseurs, et même après que la distillation du modèle est effectuée.
Cette robustesse explique donc que l'échelle de puce des modèles inférieurs est intégrale à leurs mérites et n'est pas une conséquence directe d'un algorithme ou d'une méthode d'entraînement. Néanmoins, elle admet également que les plus grands modèles peuvent être utiles pour le même but, surtout dans les cas où les problèmes d'allocation de ressources (tels que la puissance de calcul) ne se posent pas, car ils peuvent créer des images avec de meilleurs détails.
Principales conclusions et implications
De telles découvertes ne sont pas seulement révolutionnaires pour l'espace technologique actuel, mais ont également des conséquences significatives pour le développement de l'IA. Elles jouent un rôle significatif en tant que guide pour le développement des systèmes IA, permettant une génération d'images plus accessible, puissante et respectueuse des ressources à des capacités élevées. Cela est particulièrement important à une époque où il y a un appel croissant pour le développement d'une intelligence artificielle ouverte et accessible, de manière à ce qu'elle soit apportée aux développeurs et, en fin de compte, aux utilisateurs.
Cela s'aligne sur une certaine tendance de la société IA qui prévaut actuellement et fournit des preuves de la supériorité des petits modèles comme LLaMa et Falcon par rapport aux autres dans diverses tâches.
La tendance à appliquer des codes open source, qui sont efficaces en termes de vitesse et d'économie d'énergie de l'appareil, va augmenter le niveau de démocratie dans le monde de l'IA en permettant au système de fonctionner sans exiger une sensibilité des systèmes informatiques avancés. Les ramifications de ce type d'étude sont plutôt stupéfiantes, ce qui pourrait conduire à un changement complet de la façon dont l'IA est appliquée aux technologies quotidiennes et rendre les solutions IA de haut niveau disponibles à un plus grand nombre d'utilisateurs.
Un changement de paradigme
Les études de recherche de Google Research et de l'Université Johns Hopkins ont maintenant créé un point critique dans le développement de l'IA, car elles remettent en question les approches actuelles de développement de l'IA et guident les praticiens à déployer des processus IA moins chers et respectueux de l'environnement.
La communauté IA se déplace vers le domaine de la recherche sur les modèles minuscules ; cette recherche ne résume pas seulement toute la compréhension actuelle de la perspective, mais fournit également de l'espace pour des innovations créatives concernant l'efficacité, la performance et la praticité de la création de systèmes IA.
Ce développement est donc non seulement un changement de paradigme dans le développement de la technologie de l'IA, mais aussi un mouvement de l'industrie vers l'inclusivité et l'accessibilité dans la technologie. Parmi les choses que la présence croissante de l'IA rend possibles, déployer des modèles sur une myriade d'appareils qui peuvent performer efficacement et précisément est l'une des rares choses qui peuvent donner à l'IA une portée d'applications beaucoup plus large une fois que ces choses seront sur le marché.
La nouveauté de cette étude entre en jeu par les propriétés de mise à l'échelle du modèle qui intègrent les compromis entre la taille du modèle et la performance, ce qui en fait une recherche novatrice à mener, promettant un avenir IA plus efficace et accessible.
Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

John Palmer
John Murangiri a rejoint Cryptopolitan avec des compétences en analyse de marché. John (alias JP) est diplômé de l'Université de Nairobi d'un baccalauréat en communication de masse et études médiatiques. Il a précédemment contribué à des analyses du marché crypto pour InsideBitcoins.com et Metacoingraph.















