DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Ce modèle d'IA générative peut transformer l'industrie du jeu vidéo

ParShummas HumayunShummas Humayun 2 min de lecture
IA générative et jeu vidéo
  • Des chercheurs ont développé SyncDreamer, un outil d'IA innovant qui génère plusieurs vues 2D d'un objet à partir d'une seule image.
  • Cette nouvelle technique utilise un modèle de diffusion unique et fonctionne aussi bien avec des images photoréalistes qu'avec des dessins manuscrits.
  • Cette avancée promet des avantages significatifs pour les développeurs de jeux et les créateurs d'environnements virtuels en rationalisant le processus de conception 3D.

Dans le monde en évolution rapide de l'IA générative, le défi de créer des objets 3D à partir d'images 2D de manière cohérente a persisté. Cependant, des chercheurs de diverses universités ont annoncé une avancée significative : SyncDreamer. Cet outil d'IA générative innovant utilise un modèle de diffusion unique pour générer plusieurs perspectives 2D d'un objet à partir d'une seule image.

Comment l'IA générative SyncDreamer redéfinit la conception 3D

Les systèmes d'IA générative, notamment les modèles de diffusion comme Stable Diffusion, DALL-E et Midjourney, ont principalement été développés pour prédire l'apparence d'une image à mesure que du bruit est superposé. Ce processus, qui consiste à faire passer une image d'un état clair à un bruit complet puis à inverser le processus, permet à ces modèles de produire des images complexes à partir de motifs de bruit aléatoires. De plus, les modèles d'IA générative de type texte-vers-image générative AI ont étendu cette approche en apprenant à partir de milliards de paires image-description pour créer des images à partir d'indices textuels.

Cependant, l'obstacle de la cohérence multivue a entravé ces avancées. Malgré leur expertise, les modèles de diffusion trouvent difficile de prendre une image 2D et de représenter le même objet sous un nouvel angle.

Les tentatives antérieures pour combler cet écart reposaient sur la génération de modèles de diffusion pour des objets 3D – une tâche exigeant des volumes importants d'objets 3D étiquetés. Une autre stratégie incorporait des champs de radiance neurale (NeRF) qui peuvent générer des formes 3D à partir de photos 2D. Pourtant, cette technique nécessite des descriptions textuelles supplémentaires et la génération d'objets – un processus qui est non seulement intensif en calcul, mais qui exige également une intervention humaine significative.

Voici SyncDreamer. Plutôt que d'entreprendre la création directe d'une image 3D, SyncDreamer prend une image 2D et génère des angles 2D alternatifs du même sujet. Ces sorties peuvent ensuite être utilisées par des modèles comme NeRF pour former la représentation 3D.

Au cœur de la fonction de SyncDreamer se trouve sa conception visant à modéliser la distribution de probabilité partagée des images multivues. En employant plusieurs prédicteurs de bruit, SyncDreamer peut générer plusieurs images simultanément. Cette approche coordonnée assure la cohérence entre toutes les images générées.

Applications et praticité

Des représentations photoréalistes aux croquis à la main, SyncDreamer a montré son adaptabilité dans des tâches telles que la reconstruction de scènes ou les étapes de conception initiales. Les chercheurs ont souligné la capacité du système à générer des images qui sont non seulement sémantiquement alignées avec l'original, mais qui maintiennent également la cohérence multivue tant en couleur qu'en forme.

Un avantage notable de ce modèle d'IA générative réside dans sa collaboration avec d'autres modèles génératifs. En s'associant à des modèles de texte à image comme Stable Diffusion ou DALL-E, les designers peuvent produire et affiner rapidement des concepts. Ce processus cohérent, qui réduit la charge de travail des artistes 3D, offre des avantages substantiels pour le développement de jeux et la création d'environnements virtuels.

Derrière l'architecture de SyncDreamer

Un aperçu de l'architecture de SyncDreamer révèle son modèle de diffusion multifacette, qui aligne la génération de chaque vue. Le processus est construit autour du débruitage de l'entrée à l'aide d'un modèle UNet. Pour assurer la cohérence multivue, un module spécialisé assemble les caractéristiques des images et les mappe en 3D. Un réseau de neurones convolutif (CNN) tridimensionnel capture ensuite ces caractéristiques spatiales et les projette dans l'espace bidimensionnel. Cette conception complexe, qualifiée par les chercheurs de « UNet à attention de caractéristiques 3D », joue un rôle crucial dans le maintien de la précision et de la cohérence du modèle.

Le système a été perfectionné sur l'ensemble de données Objaverse, composé d'environ 800 000 objets et scènes 3D étiquetés. La vaste gamme de styles artistiques, des croquis aux peintures à l'encre, sur lesquels SyncDreamer a été testé souligne uniquement le potentiel expansif de l'IA générative dans les années à venir.

Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.

Partager cet article

Avertissement : Les informations fournies ne constituent pas des conseils de trading. Cryptopolitan.com décline toute responsabilité quant aux investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener des recherches indépendantes et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Shummas Humayun

Shummas Humayun

Shummas est une ancienne rédactrice technique spécialisée dans le contenu et une chercheuse.

PLUS D'ACTUALITÉS…