De près, sur un écran, on peut observer une image de deux plantes en pot, mais en prenant du recul ou en réduisant sa taille, elle révèle soudainement un panda roux. C’est ce même principe qui permet à une photo d’Albert Einstein de se transformer en un portrait de Marilyn Monroe, et à une image d’oiseau en noir et blanc de révéler une grenouille lorsqu’elle est colorisée.
Ces incroyables illusions d’optique ont été rendues possibles grâce à un algorithme de génération d’images à partir de texte en open source, DeepFloyd IF, développé par une équipe de chercheurs en informatique de l’université du Michigan, aux États-Unis. Ces images, qu’ils appellent « images hybrides », sont désormais disponibles en ligne accompagnées de résultats fascinants sur un site dédié.
Des Anagrammes Visuels et des Expériences Visuelles uniques
Leur méthode innovante fonctionne avec divers types d’illustrations, imitations artistiques, photos, et joue avec des effets visuels tels que le zoom, le passage du noir et blanc à la couleur, ou encore la simulation de flou cinétique. Certaines images peuvent contenir jusqu’à trois éléments distincts, offrant ainsi des expériences visuelles multiples et surprenantes.
Par ailleurs, l’équipe avait déjà développé un algorithme capable de créer des « anagrammes visuels » – des images qui représentent un objet sous un angle et se transforment en un autre objet lorsqu’on les fait pivoter.
Les Avancées en Traitement d’Images et de Langage Naturel
Les chercheurs se sont appuyés sur des techniques d’apprentissage automatique pour perfectionner leur méthode, notamment en exploitant la technique de diffusion utilisée par des outils comme Stable Diffusion ou DallE-2. Cette approche novatrice transforme progressivement des données aléatoires en images réalistes, tout en s’inspirant du processus artistique de sculpter une statue à partir d’un bloc de marbre.
Grâce à l’intégration de méthodes de traitement de langage naturel, l’algorithme de diffusion peut être entraîné sur des images annotées, permettant ainsi de traiter des descriptions détaillées et d’appliquer différents styles graphiques avec précision.
Le Pouvoir des Prompts Textuels pour Créer des Images uniques
Ce projet novateur repose sur l’utilisation simultanée de plusieurs instructions textuelles pour générer une seule image complexe. L’algorithme, une fois entraîné sur une base de données diversifiée, est capable de répondre à des directives spécifiques, même contradictoires, permettant ainsi de produire des créations visuelles surprenantes sans intervention humaine directe.
Le processus de débruitage orchestré par l’algorithme résulte d’un consensus entre des directives parfois opposées, démontrant ainsi l’incroyable potentiel de cette technologie pour créer des images uniques et fascinantes, associant des concepts visuels disparates de manière harmonieuse.