DALL·E : le dernier-né d'OpenAI impressionne

OpenAI a développé, sur la base de son modèle GPT-3, un générateur d'images nommé DALL·E. Quelles en sont les caractéristiques ?

Publié par Clément Bohic le 6 janv. 2021 | Mis à jour le 8 janv. 2021 à 09:39

Lecture
3 min

Imprimer

Des résultats époustouflants. avec une méthode non optimisée. Dans la communauté du machine learning, on est partagé à propos de DALL·E.

Ce modèle génératif de type Transformer est le dernier-né d'OpenAI. Dérivé du modèle généraliste GPT-3, il doit son nom au robot WALL-E et à Salvador Dalí. Et pour cause : il crée des images à partir de texte, à la façon d'un moteur de rendu 3D pilotable en langage naturel.

À la base de DALL·E, il y a un important jeu de données d'entraînement : des centaines de millions d'images assorties de légendes. Le modèle peut travailler uniquement à partir de texte, mais il est possible de le guider avec des images. Il représente l'ensemble sous la forme de tableaux de jetons. En d'autres termes, de symboles comparables à ce que sont pour nous les lettres de l'alphabet. Chacun couvre une grille de 8 pixels par 8.

OpenAI a mis à l'épreuve cinq capacités en particulier :

Modifier les attributs et la quantité d'un objet
En gérer plusieurs
Les modéliser en perspective
Travailler leur structure interne et externe
Tenir compte du contexte spatiotemporel

Sur le premier point, on nous donne trois exemples de créations : une horloge verte pentagonale, un cube au revêtement « en porc-épic » et des verres sur une table.

DALL·E offre des résultats convaincants quand il s'agit d'associer des textures à des objets. C'est plus aléatoire quand il s'agit d'en modifier la forme (illustration pour un cadre photo heptagonal ou un panneau stop pentagonal). Les mots à plusieurs sens lui posent par ailleurs problème.

La gestion de multiples objets se complique vite, plus encore s'il existe entre eux des relations spatiales. L'exercice de l'empilement de cubes en témoigne. Sans qu'on puisse expliquer pleinement le comportement de DALL·E. Entre autres, pourquoi il a plus de mal à poser un gros objet sur un petit que l'inverse.

Sur la partie perspective, DALL·E démontre de solides capacités, qu'il s'agisse de générer un buste d'Homère ou un capybara en voxels assis dans un champ. Il prend généralement bien en compte les effets de lumière et les distorsions comme le fish-eye ou le panorama sphérique. C'est plus compliqué lorsqu'il s'agit de créer un reflet, sauf si le miroir se trouve au sol.

Résultats également convaincants sur la représentation des structures internes et externes. En tout cas pour ce qui est des noix et du corail-cerveau.
Concernant l'adaptation au contexte spatiotemporel, là encore, c'est la quantité d'informations à traiter qui pose problème. Par exemple quand on demande à DALL·E de créer une devanture de magasin et d'y apposer un long texte. Même si, de manière générale, le modèle sait adapter le style au support. sans toutefois gérer pleinement les tons d'une même couleur.

Comme GPT-3, DALL·E présente des capacités de raisonnement instantané, c'est-à-dire sans entraînement spécifique. OpenAI les illustre avec la reproduction d'une photo de chat sous la forme d'un croquis et l'ajout de caractères sur une image de théière.

Les capacités de raisonnement de DALL·E sont aussi, dans une certaine mesure, géométriques et géographiques. Ces dernières semblent les plus développées, sans être exemptes de stéréotypes (par exemple sur les thématiques nourriture et vie sauvage).

Illustration principale © artinspiring - Adobe Stock

sponsorisé

Gestion de crises : les leçons d’un DSI

Gestion de crises : les leçons d’un DSI17:35

SNCF Connect & Tech explore toutes les voies de la rés…23:13

D'une mine à la supply chain, de l'OT à l’industrie 4.…22:33

Champs d'application et exigences NIS220:52

Retour d'expérience : mise en œuvre des exigences par…20:42

Comment simplifier la sécurisation de votre réseau tou…20:23

Sécurité renforcée : comment préparer la conformité à…20:56

Le savoir-faire règlementaire international de Cloudfl…20:32

Se protéger et remédier aux Attaques de Messagerie : U…21:48

[Episode en public] Les leçons de résilience d’OVH29:04

[Énergie] La résilience du réseau et sa mesure d'impact19:43

SASE : La fusion du SD-WAN et du SSE décryptée07:42

Quand la cyber-résilience investit l’espace16:31

Sécurité Multicouche : La clé pour une entreprise rési…16:11

Remettre l’humain au centre du cyber-espace16:55

L’IA, super-pouvoir du cyberespace09:39

Les enjeux de sécurité des médias internationaux de la…14:32

L’IA, un atout pour une continuité de service public p…16:50

Une cyber-résilience à l’aune de l’IA et des régulatio…19:25

Tous les Internets se valent-ils ?10:59

Decathlon : une culture agile à l’international20:08

Comment Carrefour a transformé la crise sanitaire en t…12:48

Comment Groupama s’assure d’être résilient face aux cr…13:48

Comment impulser une culture data dans une grande entr…14:17

Hors-série : La data du futur (Volume 1)08:28

Cegid : la tête dans le Cloud22:16

Hors-série : La data du futur (Volume 2)07:30

La data au service des verres intelligents chez Essilo…09:42

La vision conseil de Deloitte sur la data et l’IA19:04

Data altruisme et IA responsable au Crédit Mutuel Arkéa11:54

[BONUS] La Data Responsable : une vision écologique23:08

Silicon.fr L'actualité informatique et high-tech pour décideurs IT

DALL·E : le dernier-né d'OpenAI impressionne

Avec o3 et o4-mini, OpenAI mise sur une chaîne de pensée multimodale

De France Travail à la RATP, les leçons du "bac à sable" IA de la CNIL

OpenAI met GPT-4.5 en retrait : que retenir de cette parenthèse ?

Gouvernance des communications : qui se distingue sur ce marché [...]

AWS Summit : le RAG, au carrefour des stratégies GenAI

S’abonner

FFTO : Fiber To The Office ou la haute disponibilité [...]

L'UHD et la Transformation Numérique : Répondre aux [...]

Le grand dîner de Gala de la Communauté

La Matinale Silicon - Zéro Trust

La MasterClass Silicon - NIS2

Silicon.fr L'actualité informatique et high-tech pour décideurs IT

S’abonner

Partager l'épisode