Réseau autoattentif à bruit statistique (RABS)


Définition

Une architecture de réseau de neurones génératif qui combine l'architecture d'un réseau autoattentif avec le processus itératif de suppression de bruit d'un modèle à bruit statistique.

Voir aussi réseau autoattentif pour la vision.

Compléments

L'emploi d'un réseau autoattentif bénéficie de l'apprentissage autosupervisé et de sa capacité à être traité en parallèle.


Alors que les modèles à bruit statistique traditionnels utilisent des réseaux convolutifs pour débruiter les données (comme Stable Diffusion ou DALL-E 2), le réseau autoattentif à bruit statistique remplace les blocs convolutifs par des blocs autoattentifs.

L'image ou la vidéo bruitée est découpée en tuiles. Puis, chaque tuile est aplatie et transformée en un vecteur sémantique compact. On y associe une information de position appelée encodage positionnel pour situer la tuile dans les données d'entrée. Ces vecteurs passent ensuite à travers plusieurs blocs d'autoattention multitêtes. Grâce au mécanisme d'attention, le modèle capture les dépendances à longue portée dans l'ensemble de l'espace latent, offrant une qualité de génération supérieures.


Le réseau autoattentif à bruit statistique n'est pas confiné au traitement et à la génération d'images. Il constitue le socle de beaucoup d'architectures multimodales pour la génération de vidéos comme Google Veo, Sora (aujourd'hui abandonné par OpenAI), Wan d'Alibaba, Kling de Kuaishou, ou Seedance de ByteDance. En étendant le découpage des tuiles 2D à la dimension temporelle (cubes spatio-temporels), il aide à la cohérence du mouvement au fil des images d'une vidéo. Le réseau autoattentif à bruit statistique sert aussi en génération audio et musicale. Enfin, il constitue une bonne base pour le traitement [[Modèle multimodal|multimodal] de textes, d'images, de vidéos et l'espace 3D dans le même espace latent.

Français

réseau autoattentif à bruit statistique

RABS

réseau autoattentif à diffusion

architecture autoattentive à bruit statistique

architecture autoattentive à diffusion

modèle autoattentif à bruit statistique

modèle autoattentif à diffusion

transformeur à diffusion

transformeur de diffusion

Anglais

Diffusion Transformer

DiT

Sources

Source: Statistique Canada

Towards Data Science - Self-Attention In Computer Vision

Contributeurs: Claude Coulombe