« Réseau autoattentif à bruit statistique (RABS) » : différence entre les versions
m (Claude COULOMBE a déplacé la page Diffusion Transformer (DiT) vers Réseau autoattentif à bruit statistique (RABS)) |
Aucun résumé des modifications |
||
| (3 versions intermédiaires par le même utilisateur non affichées) | |||
| Ligne 11 : | Ligne 11 : | ||
L'image ou la vidéo bruitée est découpée en tuiles. Puis, chaque tuile est aplatie et transformée en un [[vecteur sémantique compact]]. On y associe une information de position appelée [[encodage positionnel]] pour situer la tuile dans les données d'entrée. Ces vecteurs passent ensuite à travers plusieurs blocs d'[[autoattention multitêtes]]. Grâce au mécanisme d'attention, le modèle capture les dépendances à longue portée dans l'ensemble de l'espace latent, offrant une qualité de génération supérieures. | L'image ou la vidéo bruitée est découpée en tuiles. Puis, chaque tuile est aplatie et transformée en un [[vecteur sémantique compact]]. On y associe une information de position appelée [[encodage positionnel]] pour situer la tuile dans les données d'entrée. Ces vecteurs passent ensuite à travers plusieurs blocs d'[[autoattention multitêtes]]. Grâce au mécanisme d'attention, le modèle capture les dépendances à longue portée dans l'ensemble de l'espace latent, offrant une qualité de génération supérieures. | ||
<hr/> | <hr/> | ||
Le réseau autoattentif à bruit statistique n'est pas confiné au traitement et à la génération d'images. Il constitue le socle de beaucoup [[Modèle multimodal|d'architectures multimodales]] pour la [[Génération texte-à-vidéo|génération de vidéos]] comme Google Veo, Sora (aujourd'hui abandonné par OpenAI), Wan d'Alibaba, Kling de Kuaishou, ou Seedance de ByteDance. En étendant le découpage des tuiles 2D à la dimension temporelle (cubes spatio-temporels), il aide à la cohérence du mouvement au fil des images d'une vidéo. Le réseau autoattentif à bruit statistique sert aussi en [[Génération automatique d'audio|génération audio]] et musicale. Enfin, il constitue une bonne base pour le traitement [[Modèle multimodal|multimodal] de textes, d'images, de vidéos et l'espace 3D dans le même [[espace latent]]. | Le réseau autoattentif à bruit statistique n'est pas confiné au traitement et à la génération d'images. Il constitue le socle de beaucoup [[Modèle multimodal|d'architectures multimodales]] pour la [[Génération texte-à-vidéo|génération de vidéos]] comme Google Veo, Sora (aujourd'hui abandonné par OpenAI), Wan d'Alibaba, Kling de Kuaishou, ou Seedance de ByteDance. En étendant le découpage des tuiles 2D à la dimension temporelle (cubes spatio-temporels), il aide à la cohérence du mouvement au fil des images d'une vidéo. Le réseau autoattentif à bruit statistique sert aussi en [[Génération automatique d'audio|génération audio]] et musicale. Enfin, il constitue une bonne base pour le traitement [[Modèle multimodal|multimodal]] de textes, d'images, de vidéos et l'espace 3D dans le même [[espace latent]]. | ||
==Français== | ==Français== | ||
'''réseau autoattentif à bruit statistique''' | '''réseau autoattentif à bruit statistique''' | ||
'''RABS''' | |||
'''réseau autoattentif à diffusion ''' | '''réseau autoattentif à diffusion ''' | ||
| Ligne 28 : | Ligne 30 : | ||
'''transformeur à diffusion''' | '''transformeur à diffusion''' | ||
==Anglais== | ==Anglais== | ||
| Ligne 39 : | Ligne 39 : | ||
==Sources== | ==Sources== | ||
[https://www. | [https://www.goenhance.ai/fr/image-models/z-image GoEnhance - transformeur de diffusion ] | ||
[https://thesis.dial.uclouvain.be/server/api/core/bitstreams/e61d0e6a-a9b1-479a-a9da-5b19bc8c8e43/content Université de Louvain - réseau autoattentif] | |||
[https:// | [https://arxiv.org/pdf/2212.09748 arXiv - Scalable Diffusion Models with Transformers | ||
- Diffusion Transformer] | |||
[[Catégorie:GRAND LEXIQUE FRANÇAIS]] | [[Catégorie:GRAND LEXIQUE FRANÇAIS]] | ||
[[Catégorie:Publication]] | [[Catégorie:Publication]] | ||
Dernière version du 24 septembre 2026 à 04:38
Définition
Une architecture de réseau de neurones génératif qui combine l'architecture d'un réseau autoattentif avec le processus itératif de suppression de bruit d'un modèle à bruit statistique.
Voir aussi réseau autoattentif pour la vision.
Compléments
L'emploi d'un réseau autoattentif bénéficie de l'apprentissage autosupervisé et de sa capacité à être traité en parallèle.
Alors que les modèles à bruit statistique traditionnels utilisent des réseaux convolutifs pour débruiter les données (comme Stable Diffusion ou DALL-E 2), le réseau autoattentif à bruit statistique remplace les blocs convolutifs par des blocs autoattentifs.
L'image ou la vidéo bruitée est découpée en tuiles. Puis, chaque tuile est aplatie et transformée en un vecteur sémantique compact. On y associe une information de position appelée encodage positionnel pour situer la tuile dans les données d'entrée. Ces vecteurs passent ensuite à travers plusieurs blocs d'autoattention multitêtes. Grâce au mécanisme d'attention, le modèle capture les dépendances à longue portée dans l'ensemble de l'espace latent, offrant une qualité de génération supérieures.
Le réseau autoattentif à bruit statistique n'est pas confiné au traitement et à la génération d'images. Il constitue le socle de beaucoup d'architectures multimodales pour la génération de vidéos comme Google Veo, Sora (aujourd'hui abandonné par OpenAI), Wan d'Alibaba, Kling de Kuaishou, ou Seedance de ByteDance. En étendant le découpage des tuiles 2D à la dimension temporelle (cubes spatio-temporels), il aide à la cohérence du mouvement au fil des images d'une vidéo. Le réseau autoattentif à bruit statistique sert aussi en génération audio et musicale. Enfin, il constitue une bonne base pour le traitement multimodal de textes, d'images, de vidéos et l'espace 3D dans le même espace latent.
Français
réseau autoattentif à bruit statistique
RABS
réseau autoattentif à diffusion
architecture autoattentive à bruit statistique
architecture autoattentive à diffusion
modèle autoattentif à bruit statistique
modèle autoattentif à diffusion
transformeur à diffusion
Anglais
Diffusion Transformer
DiT
Sources
GoEnhance - transformeur de diffusion
Université de Louvain - réseau autoattentif
[https://arxiv.org/pdf/2212.09748 arXiv - Scalable Diffusion Models with Transformers - Diffusion Transformer]
Contributeurs: Claude Coulombe





