« Réseau autoattentif pour la vision » : différence entre les versions
Aucun résumé des modifications |
Aucun résumé des modifications |
||
| Ligne 42 : | Ligne 42 : | ||
[[Catégorie:GRAND LEXIQUE FRANÇAIS]] | [[Catégorie:GRAND LEXIQUE FRANÇAIS]] | ||
[[Catégorie:Publication]] | |||
Dernière version du 24 septembre 2026 à 03:05
Définition
Une architecture de réseau de neurones basé sur un réseau autoattentif utilisé pour la vision artificielle.
Compléments
L'emploi d'un réseau autoattentif pour la vision artificielle bénéficie de l'apprentissage autosupervisé et de sa capacité à être traité en parallèle.
L'image d'entrée est découpée en une grille de tuiles carrées (par exemple, des tuiles de 16x16 pixels). Puis, chaque tuile est aplatie et transformée en un vecteur sémantique compact. On y associe une information de position appelée encodage positionnel pour situer la tuile dans l'image d'entrée. Ces vecteurs passent ensuite à travers plusieurs blocs d'autoattention multitêtes. Le réseau apprend ainsi l'importance des tuiles les unes par rapport aux autres pour analyser l'image. Par exemple, lier visuellement les yeux, le nez et la bouche d'une personne pour l'identifier.
Français
réseau autoattentif pour la vision
réseau autoattentif pour la vision artifielle
réseau autoattentif pour la vision par ordinateur
réseau neuronal autoattentif pour la vision artifielle
architecture autoattentive pour la vision
modèle autoattentif pour la vision
modèle de vision par transformeur
transformeur pour la vision
Anglais
vision transformer
ViT
self-attention network in vision
self-attention network in computer vision
Sources
Contributeurs: Claude Coulombe, wiki





