Large audio language model


Révision datée du 2 septembre 2026 à 11:56 par Arianne (discussion | contributions) (Page créée avec « == en construction == == Définition == '''Modèle multimodal''' qui enrichit les '''grands modèles de langues''' en leur ajoutant des capacités auditives, telles que la compréhension et la '''génération audio''', grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un ''LLM backbone''. Son '''entraînement''' se fait... »)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

en construction

Définition

Modèle multimodal qui enrichit les grands modèles de langues en leur ajoutant des capacités auditives, telles que la compréhension et la génération audio, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un LLM backbone. Son entraînement se fait avec de vastes corpus de paires audio-textes, couvrant souvent la parole, la musique et des scènes ambiantes.

Compléments

Ces modèles peuvent faire de nombreuses tâches, telles que: la reconnaissance automatique de la parole, le sous-titrage audio et le raisonnement audio complexe.

Français

XXXXXXXX

Anglais

large audio language model

LALM

Sources

Source : ACL Anthology

Source : Arxiv

Source : Emergent Mind

Contributeurs: Arianne Arel